多数外贸网站的 robots.txt 问题不是语法拼错,而是团队先按目录写规则、后问页面要不要被搜索找到。于是同一条 URL 同时收到“别抓取”“别收录”“请放进 Sitemap”的矛盾信号。正确顺序是先判定这条地址承担什么买家任务,再分别处理抓取、收录和提交;这样误封产品页、资料页或询盘页时,才知道该查哪一层。
先把每条 URL 标成四种处置,而不是先写一条规则
- 需要自然搜索入口的产品、应用和资料页,应优先保持可抓取、可索引,并只把规范代表地址写进 Sitemap。
- 只帮助站内浏览的搜索结果和多数筛选组合,不能因为可访问就自动成为搜索代表页。
- 需要不出现在结果但仍可公开访问的页面,必须让爬虫有机会读取 noindex。
- 真正不应公开的账户、报价或私密资料,应使用登录、权限或删除路径;robots.txt 不是安全控制。
先分清:robots.txt 管抓取,不等于页面不会出现在搜索结果
robots.txt 管抓取,不等于页面不会出现在搜索结果。Google 对 robots.txt 的说明把它定位为爬虫访问控制:它可以减少对特定路径的取得,却不能承诺一个已被其他页面发现的地址从结果中消失。先把需求写成“减少无价值抓取”或“移出搜索结果”,开发和内容团队才不会对同一页面做相反的设置。
noindex 要先被爬虫读取才可能生效。对于仍可公开打开、但不适合成为搜索入口的页面,Google 的 noindex 规则要求把指令放在页面 meta 或 X-Robots-Tag 响应头中,并不要用 robots.txt 把它挡在外面。TimZhang 踢木桩也把这些可验证信号作为收录问题排查的起点;若团队已经看见 canonical、Sitemap 和 noindex 互相冲突,可先用收录基础诊断检查已有技术信号,再决定哪一个信号需要改。
robots.txt 先看来源根目录,再看规则是否命中实际 URL
robots.txt 要从实际来源根目录开始检查。RFC 9309规定了标准的 /robots.txt 取得路径与规则组语义;文件放错子目录、写在测试主机,或只验证了 www 主域,都不会替目标来源完成配置。最小结构并不复杂:先用 User-agent 声明规则对象,再用 Disallow 或 Allow 写路径,最后用完整的 Sitemap 地址指向应提交的清单。
同一品牌的不同协议、子域名和资源主机,不能默认共用一份规则
不同来源不能默认共用同一份 robots.txt。Google 对 robots 规范的解释明确了规则只作用于托管该文件的主机、协议和端口。外贸网站若同时有主站、博客、商城、语言子域或独立图片主机,应把每个实际来源列成单独一行;“主站文件已经存在”不是其他来源正常的证据。
不要从目录名猜结果:拿一条关键 URL 做规则与页面级双重检查
规则是否造成业务影响,要拿关键 URL 做双重检查。先在浏览器打开该来源的 /robots.txt,再抽取一个产品页、一个技术资料页和一个询盘页,确认它们的完整地址没有落入错误的 Disallow;随后用 Google 的单 URL 检查功能核对单个地址的访问与索引信息。目录名看起来像“search”或“private”并不够,因为路由、重写与参数可能让真正页面落在完全不同的路径上。
Sitemap 不是全站 URL 清单,只列你愿意出现在搜索中的代表页
Sitemap 是发现提示,不是收录保证。Google 对 Sitemap 的说明把它视为补充发现信息,而不是“提交即收录”的开关。提交后仍应核对页面能否访问、内容是否可索引、内部链接是否可到达;否则 XML 文件没有报错,也可能只是在稳定地提交一批不该被推荐的地址。
Sitemap 只列希望出现在搜索中的规范代表页。Google 的构建建议要求使用完整绝对 URL,并优先选定希望展示的代表地址。因此,noindex 页、重定向地址、临时追踪参数和无独立买家价值的筛选组合不应默认进入 sitemap.xml。先按 TimZhang SEO 方法先界定页面的搜索任务,再由 CMS 输出清单,能避免“数据库里有路由”被误当作“搜索中应被展示”。
产品页、站内搜索、筛选参数和登录页,不能用同一条 Disallow 处理
先判 URL 角色,再决定 robots、noindex、Sitemap 或访问控制。这个判断不是新的搜索引擎规则,而是把公开资料中的边界转成可执行的外贸网站动作:先问页面是否需要公开访问、是否承担买家搜索任务、是否必须让爬虫读取页面指令、是否是同组 URL 的规范代表页。四个答案不同,正确处置也不同。

| URL 角色 | 抓取与索引 | Sitemap | 优先动作 |
|---|---|---|---|
| 产品页、应用页、技术资料页 | 通常允许抓取并索引 | 放入规范代表 URL | 检查 canonical、正文证据和内部链接是否一致 |
| 站内搜索结果页 | 常见做法是可访问但不作为搜索入口;若用 noindex,不能先拦爬虫 | 通常不放 | 保留用户浏览功能,避免把结果页批量提交 |
| 筛选参数页 | 取决于是否真正回答独立的采购问题 | 仅保留有独立价值的规范组合 | 不要用一个目录级 Disallow 误伤有价值的分类页 |
| 登录、账户、私密报价页 | 不应依赖搜索控制保护内容 | 不放 | 使用真实登录、权限或移除公开路径 |
这张表的关键不是把所有参数页一律屏蔽,而是让每个例外都能被解释。假设一个筛选组合确实服务特定行业、材料或认证需求,并且页面有独立内容和稳定的规范地址,它可能应保留;反过来,产品页即使位于看似杂乱的目录,也不应因路径名称被整组封掉。TimZhang 踢木桩的网站方法也把技术可见性放回产品、资料和询盘任务中判断;需要落到页面清单的团队,可回到 B2B 询盘网站的方法判断页面是否值得被发现。
改版上线后按四步复核:文件、单页、URL 清单、Google 实际状态
Google 的单 URL 检查功能可核对关键页面是否可被访问。Google 的技术要求同时提醒:页面达到访问和技术资格,并不等于它会立刻被抓取、收录或获得排名。把它放在复核的最后一步,能避免团队只看后台保存成功,或把等待处理误判成规则仍未生效。
上线后先核实事实,再核实 Google 实际看到的版本。可按四步交接:第一步,打开每个来源根目录的 robots.txt,记录响应和最近修改;第二步,抽查关键 URL 的状态码、canonical、meta robots 或 X-Robots-Tag;第三步,从 sitemap.xml 随机取样,确认每条都是完整绝对 URL、可索引且与页面代表地址一致;第四步,用 Google 的单 URL 检查功能查看页面状态,必要时同步核对 robots.txt 文件。这样出现异常时,开发、内容和运营能分别判断是文件未上线、规则误命中、清单错选,还是仍在等待处理。
已经可抓取,仍未收录时,不要继续改 robots.txt
可抓取不等于值得索引,其他问题要转到对应信号排查。Google 的抓取错误排查建议把 robots.txt 放在长期限制抓取的场景,而不是让团队频繁改它来“重新分配抓取预算”。当关键 URL 已可访问,却仍显示重复、软 404、渲染异常或内容不足,应把工单转向页面状态、规范化、渲染资源和内容本身,而不是继续扩大 Allow 或缩小 Disallow。
把 URL 角色表交给技术、内容和销售,而不是只交一份 robots.txt
URL 角色表应同时交给技术、内容和销售。表格至少包含 URL 示例、页面目的、是否公开、抓取状态、索引指令、是否进入 Sitemap、负责人和验证日期;销售或内容负责人能指出哪类页面承担询盘前的证据任务,开发则能据此确认模板和服务器规则。它比一份孤立的 robots.txt 更能防止下次迁移或 CMS 更新重新制造同样的误封。
- 先挑出流量、询盘或资料下载最关键的 10 条 URL,避免从全站噪声开始。
- 为每条 URL 标明“应搜到、仅供访问、长期不抓取、必须登录”中的一种角色。
- 把规则、页面响应和 Sitemap 样本附在同一张表里,明确谁改、谁复核。
- 改版后只在状态有证据变化时关闭工单,不以“后台已保存”作为完成条件。
如果改版后仍无法解释关键产品、资料或询盘 URL 的状态,先准备 URL 清单、当前 robots.txt 地址、Sitemap 地址和单 URL 检查结果截图。TimZhang 踢木桩可据这些材料区分技术、内容与发布问题;需要外部复核时,可预约网站问题诊断,获取收录风险与修复顺序。
常见问题
robots.txt 里可以直接写 noindex 来禁止收录吗?
不可以把 robots.txt 中的 noindex 当作 Google 支持的禁止收录方式。想让一个仍可公开访问的页面退出结果,应在页面 meta 或 X-Robots-Tag 中提供 noindex,并确保爬虫没有被 robots.txt 拦住;否则爬虫读不到该指令,外部链接发现的 URL 仍可能留下结果痕迹。若内容本身不该公开,直接采用登录或权限控制更合适。完成修改后,还应抽查页面源代码或响应头,确认指令实际随页面上线,而不是只保存在 CMS 的编辑界面里。
重要产品页被 robots.txt 拦住后,删掉规则会不会马上恢复收录?
不会,解除抓取限制只让 Google 有机会重新访问页面,并不保证它会立刻抓取或收录。先确认目标页面返回正常状态码、没有 noindex、canonical 没有指向别处,且没有从 Sitemap 或内部链接中被遗漏;随后用 Google 的单 URL 检查功能请求或观察更新。若页面质量、重复关系或渲染仍有问题,单纯解除 Disallow 不会改变这些信号。对一批曾被误封的产品页,应按优先级分批复核,避免把个别恢复情况误当作整站已经修好。
Sitemap 中能放 noindex、重定向或筛选参数 URL 吗?
通常不应,Sitemap 应优先列出希望出现在搜索结果中的规范且可索引 URL。重定向地址与 noindex 页给出的目标和提交信号相反;带参数 URL 只有在它有稳定、独立的买家任务并被选作规范代表页时才可能保留。最实用的检查方法是从 Sitemap 抽样后逐条比对最终地址、canonical、页面指令和内容任务。若参数页只是排序、会话、广告追踪或短期筛选结果,应从清单中排除,并让团队记录生成该地址的来源,方便下次模板改动时复查。
