跳到主要内容
Wiki · 机制

搜索与AI可见性 / 搜索基础

robots.txt(爬虫规则文件)

向爬虫表达可访问路径范围的根目录文本文件,用于管理抓取,不等于阻止收录或保护私密内容。

Herewow Wiki机制说明

搜索与AI可见性 / 搜索基础

爬虫规则文件

robots.txt

机制说明

robots.txt(爬虫规则文件)是放在网站根目录的纯文本规则,用 User-agent、Allow 和 Disallow 向爬虫说明哪些路径可被访问。它主要用于管理抓取范围和服务器负荷;它不是 noindex、权限控制或保证搜索结果消失的工具。

机制输入

  • 站点的公开路径与发布规则
  • 目标爬虫及需要控制的低价值路径
  • Sitemap 与页面索引策略

可检查的输出

  • 可复核的爬虫访问范围
  • 与索引和发现策略相协调的发布规则
  1. 01

  2. 02

  3. 03

  4. 04

配置与检查

  • /robots.txt 可直接访问,位于正确根目录并使用 UTF-8 文本。
  • 规则只阻断明确的低价值路径,重要产品页、资源和必要脚本保持可访问。
  • 需 noindex 的页面不被 robots.txt 阻断,页面或响应头能被爬虫读取。
  • Sitemap 指向完整 URL,迁移后同步检查主机和目录范围。

失效信号

  • 把 Disallow 当成页面下架:URL 仍可能被外部链接发现,应改用 noindex、权限保护或删除。
  • 宽泛目录规则误拦 CSS、JavaScript 或产品页:会影响渲染与理解,应以真实 URL 样本回归测试。
  • 规则仅写在一个域名或协议上:不会自动覆盖其他主机,应逐个检查发布地址。

为什么需要这个概念

B2B 网站上线下载资料、站内搜索、预览页或后台路径时,团队需要先区分“减少无价值抓取”与“让页面不出现在搜索结果”,再将规则纳入发布和迁移检查。

robots.txt 管理爬虫访问,不负责页面下架

robots.txt 告诉搜索引擎爬虫可访问哪些 URL,主要用于避免无价值路径带来过多请求。它可限制某些页面、文件或目录的抓取,但并不是让公开网页从 Google 搜索结果中消失的机制。

参考:Google Search Central

若其他网站仍链接到被阻止的 URL,搜索系统可能在未访问页面内容的情况下发现并显示该地址。真正需要移除公开页面时,应使用可被爬虫读取的 noindex、密码保护或删除资源,而不是仅添加 Disallow。

参考:Google Search Central;Google Search Central

规则按主机、爬虫和路径匹配

文件必须命名为 robots.txt 并放在站点根目录;它只影响所在协议、主机与端口下的 URL,不会自动覆盖子域名或其他协议。未被 Disallow 指定的路径默认允许抓取。

参考:Google Crawling Infrastructure

  1. 先列出需要控制的真实路径,例如站内搜索结果、临时预览目录或不重要的重复筛选 URL。
  2. 以 User-agent 定义目标爬虫,再使用 Disallow 限制目录;必要时用 Allow 放开被宽泛规则覆盖的子路径。
  3. 使用完整 URL 的 Sitemap 指令声明发现清单,并保留 UTF-8 编码与清晰注释。

把抓取、索引和渲染放在一次检查里

robots.txt 只解决爬虫是否请求资源。若页面需要 noindex,爬虫必须先能访问页面并读取 meta robots 或 X-Robots-Tag;同时设置 Disallow 和 noindex 往往会让 noindex 无法生效。

参考:Google Search Central

  • 直接访问 /robots.txt,确认返回的是可解析的 UTF-8 文本而非重定向、登录页或 HTML 错误页。
  • 抽查重要产品页、图片脚本和 Sitemap 是否没有被误拦,页面渲染仍保留必要资源。
  • 在 Search Console 的 URL Inspection 与索引报告中复核实际抓取、索引和 noindex 读取状态。

迁移和模板更新后重新验证规则

目录改名、语言站拆分、CMS 插件切换或新建下载中心后,旧规则可能继续阻断新页面或失去目标。把 robots.txt 与 URL 路由、Sitemap 生成和页面索引策略放在同一发布清单中,才能发现这种错配。

参考:Google Crawling Infrastructure

robots.txt 的规则由爬虫自愿遵守,不是安全边界。任何不能公开的客户资料、报价或后台接口,应通过登录、权限和服务器配置保护,而不是依赖抓取规则。

参考:Google Search Central

项目场景

处理工业传感器站的站内搜索与资料预览路径

背景
站点开放型号搜索和资料预览,广告团队也会分享带参数的产品链接。
处理方式
团队只对不具备买家研究价值且会产生大量重复请求的路径设置抓取规则;需要从搜索结果移除的公开页面改用可被读取的 noindex 或权限控制。
可能结果
团队能避免把重要产品页、脚本资源或 noindex 页面一并阻断,并把抓取控制纳入发布复核。

这是用于说明判断路径的情境,并非项目结果或客户案例。

常见误解

Disallow 就等于 noindex。

Disallow 阻止抓取;页面若被阻止,爬虫也无法读取 noindex,URL 仍可能因外部链接被发现。

robots.txt 可以保护公开的报价和客户资料。

它不是权限控制,规则也未必被所有爬虫遵守;敏感资源应设置认证或移除公开访问。

所有看似重复的页面都应拦截。

先判断是否是买家需要的独立产品、语言或应用页;重要页面需要可访问的内容和内链,而非机械拦截。

还会被问到

robots.txt 可以阻止 AI 爬虫吗?

它能向支持该规则的爬虫表达访问偏好,但不是强制执行或安全控制。团队应先明确数据公开范围,再结合访问权限、服务条款和服务器防护评估。

要让 PDF 不出现在搜索结果中,应使用 robots.txt 吗?

若目标是移除搜索结果,应使用适合该资源的 X-Robots-Tag noindex 或权限控制,并确保爬虫能够读取该响应头;只禁止抓取并不可靠。

资料与方法边界

本页的定义、口径或方法均以可核验资料为依据;下列来源用于说明适用边界,不替代具体项目判断。

  1. 01
    Introduction to robots.txt

    Google Search Central · 核验于 2026年8月10日

  2. 02
    How to write and submit a robots.txt file

    Google Crawling Infrastructure · 核验于 2026年8月10日

  3. 03
    Block Search indexing with noindex

    Google Search Central · 核验于 2026年8月10日

继续阅读

当重要页面未被发现或出现索引异常时,先区分抓取规则、页面可访问性、canonical 和 noindex 信号。

使用收录诊断工具

相关概念