引言
每一篇关于AI爬虫的文章都会提醒你避免犯同样的错误。这些警告指出:你在2023年那场“抓取恐慌”中屏蔽了GPTBot,却意外地将那些用于在实时回答中引用网页内容的新型代理也一并拦截了。你本意是阻止训练用爬虫,却不知不觉间退出了推荐系统。
我们验证了这种情况是否真的存在。
在219个域名中,这种情况一次也没发生过。
并非偶有发生。并非仅在少数情况下。甚至一次都没有。
方法
我们选取了七大类别(SaaS、电商、金融、健康、旅游、家居和营销)中26个商业搜索查询的排名前二十的自然搜索结果,共涉及254个独立域名。2026年7月28日,我们为每个域名抓取了robots.txt文件,其中219个域名成功解析。其中7个域名根本未提供robots.txt文件,这被视为允许所有访问。
对于每个域名,我们使用标准优先级规则将每个 AI 用户代理与该文件进行匹配:最具体的匹配用户代理组优先,因此精确匹配的用户代理将覆盖 *。当某个域名的优先组禁止访问网站根目录,且没有更具体的允许规则时,该域名即被视为阻止了该用户代理。
共检查了12个用户代理,按其数据源类型进行分类。
| 代理 | 运营商 | 数据源 |
| GPTBot | OpenAI | 训练 |
| OAI-SearchBot | OpenAI | ChatGPT 搜索引用 |
| ClaudeBot | Anthropic | 训练 |
| Claude-SearchBot | Anthropic | Claude 搜索引用 |
| 困惑度机器人 | Perplexity | 答案 |
| DuckAssistBot | DuckDuckGo | 答案 |
| Amazonbot | 亚马逊 | 答案 |
| CCBot | Common Crawl | 许多模型所依赖的语料库 |
| Google-Extended | 用于Gemini训练,而非搜索 | |
| Applebot-Extended | Apple | 训练 |
| Bytespider | 字节跳动 | 培训 |
| 元外部代理 | Meta | 训练 |
结果
其中 77% 的域 名允许所有 AI 用户代理访问,23% 的域名至少屏蔽了一个用户代理。
| 代理 | 被阻止 | 明确命名该域的域名 |
| Bytespider | 20% | 45 |
| CCBot | 20% | 47 |
| ClaudeBot | 17% | 50 |
| Google-Extended | 16% | 46 |
| 元外部代理 | 16% | 38 |
| PerplexityBot | 15% | 44 |
| GPTBot | 14% | 53 |
| Applebot-Extended | 14% | 39 |
| Amazonbot | 13% | 39 |
| 克劳德-搜索机器人 | 10% | 22 |
| DuckAssistBot | 10% | 24 |
| OAI-SearchBot | 9% | 34 |
被封锁频率最低的用户代理是为 ChatGPT 检索引用页面而使用的。被封锁频率最高的用户代理则是用于抓取训练语料库的那些。
有效SEO的一体化平台
每个成功的企业背后都有一个强大的SEO活动。但是,有无数的优化工具和技术可供选择,很难知道从哪里开始。好了,不要再害怕了,因为我已经得到了可以帮助的东西。介绍一下Ranktracker有效的SEO一体化平台
这种排序并非偶然,这正是整个研究的核心发现。
没有人是在犯错。每个人都在做出决定
看看那两家同时运营训练爬虫和搜索爬虫的运营商。
| 同时阻止两者 | 阻止训练,允许搜索 | 阻止搜索,允许训练 | |
| OpenAI、GPTBot / OAI-SearchBot | 9% | 5% | 0% |
| Anthropic,ClaudeBot / Claude-SearchBot | 10% | 7% | 0% |
有 12 个域名会屏蔽 GPTBot,却有意允许 OAI-SearchBot 访问。另有 15 个域名对 Anthropic 采取了类似做法。这是一种连贯的政策:不要用我的内容进行训练,但可以引用我的内容。
没有人采取相反的做法。
另外两个数据也指向同一结论。在整个样本中,仅有四个域名使用“User-agent: *”这种通用的根级禁止规则,而且恰好只有一个域名在未明确指名任何AI代理的情况下,将某个AI代理屏蔽了。编辑这些文件的人清楚地知道哪些代理存在,以及它们各自的功能。
因此,行业警告针对的其实是一个在本样本中并不存在的问题。真正值得探讨的问题并非你是否无意中屏蔽了搜索代理,而是你是否有意为之。
因为其中 18% 的域名至少屏蔽了一个搜索爬虫,4% 的域名屏蔽了全部四个。这些网站已选择不出现在 AI 答案中,而根据现有证据,它们是故意这样做的。
今天就能解决问题的5种方法
-
将训练和搜索视为两个独立的问题。它们是不同的决策,市场已经将它们区分开来。大多数发布商希望获得后者,而不希望涉及前者。请按此方式编写文件,而不是将“AI爬虫”视为一个类别。
-
明确列出每个代理的名称。这里只有四个域名依赖通配符,且理由充分:仅使用“User-agent: * disallow”会拦截你在编写该规则时尚未存在的代理,也会拦截未来尚未出现的代理。在这些结果中被拦截次数最多的两个代理——Bytespider和meta-externalagent——其出现时间都晚于目前仍在流传的大多数robots.txt建议。
-
请按名称检查 OAI-SearchBot 和 Claude-SearchBot。这两个爬虫决定了您的内容能否被引用。样本中分别有 9% 和 10% 的网站屏蔽了它们。如果您属于这一类且并非有意为之,那么这就是需要修改的行,也是本列表中唯一会立即影响可见性的项目。
-
请每季度重新审核。过去一年中多次出现了新的爬虫。无论当时编写得多么仔细,十八个月前创建的文件都会遗漏某些条目。
-
请在边缘进行验证,而不仅仅依赖文件。您 CDN 上的机器人管理规则可能会屏蔽 robots.txt 明确允许的爬虫,而该文件对此不会提供任何提示。这就是即使 robots.txt 完美无缺仍可能存在的漏洞。
区分这两种决策的起点:
# 引用我。这些爬虫会抓取页面内容用于实时回答中的引用。
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
遇见Ranktracker有效SEO的一体化平台
每个成功的企业背后都有一个强大的SEO活动。但是,有无数的优化工具和技术可供选择,很难知道从哪里开始。好了,不要再害怕了,因为我已经得到了可以帮助的东西。介绍一下Ranktracker有效的SEO一体化平台
User-agent: DuckAssistBot
Allow: /
不要用我进行训练。若您不同意,请将这些规则改为 Allow。
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
这与本示例中已有 12 到 15 个域名采用的配置非常接近。这如今已是一种主流做法,而非什么高明之举。
为什么这些内容都没有出现在你已经运行的报告中
Search Console 报告的是 Googlebot,并未提及 OAI-SearchBot。Analytics 报告的是会话数,而一个从未引用过你的搜索引擎不会发送任何会话,因此也无从缺失。排名追踪工具报告的是排名位置,而你的排名位置并未受到上述任何因素的影响。
有效SEO的一体化平台
每个成功的企业背后都有一个强大的SEO活动。但是,有无数的优化工具和技术可供选择,很难知道从哪里开始。好了,不要再害怕了,因为我已经得到了可以帮助的东西。介绍一下Ranktracker有效的SEO一体化平台
有两种方法可以发现这个问题。一种是直接阅读该文件,这也是本研究采用的方法。另一种是利用AI 可见性检测工具从症状倒推:按计划向各搜索引擎提出与你所属类别相关的问题,并留意那些明确表示完全无法看到你的回答。
本研究背后的爬虫审计正是我们在 Honeyb 中运行的流程,它会按计划(而非一次性操作)将上述目录中的每个命名代理与网站的 robots 规则进行比对。访问权限是其检查的四项内容中的第一项。其余三项分别是:搜索引擎是否推荐你的网站、具体需要修改什么,以及生成并发布经过修改的内容。
值得说明的两点限制
本样本来自美国商业搜索结果页面(SERPs),因此倾向于涵盖大型出版商和知名品牌——这些主体既具备相关认知,又拥有法律建议,能够在此问题上做出深思熟虑的决策。如果以小型企业网站为样本,结果很可能截然不同,而“无意中被屏蔽”的情况在这些网站中很可能确实存在。我 们将在此之后进行相关测试。
此外,robots.txt 文件记录的是意图,而非强制执行。我们并未测试这些域名是否实际向每个爬虫提供内容——这取决于 CDN 规则,而文件与现实之间的差距往往正源于此。
本研究背后的平台位于honeyb.ai。

