AI Crawler Guide

AI 爬虫与 robots.txt 配置指南

ChatGPT、Claude、Perplexity 和 Google 使用的控制标识并非同一种用途。先决定网站希望开放搜索、用户读取还是训练抓取,再写规则,比一股脑全部允许或全部屏蔽更可靠。

核心原则 按用途分别控制 搜索、用户请求、训练不是一件事。

这份指南关注网站所有者可以公开验证的配置。爬虫被允许访问,只代表 robots.txt 没有阻止它,不代表页面一定会被抓取、引用、推荐或用于任何特定产品。

先分清四类访问目的

AI 搜索发现

用于发现网页并为搜索型答案提供候选来源,例如 OAI-SearchBot、Claude-SearchBot 和 PerplexityBot。屏蔽后可能减少相应产品发现页面的机会。

用户发起的读取

用户在产品里粘贴链接或要求读取网页时,服务可能以专用标识代取页面。这类访问与后台建立搜索索引或批量训练抓取不同。

模型训练控制

GPTBot、ClaudeBot 和 Google-Extended 等标识用于表达对模型改进或相关数据使用的选择。可以与搜索规则分别配置。

广告落地页验证

OAI-AdsBot 用于 ChatGPT 广告系统验证落地页。它不属于 Google AdSense,也不决定普通页面能否出现在 AI 搜索回答中。

常见控制标识对照

厂商可能调整产品与爬虫说明。上线前应再次查看对应官方文档,不能只依赖旧博客或未经维护的名单。

标识厂商主要用途配置时的关键点
OAI-SearchBotOpenAIChatGPT 搜索发现与 GPTBot 分开控制;允许不保证收录或引用。
GPTBotOpenAI模型训练相关抓取控制不希望训练抓取时可单独 Disallow,不必连带屏蔽搜索。
OAI-AdsBotOpenAI广告落地页验证仅与 ChatGPT 广告页面检查相关。
Claude-SearchBotAnthropicClaude 搜索用于改善搜索结果质量,与 ClaudeBot 分开。
Claude-UserAnthropic用户发起的网页访问可能在用户主动要求读取页面时出现。
ClaudeBotAnthropic模型训练相关抓取控制可独立设置允许或禁止。
PerplexityBotPerplexity搜索索引官方同时公布 IP 范围,robots.txt 仍是公开偏好信号。
GooglebotGoogleGoogle 搜索抓取控制普通搜索抓取,规则会直接影响搜索发现能力。
Google-ExtendedGoogle部分 Gemini 训练与 Grounding 使用控制它是 robots.txt 产品令牌,不是独立 HTTP User-Agent;官方说明不影响 Google 搜索排名。

三个实用 robots.txt 模板

模板要放在站点根目录的 /robots.txt。以下示例只表达抓取偏好,不构成访问控制;敏感内容仍应使用认证和服务器权限保护。

方案一:允许搜索发现,拒绝训练抓取

适合希望内容可能出现在 AI 搜索答案中,但不希望被相应训练爬虫抓取的网站。

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

方案二:公开内容全部允许,后台统一禁止

适合文档、博客和公开工具站。先用通用规则关闭后台与临时目录,再允许其余公开页面。

User-agent: *
Disallow: /admin/
Disallow: /account/
Disallow: /preview/
Allow: /

Sitemap: https://example.com/sitemap.xml

robots.txt 是自愿遵守的爬取规则,不能阻止恶意访问者。后台必须继续使用登录、授权、网络限制和正确的缓存头。

方案三:只屏蔽特定路径

当公开文章可被发现,但某类生成页、搜索结果页或参数页不适合抓取时,应限制具体路径,避免误伤整个站点。

User-agent: OAI-SearchBot
Disallow: /internal-search/
Disallow: /generated-preview/
Allow: /

User-agent: Claude-SearchBot
Disallow: /internal-search/
Disallow: /generated-preview/
Allow: /

上线前后的验证清单

  1. 确认 robots.txt 可公开访问。请求应返回 200 和纯文本内容,不能先跳到登录页、验证码或通用 HTML 首页。
  2. 逐个标识计算最终规则。同一爬虫可能同时匹配专用组和通配组,应按 robots.txt 的匹配规则判断,而不是只搜索一行文字。
  3. 检查页面级 noindex。即使 robots.txt 允许,HTML 的 robots meta 或 HTTP X-Robots-Tag 仍可能要求搜索系统不索引页面。
  4. 保证规范地址一致。canonical、站点地图和内部链接应指向可访问的最终 URL,避免把爬虫送进多段重定向或软 404。
  5. 提供可理解的正文。标题、摘要、H1、正文层级、发布日期和作者信息比重复关键词更有价值;结构化数据必须与可见内容一致。
  6. 修改后重新检测。使用AI 搜索可见性检测读取线上版本,同时用HTTP 检测确认 robots.txt 与页面没有异常跳转。

llms.txt、结构化数据与“AI SEO”

llms.txt 目前不是通用收录标准

llms.txt 是社区提出的文本格式,可帮助愿意读取它的系统了解站点重点,但没有证据表明所有主流 AI 搜索都要求它。它不能代替可抓取 HTML、robots.txt、sitemap.xml 或 canonical。

结构化数据要与页面事实一致

文章、FAQ、软件工具等 Schema.org 标记能减少机器理解页面类型时的歧义,但虚构评分、评价、作者或日期可能适得其反。只标记页面真实展示且持续维护的信息。

没有设置能保证被引用

抓取权限只是入口。内容是否被发现、保留或引用,还受页面质量、原创性、时效性、来源可信度、用户问题与各产品内部系统影响。本站不提供所谓 GEO 分数或收录保证。

官方资料

常见问题

允许 AI 搜索是否等于允许训练?

不等于。OpenAI 和 Anthropic 提供了用途不同的标识,可以允许搜索发现,同时单独禁止 GPTBot 或 ClaudeBot 等训练相关抓取。

Google-Extended 会不会影响 Google 搜索排名?

Google 官方说明它不会影响网页是否进入 Google 搜索,也不会影响搜索排名;Googlebot 才是普通网页搜索抓取的主要控制标识。

添加 llms.txt 能提高 AI 搜索排名吗?

没有这样的保证。它目前是社区提案,最多作为补充入口;站点仍应优先保证公开页面可访问、内容可靠、内部链接清楚,并正确设置 robots.txt、站点地图和 canonical。

为什么 robots.txt 允许,工具仍无法读取页面?

可能是 WAF、CDN、地区限制、登录要求、证书错误或服务器超时。robots.txt 只描述抓取偏好,不能证明网络请求一定成功。

作者与维护

作者与维护: 核对方式:公网实测与官方资料 最后核对:2026年8月21日

本文依据公开协议、官方文档与本站实时检测结果维护。发现结果差异时,请通过反馈表单提供页面、现象与复现时间。