AI 搜索发现
用于发现网页并为搜索型答案提供候选来源,例如 OAI-SearchBot、Claude-SearchBot 和 PerplexityBot。屏蔽后可能减少相应产品发现页面的机会。
AI Crawler Guide
ChatGPT、Claude、Perplexity 和 Google 使用的控制标识并非同一种用途。先决定网站希望开放搜索、用户读取还是训练抓取,再写规则,比一股脑全部允许或全部屏蔽更可靠。
这份指南关注网站所有者可以公开验证的配置。爬虫被允许访问,只代表 robots.txt 没有阻止它,不代表页面一定会被抓取、引用、推荐或用于任何特定产品。
用于发现网页并为搜索型答案提供候选来源,例如 OAI-SearchBot、Claude-SearchBot 和 PerplexityBot。屏蔽后可能减少相应产品发现页面的机会。
用户在产品里粘贴链接或要求读取网页时,服务可能以专用标识代取页面。这类访问与后台建立搜索索引或批量训练抓取不同。
GPTBot、ClaudeBot 和 Google-Extended 等标识用于表达对模型改进或相关数据使用的选择。可以与搜索规则分别配置。
OAI-AdsBot 用于 ChatGPT 广告系统验证落地页。它不属于 Google AdSense,也不决定普通页面能否出现在 AI 搜索回答中。
厂商可能调整产品与爬虫说明。上线前应再次查看对应官方文档,不能只依赖旧博客或未经维护的名单。
| 标识 | 厂商 | 主要用途 | 配置时的关键点 |
|---|---|---|---|
OAI-SearchBot | OpenAI | ChatGPT 搜索发现 | 与 GPTBot 分开控制;允许不保证收录或引用。 |
GPTBot | OpenAI | 模型训练相关抓取控制 | 不希望训练抓取时可单独 Disallow,不必连带屏蔽搜索。 |
OAI-AdsBot | OpenAI | 广告落地页验证 | 仅与 ChatGPT 广告页面检查相关。 |
Claude-SearchBot | Anthropic | Claude 搜索 | 用于改善搜索结果质量,与 ClaudeBot 分开。 |
Claude-User | Anthropic | 用户发起的网页访问 | 可能在用户主动要求读取页面时出现。 |
ClaudeBot | Anthropic | 模型训练相关抓取控制 | 可独立设置允许或禁止。 |
PerplexityBot | Perplexity | 搜索索引 | 官方同时公布 IP 范围,robots.txt 仍是公开偏好信号。 |
Googlebot | Google 搜索抓取 | 控制普通搜索抓取,规则会直接影响搜索发现能力。 | |
Google-Extended | 部分 Gemini 训练与 Grounding 使用控制 | 它是 robots.txt 产品令牌,不是独立 HTTP User-Agent;官方说明不影响 Google 搜索排名。 |
模板要放在站点根目录的 /robots.txt。以下示例只表达抓取偏好,不构成访问控制;敏感内容仍应使用认证和服务器权限保护。
适合希望内容可能出现在 AI 搜索答案中,但不希望被相应训练爬虫抓取的网站。
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
适合文档、博客和公开工具站。先用通用规则关闭后台与临时目录,再允许其余公开页面。
User-agent: *
Disallow: /admin/
Disallow: /account/
Disallow: /preview/
Allow: /
Sitemap: https://example.com/sitemap.xml
robots.txt 是自愿遵守的爬取规则,不能阻止恶意访问者。后台必须继续使用登录、授权、网络限制和正确的缓存头。
当公开文章可被发现,但某类生成页、搜索结果页或参数页不适合抓取时,应限制具体路径,避免误伤整个站点。
User-agent: OAI-SearchBot
Disallow: /internal-search/
Disallow: /generated-preview/
Allow: /
User-agent: Claude-SearchBot
Disallow: /internal-search/
Disallow: /generated-preview/
Allow: /
X-Robots-Tag 仍可能要求搜索系统不索引页面。llms.txt 是社区提出的文本格式,可帮助愿意读取它的系统了解站点重点,但没有证据表明所有主流 AI 搜索都要求它。它不能代替可抓取 HTML、robots.txt、sitemap.xml 或 canonical。
文章、FAQ、软件工具等 Schema.org 标记能减少机器理解页面类型时的歧义,但虚构评分、评价、作者或日期可能适得其反。只标记页面真实展示且持续维护的信息。
抓取权限只是入口。内容是否被发现、保留或引用,还受页面质量、原创性、时效性、来源可信度、用户问题与各产品内部系统影响。本站不提供所谓 GEO 分数或收录保证。
不等于。OpenAI 和 Anthropic 提供了用途不同的标识,可以允许搜索发现,同时单独禁止 GPTBot 或 ClaudeBot 等训练相关抓取。
Google 官方说明它不会影响网页是否进入 Google 搜索,也不会影响搜索排名;Googlebot 才是普通网页搜索抓取的主要控制标识。
没有这样的保证。它目前是社区提案,最多作为补充入口;站点仍应优先保证公开页面可访问、内容可靠、内部链接清楚,并正确设置 robots.txt、站点地图和 canonical。
可能是 WAF、CDN、地区限制、登录要求、证书错误或服务器超时。robots.txt 只描述抓取偏好,不能证明网络请求一定成功。
作者与维护:iphelp站长工具箱站长 核对方式:公网实测与官方资料 最后核对:2026年8月21日
本文依据公开协议、官方文档与本站实时检测结果维护。发现结果差异时,请通过反馈表单提供页面、现象与复现时间。