先说最重要的一件事:AI 爬虫不是一类东西,而是两类。把它们混在一起决定"放行还是屏蔽", 是最常见的错误——很多人想屏蔽 AI 训练,结果把自己从 AI 搜索结果里也一起删了。
这两类可以分开设置:放行检索型、屏蔽训练型,是完全合理的选择——但前提是你得分得清谁是谁。
| 爬虫 | 归属与用途 | 挡掉的后果 |
|---|---|---|
| OAI-SearchBot OpenAI |
为 ChatGPT 的联网搜索建立索引。决定你会不会出现在 ChatGPT 的答案里。 | ChatGPT 搜不到你 |
| ChatGPT-User OpenAI |
用户主动让 ChatGPT 打开某个页面时的抓取。 | 用户问到你时打不开 |
| PerplexityBot Perplexity |
Perplexity 的检索与引用来源。 | Perplexity 不引用你 |
| Claude-SearchBot Anthropic |
Claude 的搜索索引。 | Claude 答案里没有你 |
| Claude-User Anthropic |
用户让 Claude 打开页面时。 | 同上 |
| Googlebot Google |
传统搜索 + AI Overviews / AI Mode 的底层来源。 | Google 流量归零 |
| Bingbot Microsoft |
Bing 搜索 + Copilot 的检索后端。 | Bing 与 Copilot 都丢 |
Googlebot 给屏蔽了。
这两者完全不同——Google-Extended 才管 Gemini 训练,Googlebot 管普通搜索排名。
屏蔽 Googlebot 会直接把你从 Google 搜索结果里删掉,跟 AI 没关系,是纯损失。| 爬虫 | 用途 | 常见选择 |
|---|---|---|
| GPTBot OpenAI · 训练 | 抓取内容用于模型相关流程。 | 按你是否愿意被训练决定 |
| Google-Extended Google · Gemini | Gemini 的训练与部分生成式用途。不影响 Google 排名。 | 同上 |
| Applebot-Extended Apple | Apple 智能相关训练。 | 同上 |
| Meta-ExternalAgent Meta | Meta 的 AI 抓取。目前少数会真正读取 llms.txt 的爬虫。 | 多数人放行 |
| CCBot Common Crawl | 公共语料库,很多模型的训练数据都来自它。 | 想彻底不进训练集就挡 |
| Bytespider 字节跳动 | 字节系 AI 训练抓取。 | 视你对国内大模型的态度 |
这一类的取舍本质是:要不要让自己的内容参与模型训练。 挡掉它们不会影响你在 Google 或 ChatGPT 搜索里的排名——这一点各家的官方说明都写得很清楚。
规则其实只有三条,但几乎每条都有人搞反:
很多人以为"写在后面的覆盖前面的",不是。爬虫只会匹配最具体的那一组:
User-agent: GPTBot 比 User-agent: * 具体,所以前者胜出,跟谁写在前头没关系。
按 RFC 9309,两条规则匹配长度一样,以 Allow 为准。
另外 Disallow: 后面什么都不写 = 放行,不是"禁止所有"。
重复写 User-agent: GPTBot 并设置不同规则,只会生效其中一组。合并成一组再写。
# 检索型:全部放行(带来真实点击) User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / # 训练型:想不被训练就把 Allow 改成 Disallow User-agent: GPTBot Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: Meta-ExternalAgent Allow: / User-agent: CCBot Allow: / User-agent: Bytespider Allow: / # 传统搜索基线:必须放行 User-agent: Googlebot Allow: / User-agent: Bingbot Allow: / User-agent: * Allow: / Sitemap: https://你的域名/sitemap.xml
放行之后多久能被引用?没有准数。放行只是给了许可,抓不抓、什么时候抓由对方调度决定。 新站等几周很正常,别改完两天没动静就改回去。
屏蔽训练型爬虫,能保护内容吗?只能挡住守规矩的那一批。 robots.txt 是自愿协议,不守规矩的抓取器根本不看它。真要防得靠 WAF,不是靠这个文件。