Aivisnap · AI 可见性笔记

2026 年 AI 爬虫全清单:哪些必须放行,哪些可以不理

2026-09-24 · 读完约 8 分钟 · 与 Aivisnap 免费工具检测的 13 个爬虫一致

先说最重要的一件事:AI 爬虫不是一类东西,而是两类。把它们混在一起决定"放行还是屏蔽", 是最常见的错误——很多人想屏蔽 AI 训练,结果把自己从 AI 搜索结果里也一起删了。

检索型爬虫:用户提问时实时去抓页面,然后在答案里引用你、带上链接。它们能带来真实点击。
训练型爬虫:把页面抓走喂给模型训练。不直接带来流量,但决定 AI 会不会"记住"你。

这两类可以分开设置:放行检索型、屏蔽训练型,是完全合理的选择——但前提是你得分得清谁是谁。

检索型爬虫:建议全部放行

爬虫归属与用途挡掉的后果
OAI-SearchBot
OpenAI
为 ChatGPT 的联网搜索建立索引。决定你会不会出现在 ChatGPT 的答案里。 ChatGPT 搜不到你
ChatGPT-User
OpenAI
用户主动让 ChatGPT 打开某个页面时的抓取。 用户问到你时打不开
PerplexityBot
Perplexity
Perplexity 的检索与引用来源。 Perplexity 不引用你
Claude-SearchBot
Anthropic
Claude 的搜索索引。 Claude 答案里没有你
Claude-User
Anthropic
用户让 Claude 打开页面时。 同上
Googlebot
Google
传统搜索 + AI Overviews / AI Mode 的底层来源。 Google 流量归零
Bingbot
Microsoft
Bing 搜索 + Copilot 的检索后端。 Bing 与 Copilot 都丢
最多人踩的坑:想屏蔽 Gemini 的训练,却把 Googlebot 给屏蔽了。 这两者完全不同——Google-Extended 才管 Gemini 训练,Googlebot 管普通搜索排名。 屏蔽 Googlebot 会直接把你从 Google 搜索结果里删掉,跟 AI 没关系,是纯损失。

训练型爬虫:你自己决定

爬虫用途常见选择
GPTBot
OpenAI · 训练
抓取内容用于模型相关流程。按你是否愿意被训练决定
Google-Extended
Google · Gemini
Gemini 的训练与部分生成式用途。不影响 Google 排名。同上
Applebot-Extended
Apple
Apple 智能相关训练。同上
Meta-ExternalAgent
Meta
Meta 的 AI 抓取。目前少数会真正读取 llms.txt 的爬虫。多数人放行
CCBot
Common Crawl
公共语料库,很多模型的训练数据都来自它。想彻底不进训练集就挡
Bytespider
字节跳动
字节系 AI 训练抓取。视你对国内大模型的态度

这一类的取舍本质是:要不要让自己的内容参与模型训练。 挡掉它们不会影响你在 Google 或 ChatGPT 搜索里的排名——这一点各家的官方说明都写得很清楚。

robots.txt 怎么写才不会写错

规则其实只有三条,但几乎每条都有人搞反:

1. 最具体的 User-agent 组优先,跟先后顺序无关

很多人以为"写在后面的覆盖前面的",不是。爬虫只会匹配最具体的那一组: User-agent: GPTBotUser-agent: * 具体,所以前者胜出,跟谁写在前头没关系。

2. 规则长度相同时,Allow 胜出

按 RFC 9309,两条规则匹配长度一样,以 Allow 为准。 另外 Disallow: 后面什么都不写 = 放行,不是"禁止所有"。

3. 同一个爬虫只写一组

重复写 User-agent: GPTBot 并设置不同规则,只会生效其中一组。合并成一组再写。

可以直接复制的配置

# 检索型:全部放行(带来真实点击)
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# 训练型:想不被训练就把 Allow 改成 Disallow
User-agent: GPTBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: Meta-ExternalAgent
Allow: /

User-agent: CCBot
Allow: /

User-agent: Bytespider
Allow: /

# 传统搜索基线:必须放行
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

User-agent: *
Allow: /

Sitemap: https://你的域名/sitemap.xml
写完不等于生效。你的站如果在 Cloudflare 后面,CDN 那一层可能另有说法—— 参见 robots.txt 明明放行,AI 还是抓不到的三处原因

两个常被问到的问题

放行之后多久能被引用?没有准数。放行只是给了许可,抓不抓、什么时候抓由对方调度决定。 新站等几周很正常,别改完两天没动静就改回去。

屏蔽训练型爬虫,能保护内容吗?只能挡住守规矩的那一批。 robots.txt 是自愿协议,不守规矩的抓取器根本不看它。真要防得靠 WAF,不是靠这个文件。

想知道自己站上这 13 个爬虫现在是什么状态?
免费检测,30 秒出结果
读 robots.txt + 用真实爬虫 UA 实测一次,能看出 CDN 层有没有偷偷拦
AI 爬虫可达性检查 · Cloudflare 静默封锁 · AI 为什么不引用我 · English →
爬虫名单与用途以各厂商官方文档为准,本文按 2026-09 的情况整理