先给结论,省得你读完一篇才发现不值得做:
这话可能跟你在别处看到的不太一样。很多文章把 llms.txt 说成"AI 时代的 robots.txt", 这话目前不成立:robots.txt 是各家都遵守的既有标准,llms.txt 只是一个社区提案。
llms.txt 是放在网站根目录的一个 Markdown 文件(https://你的域名/llms.txt),
内容是这个站点的结构化摘要:一句话说明你是谁、有哪些主要内容、每块内容的链接。
面向的对象是"想快速理解这个站是什么"的读的人,理论上也包括大模型。
它 2024 年由 Jeremy Howard 等人提出,配套还有 llms-full.txt(把整站正文塞进一个文件)。
提案本身很清晰,问题在于:提案不等于被采用。
| 厂商 | 态度 |
|---|---|
| OpenAI | 未承诺支持 llms.txt,公开表示更倾向于正常抓取页面 |
| 明确表示不使用 llms.txt 做搜索或 AI 功能 | |
| Anthropic | 未承诺支持 |
| Meta | Meta-ExternalAgent 是目前少数会实际读取它的爬虫 |
那为什么还建议你写?三个理由,都很实在:
把它当成一份低成本保险,别当成 AI 可见性的主策略。主策略仍然是: 内容本身写得能被一句话摘出来、结构清晰、事实明确。
约定的结构是:H1 写站点名,紧接着一段引用块写"这个站是干嘛的", 然后若干小节,每节列出该主题下的关键页面链接。
# 你的站点名 > 一句话说明这个站是做什么的、服务谁。 > 再补一句它跟同类站有什么不一样。 ## 主要栏目 - [栏目一](https://你的域名/path/):这个栏目讲什么 - [栏目二](https://你的域名/path/):这个栏目讲什么 ## 常见问题 - [某个问题](https://你的域名/faq/):简短说明 ## 可选 - 如果哪些页面你不希望被引用,可以在这里写明。
几条经验:
llms-full.txt。/llms.txt 确认返回 200、内容是纯文本。决定 AI 会不会引用你的,从来不是这类文件,而是内容本身能不能被摘出来用: 有没有明确的数字、结论、对比;一段话能不能独立成立;别人引用你的时候,能不能一句话说清"他说了什么"。
如果一个页面读完还得让读者自己归纳,那就算 llms.txt 写得再漂亮,也没有人(和 AI)会引用它。