llms.txt 的 AI 爬虫许可条款:允许抓取与禁止爬虫怎么声明
很多站长配 llms.txt 时有个疑问:文件本身就是给 AI 看的,那"哪些 AI 爬虫能来、 哪些不能来"到底由谁说了算?答案是 robots.txt + llms.txt 各管一段。 这篇文章讲清 AI 爬虫许可的完整声明方式:robots.txt 负责"禁止谁",llms.txt 负责 "向谁推荐内容",两者配合才是完整的许可体系。配置工具直接用 llms.txt 生成器 和 robots.txt 生成器。
先分清楚两个文件的职责
robots.txt 是针对所有爬虫(包括搜索引擎和 AI 爬虫)的访问规则; llms.txt 是"内容推荐清单",它自己并不执行爬虫禁令——AI 爬虫该不该抓、抓哪里, 仍然由 robots.txt 和爬虫自身的条款决定。这也是一直以来的结论: llms.txt 和 robots.txt 有什么区别 里详细对比过,这里只讲许可怎么落地。
主流 AI 爬虫的 User-Agent 清单
要在 robots.txt 里精确控制 AI 爬虫,先要知道各家的 User-Agent(均以其公开文档为准, 查询时间 2026-09-13):
| 爬虫 | User-Agent(常用值) | 主要用途 |
|---|---|---|
| GPTBot | GPTBot / OAI-SearchBot | OpenAI 训练与搜索抓取 |
| ClaudeBot | ClaudeBot / Claude-Web | Anthropic 训练与检索 |
| PerplexityBot | PerplexityBot | Perplexity 实时搜索 |
| Google-Extended | Google-Extended | Google 的 AI 使用控制 |
| Bytespider | Bytespider | 字节跳动系爬虫 |
允许抓取的推荐写法
如果你希望所有 AI 爬虫都能访问,最省心的方式是不在 robots.txt 里做任何 AI 相关的 特殊限制(默认允许),同时在 llms.txt 里把高价值页面推荐出去。下面是一段"选择开放"的 写法示例:
# robots.txt User-agent: GPTBot Allow: / Disallow: /private/ User-agent: PerplexityBot Allow: / User-agent: Google-Extended Allow: /
注意:Allow: / 只是声明许可,最终是否抓取仍由各家爬虫策略决定,
但明确声明是有助于被纳入抓取队列的。
禁止某个 AI 爬虫的写法
不想让某家 AI 使用你的内容(例如不想被用于训练),在 robots.txt 里 Disallow 对应 User-Agent 即可,并把禁令同步到 llms.txt 的区块处理思路里(llms.txt 不写 Disallow, 但可以不在推荐列表里引导该用途内容):
# robots.txt User-agent: GPTBot Disallow: / User-agent: OAI-SearchBot Disallow: /
设置后建议用 curl 或浏览器模拟对应 UA 验证 404/拒绝效果,一般 24-48 小时生效。 想把这套"文件配合"体系配得更完整,可参考 llms.txt 常见错误自查清单。
llms.txt 里需要声明许可吗?
规范文件(llmstxt.org,查询时间 2026-09-13)本身并没有"许可区"字段,绝大多数已上线 站点也没有在 llms.txt 里写许可声明。如果你的确想注明,可以在文件末尾加一个区块:
## 使用许可 - 本文件的链接与描述允许 AI 检索器使用 - 全文抓取请遵守 robots.txt 中对应爬虫的规则
这是社区通行做法而非规范必选项,加不加都不影响格式合规。
严格模式:哪些页面不想让 AI 碰
除了 robots.txt,还有两个手段:一是受保护页面要求登录,AI 爬虫无凭证自然抓不到;
二是把敏感路径(如 /private/、/admin/)在 robots.txt 里
Disallow,同时保证它们不出现在 llms.txt 链接列表里。记住:
出现在 llms.txt 里的链接等于"欢迎来读",敏感页面绝不能出现在推荐清单中。
实践建议:先查许可文档再动手
配置 AI 爬虫许可前,最重要的一步是查各家的官方爬虫文档: 同一家公司的爬虫也可能分"训练用"和"搜索用"两类 User-Agent, 规则写法不同(各家公开文档,查询时间 2026-09-13)。 把你要允许/禁止的爬虫全部列出来,一条条核对后再写进 robots.txt。
另外注意:robots.txt 的修改生效有延迟,且不同爬虫的抓取频率不同。 上线后建议隔几天复查一次日志,确认实际抓取行为与声明一致, 而不是写完就不管。若发现某爬虫仍在高频抓取你已声明禁止的路径, 再考虑升级为访问鉴权等更强手段。
最后提醒:llms.txt 推荐清单里的每个链接,仍然要让 robots.txt 生成器生成的规则 放行对应爬虫,否则"推荐了却抓不到"的尴尬情况会持续存在。
小结
AI 爬虫许可的正确姿势是:robots.txt 管禁令,llms.txt 管推荐,两者文件都要规范。 用 robots 生成器做规则,用 llms.txt 生成器做清单,最后用品牌可见度工具验证结果。 现在就配:→ 一键生成 llms.txt 推荐清单 |→ 同时配好 robots.txt 爬虫规则。