llms.txt生成与部署的9个常见错误自查清单
llms.txt 的结构很简单,但"简单"不等于"不会错"——我接触过的配置问题,翻来覆去 就那么 9 种,全部踩在规范与部署的细节上。这篇直接给你一份可以照着逐条打勾的 自查清单,配完对着过一遍,基本能排除 90% 的"配了没效果"。
错误1:文件放在子目录而非根目录
这是最常见的错误。llms.txt 必须放在网站根目录(与 index.html、robots.txt
同级),AI 只会在根路径找 /llms.txt。放错到 /assets、/public 之类
的子目录,等于根本没配。
自查:浏览器访问 https://你的域名/llms.txt,能直接
看到明文内容即通过。
错误2:格式不符合规范(缺 H1 / 区块混乱)
规范要求特定的结构顺序:H1 标题 → 引用块简介 → 可选描述 → H2 区块 → 链接列表。
常见错误是:第一行用 ## 起头、简介不用 > 引用块、
或者全文只有一堆链接没有标题。
自查:对照 格式规范详解 逐段核对。
错误3:链接写法错误(相对路径 / 锚点)
llms.txt 里的链接必须用完整绝对地址(https:// 开头)。写成相对路径
- [首页](/)、或者带 #锚点、带跟踪参数的链接,AI 都
无法正确解析。
自查:正则搜索文件里是否有不是 https:// 开头的链接行。
错误4:内容空洞,只有链接没有描述
规范的链接行是 [标题](URL) : 描述,描述是可选但强烈建议的部分。
你只写 URL 不给说明,AI 在短上下文里就只能靠猜,引用的概率大幅下降。
每条链接配一句话:"这页解决什么问题",成本低、收益直接。
错误5:与 robots.txt 相矛盾
llms.txt 推荐的页面,如果 robots.txt 里被 Disallow 了,AI 将无法抓取,推荐 全部白费。典型场景:换服务器后 robots 规则改严了,llms.txt 没同步。
自查:把 llms.txt 里每个 URL 对着 robots.txt 规则过一遍。 配合逻辑见 robots vs llms。
错误6:多语言站只配了主语言
你的站有中文、英文、德文等多语言版本,llms.txt 却只写了中文——那 AI 在回答 英语、德语用户问题时,就找不到你的多语言内容。参考 Anthropic 的做法( docs.anthropic.com/llms.txt,查询时间 2026-09-13):列出每种语言、页数和 路径,主语言给内容,其他语言给链接。
错误7:更新后没有重新验证(缓存)
改了文件、清了 CDN,以为万事大吉。结果浏览器缓存还停在旧版本,外部抓取也 拿到旧的。任何一次修改后都要:重新访问验证 200、确认编码、用无痕窗口或 curl 看最新内容。
错误8:把营销话术堆进 llms.txt
"行业第一""全网最强""立即抢购"这类话术写在网页上是宣传语,写在 llms.txt 里 就是噪音。AI 要的是事实性、可理解的描述,营销词会稀释信息密度,甚至 让解析器怀疑内容质量。简介和描述都用中性、准确的表达。
错误9:配完不管,内容与站点脱节
文件配好后半年不动,站点早已新增了核心栏目、删除了旧页面,llms.txt 里的链接 开始 404、简介早已过时。AI 抓到一个满屏死链的"推荐清单",很可能直接放弃 这个文件。
自查:每季度通读一遍,确认链接有效、简介准确、与站点现状一致。
可打印版自查清单
| # | 检查项 | 通过标准 |
|---|---|---|
| 1 | 位置 | /llms.txt 直接访问返回 200 |
| 2 | 结构 | H1 → 引用块 → 区块 → 链接 |
| 3 | 链接 | 全部 https:// 绝对地址 |
| 4 | 描述 | 核心链接均带一句话说明 |
| 5 | robots 一致性 | 推荐 URL 均未被 Disallow |
| 6 | 多语言 | 各语言版本均有入口 |
| 7 | 缓存 | 修改后已验证最新内容 |
| 8 | 语言风格 | 事实性描述,无营销堆砌 |
| 9 | 维护 | 季度检查,无死链、无过时简介 |
拿清单对照,用生成器生成规范版本
9 条全过,你的 llms.txt 就是合格线以上了。如果动手前想先看完整流程,复习 从创建到部署上线教程; 直接生成规范版本就走 llms.txt 生成器—— 填名称、描述、URL,自动按标准结构产出,肉眼可见少踩一半坑。