llms.txt生成与部署的9个常见错误自查清单

2026-09-13 ·

llms.txt 的结构很简单,但"简单"不等于"不会错"——我接触过的配置问题,翻来覆去 就那么 9 种,全部踩在规范与部署的细节上。这篇直接给你一份可以照着逐条打勾的 自查清单,配完对着过一遍,基本能排除 90% 的"配了没效果"。

错误1:文件放在子目录而非根目录

这是最常见的错误。llms.txt 必须放在网站根目录(与 index.html、robots.txt 同级),AI 只会在根路径找 /llms.txt。放错到 /assets、/public 之类 的子目录,等于根本没配。

自查:浏览器访问 https://你的域名/llms.txt,能直接 看到明文内容即通过。

错误2:格式不符合规范(缺 H1 / 区块混乱)

规范要求特定的结构顺序:H1 标题 → 引用块简介 → 可选描述 → H2 区块 → 链接列表。 常见错误是:第一行用 ## 起头、简介不用 > 引用块、 或者全文只有一堆链接没有标题。

自查:对照 格式规范详解 逐段核对。

错误3:链接写法错误(相对路径 / 锚点)

llms.txt 里的链接必须用完整绝对地址(https:// 开头)。写成相对路径 - [首页](/)、或者带 #锚点、带跟踪参数的链接,AI 都 无法正确解析。

自查:正则搜索文件里是否有不是 https:// 开头的链接行。

错误4:内容空洞,只有链接没有描述

规范的链接行是 [标题](URL) : 描述,描述是可选但强烈建议的部分。 你只写 URL 不给说明,AI 在短上下文里就只能靠猜,引用的概率大幅下降。 每条链接配一句话:"这页解决什么问题",成本低、收益直接。

错误5:与 robots.txt 相矛盾

llms.txt 推荐的页面,如果 robots.txt 里被 Disallow 了,AI 将无法抓取,推荐 全部白费。典型场景:换服务器后 robots 规则改严了,llms.txt 没同步。

自查:把 llms.txt 里每个 URL 对着 robots.txt 规则过一遍。 配合逻辑见 robots vs llms

错误6:多语言站只配了主语言

你的站有中文、英文、德文等多语言版本,llms.txt 却只写了中文——那 AI 在回答 英语、德语用户问题时,就找不到你的多语言内容。参考 Anthropic 的做法( docs.anthropic.com/llms.txt,查询时间 2026-09-13):列出每种语言、页数和 路径,主语言给内容,其他语言给链接。

错误7:更新后没有重新验证(缓存)

改了文件、清了 CDN,以为万事大吉。结果浏览器缓存还停在旧版本,外部抓取也 拿到旧的。任何一次修改后都要:重新访问验证 200、确认编码、用无痕窗口或 curl 看最新内容。

错误8:把营销话术堆进 llms.txt

"行业第一""全网最强""立即抢购"这类话术写在网页上是宣传语,写在 llms.txt 里 就是噪音。AI 要的是事实性、可理解的描述,营销词会稀释信息密度,甚至 让解析器怀疑内容质量。简介和描述都用中性、准确的表达。

错误9:配完不管,内容与站点脱节

文件配好后半年不动,站点早已新增了核心栏目、删除了旧页面,llms.txt 里的链接 开始 404、简介早已过时。AI 抓到一个满屏死链的"推荐清单",很可能直接放弃 这个文件。

自查:每季度通读一遍,确认链接有效、简介准确、与站点现状一致。

可打印版自查清单

#检查项通过标准
1位置/llms.txt 直接访问返回 200
2结构H1 → 引用块 → 区块 → 链接
3链接全部 https:// 绝对地址
4描述核心链接均带一句话说明
5robots 一致性推荐 URL 均未被 Disallow
6多语言各语言版本均有入口
7缓存修改后已验证最新内容
8语言风格事实性描述,无营销堆砌
9维护季度检查,无死链、无过时简介

拿清单对照,用生成器生成规范版本

9 条全过,你的 llms.txt 就是合格线以上了。如果动手前想先看完整流程,复习 从创建到部署上线教程; 直接生成规范版本就走 llms.txt 生成器—— 填名称、描述、URL,自动按标准结构产出,肉眼可见少踩一半坑。