最近给公司开发一个新的网站和小程序,在研究搭建优化基础代码的时候,发现了llmstxt 这个东西。第一印象感觉像sitemap,像robots.txt,深入读取 https://llmstxt.org/ 之后发现确实有部分相似。
简而言之, llms.txt一个放在网站里的 Markdown 文件,告诉 Agent 重要的东西在哪些链接后面。它不像 robots.txt 那样管能不能抓,也不像 sitemap.xml 那样列全所有页面,它就是一份给 AI 看的内容清单。
今年规范更新到了 v2,几个变化值得注意:文件不只能放根目录,子路径也成;页面的 Markdown 版可以叫 page.md 也能叫 page.html.md;还多了 rel=alternate 和 rel=describedby 两个链接关系,让 Agent 不用猜就知道去哪找。
改造只要三步。
第一步,写 /llms.txt。 格式很简单:
# 站点名 > 一句话说明站点是做什么的。 ## Docs - [某页面](https://example.com/xxx.md): 这页有什么。
整份文件唯一必填的只有开头的标题,其余都可选。
第二步,给信息页面配一个 .md 版本。 同一个 URL,把扩展名换成 .md,或者后面加 .md 都行,无文件名就写 index.md。
第三步,告诉 Agent 怎么找。 能改页面就在
里加两个 link 标签,不想改页面就在服务器配一个 Link: 响应头,CDN 也能干这事。我给 Nginx 的写法:add_header Link "; rel=\"alternate\"; type=\"text/markdown\", ; rel=\"describedby\"";
写完用 curl 确认 200,再用官方的小工具 llms_txt2ctx 过一遍格式,最后拿 Claude 实测:只给它 llms.txt,看它能不能答对站里的问题。
几个坑:Optional 分区现在没有机械含义,只是惯例;任何注释都不要写进 H2 分区里,官方解析器会直接报错;别把后台和内部页面列进去;robots.txt 拦了 AI 爬虫的路径,llms.txt 里就不要再放。网上流行的 llms-full.txt、Key Facts 那些,都是社区实践,官方规范里没有。
我把官方文档整理成了一份操作手册,附带一个能直接填的模板,照着做就行:
官方规范原文在 llmstxt.org,有疑问以它为准。

