TL;DR
- llms.txt 文件是您网站根目录下的一个单一 Markdown 文件(
/llms.txt),它为 AI 代理提供了您最重要页面的精心策划的地图,而不是强迫它们解析完整的 HTML 导航、广告和脚本。 - 文件中唯一必需的部分是 H1 标题。 块引用摘要、可选的正文段落以及 Markdown 链接的 H2 部分都是可选的,但根据规范建议使用。
llms-full.txt是一个单独的配套文件,它将您整个网站的文本编译成一个 Markdown 文档 —— 这是 Mintlify 与 Anthropic 开发的一个约定,后来成为官方提案的一部分,来自 Mintlify 托管文档的数据表明,代理请求该文件的频率是llms.txt的两倍以上。- 手动创建一个文件需要四个步骤:清点您的关键页面、撰写 H1 和摘要、在 H2 标题下分组链接,并将文件发布在您的根目录。 对于页面数量超过几十个的网站,手动生成
llms-full.txt不再实际。 - 谷歌已明确表示,llms.txt 不会影响搜索排名。 谷歌自己的生成式 AI 指导说,网站不需要新的机器可读文件才能出现在 AI 搜索结果中,谷歌的约翰·穆勒直接表示,llms.txt “不是为搜索而做的。”
- 不过,Chrome Lighthouse 现在确实会检查 llms.txt,只是并不是为了 SEO。 在 Lighthouse 13.3 中新增的“代理浏览”(Agentic Browsing)实验分类会验证 llms.txt 的存在和格式,连同 WebMCP 注释和布局稳定性,将该文件框架视为代理兼容性信号,而非排名因素。
- 几个文档平台自动生成该文件,包括 Mintlify、GitBook 以及静态网站插件如
vitepress-plugin-llms和docusaurus-plugin-llms,因此在手动编写之前请检查您的平台。
什么是 llms.txt 文件?
llms.txt 文件是一个单独的 Markdown 文件,理想情况下放置在 yoursite.com/llms.txt,它为 AI 代理和语言模型提供了网站最重要页面的精心策划的地图,而不是强迫它们解析完整的 HTML 导航、广告和脚本。llmstxt.org 的规范说明准确描述了该格式:这是一个 Markdown 文件,提供给代理“背景信息、指导以及指向详细 Markdown 文件的链接”,而不是原始的 HTML 树。
这个文件的存在是因为 AI 代理和语言模型访问网站的效率远低于人类使用鼠标浏览。一个需要定价页面或 API 参考的模型必须获取完整的 HTML,剥离导航栏、饼干横幅和嵌入的脚本,并猜测哪些链接实际上是重要的——这种工作可以通过精心策划的 Markdown 索引在一次请求中消除。该文件与任何单一框架或托管提供商无关:任何能够将文件添加到网络服务器文档根目录的人都可以发布一个,无论该网站是使用静态网站生成器、自定义 CMS 还是手工服务器运行的。
本指南还引用了一些进一步的阅读,值得同时收藏:关于AI 代理框架的概述,这些框架消费 llms.txt,并对2026 年 AI 代理基础设施的发展方向的更广泛探讨。
为什么您的网站需要一个 llms.txt 文件
文档网站、开发者工具以及任何期望被 AI 编程代理或聊天机器人查找的产品最需要 llms.txt 文件,因为这些正是希望快速回答特定技术问题的受众。一些被客户面向的 AI 助手引用的支持门户,一个其 README 被粘贴到编程代理中的开源项目,以及一个与 LLM 集成的 API 的 SaaS 产品都符合这种模式。内容丰富的营销网站,技术细节独特性较少,从文件中获得的益处较少,因为本来就没有值得整合的结构化参考材料。
实际好处体现在两个方面:支持 llms.txt 的代理在加载网站时花费了更少的时间和更少的代币,以找到人类通常会收藏的相同少量页面,团队获得了一个单一的、版本化的文件,他们可以有意更新,而不是希望通用的爬虫从完整的网站地图中挑选正确的页面。
如何创建 llms.txt:三种方法
三种方法几乎涵盖了每个网站,正确的方法取决于您的内容已经如何结构化。手动编写 llms.txt 对于小型网站和单页面项目效果很好,开发人员可以在十五分钟内列出每个重要页面——这是 llmstxt.org 上的 FastHTML 示例所展示的方法。如果您的文档已经在 Mintlify、GitBook 或维护插件的静态网站生成器上运行,则平台自动生成是最低成本的选择(vitepress-plugin-llms 和 docusaurus-plugin-llms 涵盖了两个最常见的静态网站生成器),因为平台会在您文档更改时重新生成文件。爬取您自己的网站最适合没有支持插件的大型网站——营销网站、自定义 CMS,或跨多个子域的文档——在这些情况中,手动将数十或数百个页面复制到 Markdown 中是不现实的。
快速浏览
为一个有数百个页面的网站构建 llms-full.txt 意味着需要将每个页面转换为干净的 Markdown——Nstproxy Crawl 可以在每个页面的一次 API 调用中完成该转换,包含对那些无法通过普通 HTTP 获取工作的页面的 JavaScript 渲染。
针对爬取方法,Nstproxy Crawl——作为一个专门的 AI 网络爬虫 API 发布——专门用于将一系列 URL 转换为 llms.txt 链接和 llms-full.txt 的完整文本转储所需的干净 Markdown。这是一个 REST API,可以获取页面,渲染页面所需的任何 JavaScript,并在一次调用中返回清理后的 Markdown 或 HTML,并具有站点级爬取模式,在明确的 maxDepth 和 maxPages 限制下遍历一个域,而不是随意进入您从未打算包括的分页或登录页面。这个有限的站点级爬取就是这里重要的部分:它为您提供了 llms-full.txt 的原材料,而无需手动复制每个页面,您可以完全控制哪些页面实际进入精心整理的 llms.txt 链接。
- 带有明确边界的站点级爬取——设置
maxDepth、maxPages并包含/排除 URL 规则,以便针对您的文档子域的爬取不会拉入您的营销博客或帐户登录页面。 - 每个页面的干净 Markdown 输出——每个爬取的页面都会返回准备粘贴到
llms-full.txt中的 Markdown,而无需手动剥离导航和样板 HTML。 - 包括 JavaScript 渲染——使用客户端框架构建的页面在转换之前完全渲染,因此您不会在任何加载内容后才呈现的页面上留下空壳。
开始之前您需要的
创建 llms.txt 文件需要对您的 Web 服务器文档根目录的写入权限(或通过您的托管平台、CMS 或静态网站生成器的公共目录添加静态文件的能力),因为该文件必须可以通过 yoursite.com/llms.txt 访问才能发挥任何作用。您还需要一个值得包括的页面清单——大多数团队可以凭记忆列出他们的前 10 到 30 个页面,但完整文本 llms-full.txt 文件从您的网站地图或 CMS 中提取的完整列表中受益。手动编写文件不需要特殊软件,只需要一个普通文本编辑器;而爬取方法额外需要您使用的爬取服务的 API 密钥。
准备您的工具和工作区
首先决定上述三种方法中哪一种适合您的网站,因为这个选择将决定其余的设置。如果您的文档平台已经支持自动生成,检查其设置中是否有“llms.txt”或“AI 可读文档”的开关,然后再手动执行任何操作——Mintlify、GitBook 和几个 CMS SEO 插件(如 Yoast SEO 和 AIOSEO)在无需额外安装的情况下即可启用此功能。如果您是手动编写文件,则只需要一个支持 Markdown 的文本编辑器,其他无需任何设置。如果您要爬取现有网站以构建 llms-full.txt,请安装您爬取服务的 SDK(例如,npm install @nstdata-ai/crawl 或相应的 Python 包),并保持您的 API 密钥不在任何您计划提交到公共存储库的文件中。
第一步:清点您最重要的页面
列出每个代理或开发者在尝试理解或使用您的网站时实际想要的页面,而不是列出所有存在的页面。对于文档网站,这通常意味着您的快速入门指南、API参考、核心概念页面和一些示例;对于产品网站,这意味着您的定价页面、关键特性页面以及任何面向开发者的文档。省略分页列表、登录页面和法律模板 — 文件的重点是策划,而包含低价值页面的列表会违背这一目的。
第2步:编写H1标题和摘要
打开文件,使用单个H1标题命名您的网站或项目 — 这是规范实际上要求的唯一部分。紧接着是一个引用块(以>开头的一行),用一到两句话总结项目是什么以及面向谁,因为这是代理在决定是否访问任何链接之前阅读的第一也是唯一的上下文。
# 您的项目名称 > 您的项目是一个[描述其功能及目标受众的简短描述]。
第3步:按H2类别对链接进行分组
将您列出的页面按H2标题分组,例如## 文档、## 示例和## API参考,然后将每个页面列出为带有简短说明的markdown链接。规范将## 可选部分视为代理在需要较短上下文时可以跳过的次要链接,因此将任何确实不重要的内容放在那里,而不是混入主要部分。
## 文档 - [快速入门](https://yoursite.com/docs/quickstart.md):在五分钟内运行一个工作示例。 - [API参考](https://yoursite.com/docs/api.md):完整的端点、参数和响应字段列表。 ## 可选 - [变更日志](https://yoursite.com/changelog.md):版本历史,提供上下文但使用产品时不是必需的。
第4步:添加llms-full.txt以获取完整文本(可选)
如果您希望代理能够在一次请求中加载您整个文档,可以将关键页面的完整文本编译到第二个文件/llms-full.txt中。该约定源于真实的、文档化的来源,而不是非正式的做法:Mintlify 对格式历史的陈述 表示它在正式的llms.txt提案之前与Anthropic共同开发了完整文本文件,并报告说,访问其托管文档的代理请求llms-full.txt的频率是策划的llms.txt的两倍以上。对于小型网站,生成它可能意味着手动连接每个页面的Markdown源。对于较大的网站,可以在自己域名上运行一个有界的站点级爬取,将每个返回的页面转换为Markdown,并按llms.txt链接出现的相同顺序连接结果,以确保两个文件在逻辑上保持一致。
第5步:验证并发布您的文件
在发布之前,根据规范的结构规则检查您的文件:存在H1,如果包含的话有一个引用块摘要,以及每个列表项格式为正确的markdown链接而不是裸露的URL。然后将llms.txt(如果创建了的话,还有llms-full.txt)上传到您网站的文档根目录,以便它们可以在yoursite.com/llms.txt和yoursite.com/llms-full.txt解决。如果您的网站从不同的子路径提供不同的部分 — 例如,有一个具有自己范围的/docs子目录 — 规范允许该子路径下的更具体的llms.txt优先于根文件。
第6步:使用真实的AI代理进行测试
只给AI代理或聊天机器人您的llms.txt文件作为起点,并问它真实访问者可能会问的问题,然后检查它是否可以根据您提供的链接和描述正确回答。如果它始终跟随错误的链接或询问您的文件应涵盖的信息,那表明您的描述过于模糊或缺少重要页面 — 将此视为正常的编辑过程,而不是一次性检查,因为该文件需要与任何其他文档一样的维护。
完整的llms.txt格式及示例
一个完整的、符合规范的llms.txt文件遵循以下结构,按此顺序:
# 项目名称 > 项目的简短一或两句话摘要。 可选的额外上下文段落,补充摘要中未包含的内容。 ## 文档 - [页面标题](https://example.com/page.md):关于该页面的可选单行说明。 ## 示例 - [示例标题](https://example.com/example.md):可选的单行说明。 ## 可选 - [次要资源](https://example.com/secondary.md):可选的单行说明。
只需 H1,其他内容是可选的
只需 H1;其他内容——引用、正文段落和 H2 部分——是可选的,但可以提高代理对文件的有效性。请注意,并非每个实际的实现都严格遵循此规则:Anthropic 自己的平台文档 llms.txt 文件 完全跳过 H1 和引用,直接进入 H2 类别与 Markdown 链接,因此将完整规范视为目标,而不是每个代理都强制执行的硬性要求。
llms.txt 无法做到的:SEO 和其他限制
llms.txt 不会影响 Google 搜索排名,而 Google 也明确表示这一点,不留下模糊性。Google 的生成 AI 优化指南指出,网站无需新的机器可读文件、AI 文本文件或 Markdown 即可出现在生成 AI 搜索结果中,Google 的约翰·穆勒在 2026 年 1 月在 Bluesky 上表示 llms.txt “不是为了搜索而做”——在 Google 运营的网站上存在此文件也并不代表对这一格式的认可。
这并不意味着文件毫无意义,但确实意味着收益与许多以 SEO 为中心的解释所暗示的不同。Chrome Lighthouse 在 Lighthouse 13.3 中添加了一个实验性的“代理浏览”(Agentic Browsing)审计类别,检查 llms.txt 是否存在,并根据规范的建议(H1 头部、足够的长度和包含的链接)进行验证,同时检查 WebMCP 工具注释、无障碍树结构和布局稳定性。这是一种关于网站如何与 AI 代理特定合作的信号,与搜索可见性无关。
另一个真实的限制是采用和执行:没有单一的权威机构验证任何给定的 AI 代理是否实际读取或尊重您的 llms.txt 文件,因此发布一个文件是一种风险,取决于访问您网站的代理是否支持这一惯例,而不是特定结果的保证。将其视为代理面向用例的补充基础设施,而不是替代您现有的 sitemap.xml 或 robots.txt,它们继续以往的方式为搜索引擎和常规爬虫服务。如果本指南中的某些术语不熟悉,Nstproxy 的 网页数据和 AI 代理术语词汇表 详细介绍了与爬虫、渲染和结构化提取相关的概念。
结论
创建 llms.txt 文件就是撰写一个必需的 H1,一个可选但推荐的摘要和一组分类链接,并将结果发布到您网站的根目录——对于小型网站来说,这项任务手动完成只需几分钟,而大型网站则可以从限制爬取中受益。它不会影响您的搜索排名,因为 Google 已明确表示它不会,但它确实为 AI 代理提供了一种更快、更可靠的方式来理解您的网站,而 Chrome Lighthouse 现在将其视为判断网站代理友好程度的一部分。发布该文件,针对真实代理进行测试,并按照您对待任何其他文档的相同时间表定期检查。
常见问题解答
问:我应该将 llms.txt 文件上传到哪里?
将其上传到您网站的文档根目录,以便在 yoursite.com/llms.txt 处解析;您还可以在像 /docs/llms.txt 这样的子路径下发布一个更具体的版本,这在该路径下的 URL 中优先于根文件。
问:我需要同时使用 llms.txt 和 llms-full.txt 吗?
不——单独的 llms.txt 就是一个完整的、符合规范的文件,但添加 llms-full.txt 允许代理在单个请求中加载您整个文档的文本,而不是跟随各个链接,这对于较大的文档网站是值得额外努力的。
问:llms.txt 文件会提高我的 Google 搜索排名吗?
不会,Google 也直接确认了这一点:其生成 AI 优化指南表示,不需要新的机器可读文件才能出现在 AI 搜索结果中,Google 的约翰·穆勒已声明 llms.txt 不用于搜索。
问:我的文档平台是否已为我生成此文件?
可能——Mintlify、GitBook 和几个 CMS SEO 插件(Yoast SEO、AIOSEO)会自动生成 llms.txt,静态网站生成器也维护着像 vitepress-plugin-llms 和 docusaurus-plugin-llms 这样的插件,因此在手动编写之前检查您平台的设置。
问:我应该多长时间更新一次 llms.txt 文件? 每当您添加、删除或显著重组所引用的页面时,都要更新它,就像您维护网站地图一样——一个指向已删除页面的过时文件对代理来说比没有文件还要糟糕。
问:我可以为网站的不同部分创建不同的 llms.txt 文件吗?
可以——该规范允许在子路径下的更具体的 llms.txt 文件优先于根文件,适用于该子路径下的 URL,这在您的文档、博客和营销页面需要不同的策划时非常有用。
问:llms.txt 是否有最低长度要求?
规范本身没有设定最低长度,但 Chrome Lighthouse 的代理浏览审计会检查“H1 标题”和包含链接的“足够长度”,因此,一个极短的文件可能在技术上符合规范,但会在该特定检查中失败。
问:如果我根本不创建 llms.txt 文件会发生什么?
没有什么会破坏——该文件完全是可选的基础设施,没有 llms.txt 支持的代理将仅返回解析您网站的常规 HTML,正如他们以前所做的那样;您只是为支持它的代理留下了一个便利。



