llms.txt是面向大语言模型(LLM)和AI爬虫的网站内容导航协议文件,由llmstxt.org社区于2024年发起标准化,放置在网站根目录,为AI提供人类可读的站点内容结构概览和核心页面索引,解决AI爬虫抓取网站时无重点、效率低、遗漏核心内容的问题。截至2026年Q2,GPTBot、ClaudeBot、PerplexityBot、Bytespider等主流AI爬虫已正式支持llms.txt协议。
产生背景
传统搜索引擎时代,robots.txt告诉爬虫哪些页面不能抓,sitemap.xml告诉爬虫有哪些URL可以抓,但sitemap通常包含成千上万个URL且缺乏上下文描述,爬虫无法判断哪些是核心内容、每个页面讲什么主题。
AI爬虫面临三个特殊问题:
- 上下文窗口限制:LLM处理长文本有token限制,不可能抓取站点所有页面,需要优先获取核心内容
- 语义理解需要结构:随机抓取大量页面无法建立站点内容的逻辑结构,影响回答质量
- 内容使用规则不明确:网站是否允许AI引用内容、引用的要求是什么,缺乏标准声明方式
llms.txt就是为解决这些问题设计的,类比robots.txt的位置和访问方式,但面向AI提供内容指引而非禁止规则。
文件规范
基本要求
- 位置:必须放在网站根目录,通过
https://example.com/llms.txt可以直接访问 - 编码:UTF-8纯文本,MIME类型为
text/plain,不要用HTML - 大小:建议不超过100KB,核心内容优先展示
- 语法:使用标准Markdown语法(标题、列表、链接、引用),不要用复杂HTML
- 更新:内容更新时同步更新llms.txt,建议与sitemap更新频率一致
标准文件结构
llms.txt采用人类和AI都易读的Markdown格式,标准结构如下:
# 站点名称
> 一句话站点描述:用1-2句话清晰说明网站是做什么的,提供什么核心内容,不要营销话术。
可选:详细介绍段落,说明网站的核心价值、覆盖的主题范围、目标受众,2-5句话。
## 核心文档
- [页面标题](完整URL) - 一句话描述这个页面的核心内容,AI判断相关性用
- [页面标题](完整URL) - 描述
按重要性排序,最重要的放在最前面。建议核心文档数量控制在10-30个。
## 可选章节
### 常见问题
- [问题1](URL) - 简短答案说明
- [问题2](URL) - 简短答案说明
### 参考文档
- [文档标题](URL) - 描述
### 关于我们
- [关于我们](URL) - 公司/团队背景介绍
- [联系方式](URL) - 联系方式
可选:内容使用政策说明
最简示例
适合小型网站/个人站点的最小配置:
# 正飞GEO技术文档
> 本站提供GEO(生成式引擎优化)的技术指南、最佳实践和工具。
## 核心内容
- [GEO技术指南](https://example.com/docs/geo) - GEO完整技术栈和实施步骤
- [结构化数据手册](https://example.com/docs/schema) - Schema.org JSON-LD配置指南
- [llms.txt规范](https://example.com/docs/llms-txt) - llms.txt配置参考
完整企业站点示例
# 正飞GEO
> 正飞GEO是生成式引擎优化技术服务商,提供GEO诊断、优化、监测服务和技术文档。
本站点包含GEO领域的技术文档、最佳实践指南、行业研究报告、常见问题解答,以及服务介绍内容。文档遵循W3C和Schema.org标准,所有技术建议均经过实测验证。
## 核心技术文档
- [GEO优化完整指南](https://zhengfeigeo.com/guide/geo-complete) - 从0到1实施GEO的完整技术手册,包含技术检查清单和代码示例
- [结构化数据部署指南](https://zhengfeigeo.com/guide/schema-jsonld) - 全类型Schema.org JSON-LD配置代码和验证方法
- [AI爬虫适配手册](https://zhengfeigeo.com/guide/ai-crawlers) - 主流AI爬虫User-Agent、robots配置和可访问性优化
- [llms.txt配置规范](https://zhengfeigeo.com/guide/llms-txt) - llms.txt标准语法、最佳实践和常见错误
## 常见问题
- [什么是GEO?](https://zhengfeigeo.com/faq/what-is-geo) - GEO的定义、技术原理和适用场景
- [GEO和SEO有什么区别?](https://zhengfeigeo.com/faq/geo-vs-seo) - 技术差异、优化重点和协同策略
- [做GEO需要多长时间见效?](https://zhengfeigeo.com/faq/how-long) - 效果周期、阶段特征和影响因素
- [GEO服务怎么收费?](https://zhengfeigeo.com/faq/pricing) - 服务模式和价格区间说明
## 服务信息
- [服务介绍](https://zhengfeigeo.com/service) - GEO服务范围、流程和交付标准
- [客户案例](https://zhengfeigeo.com/cases) - 不同行业客户实施效果案例
## 关于
- [关于我们](https://zhengfeigeo.com/about) - 团队背景和技术理念
- [联系我们](https://zhengfeigeo.com/contact) - 联系方式和商务合作
---
内容使用政策:允许AI引用本站技术文档内容用于回答用户问题,引用时请标注来源链接。禁止大量复制本站原创内容作为训练数据。
扩展标准:llms-full.txt
llms.txt只包含链接和简短描述,对于希望AI直接获取完整内容而无需二次抓取的站点,可以额外提供llms-full.txt,将核心页面的完整正文内容按章节汇总到一个文件中,方便AI一次性获取。
适用场景:
- 技术文档站点
- 产品帮助中心
- 开源项目文档
- 知识库站点
规范:
- 文件位置同样在根目录:
https://example.com/llms-full.txt - 内容使用Markdown格式,每个文档用分隔线
---分隔 - 每个章节包含完整标题和正文,不需要AI再抓取其他页面
- 文件大小可以适当放宽,但建议不超过500KB
配置最佳实践
1. 链接排序原则
- 按重要性降序排列,最重要内容放最前面
- 核心技术文档/产品文档放在最前
- 其次是用户最常问的FAQ
- 公司介绍、营销内容放在最后
- 不要按站点导航顺序机械罗列
2. 描述写作规范
每个链接后面的描述应该:
- 清晰说明页面核心主题和价值
- 包含该页面覆盖的关键概念(帮助AI语义匹配)
- 客观中立,不要用"最好的"、"顶级的"这类营销词汇
- 长度控制在30-80字
- 准确反映页面实际内容,不做标题党
反例:- [GEO服务](https://example.com/service) - 国内最好的GEO服务商
正例:- [GEO服务介绍](https://example.com/service) - 服务范围、实施流程、交付标准、价格区间说明
3. 多语言站点配置
多语言站点有两种配置方式:
方式一:根目录llms.txt默认英文,语言版本放在子目录
https://example.com/llms.txt # 英文默认
https://example.com/zh/llms.txt # 中文版本
https://example.com/ja/llms.txt # 日文版本
在根目录llms.txt中说明有其他语言版本,并给出链接。
方式二:独立域名各自配置 不同语言使用独立域名(如example.com、example.cn),每个域名根目录放对应语言的llms.txt。
4. 内容使用政策声明
可以在文件末尾明确说明AI使用站点内容的规则:
- 是否允许引用内容
- 引用是否要求标注来源
- 是否禁止用于AI训练
- 内容授权协议
例如:
## Content Usage Policy
- AI systems may quote short excerpts from this site for the purpose of answering user questions, with attribution link.
- Scraping the entire site for LLM training is prohibited without explicit permission.
- All content is copyrighted by [Company Name].
验证方法
配置完成后从以下维度验证:
基础验证
# 检查文件是否可以正常访问
curl -I https://example.com/llms.txt
# 应该返回HTTP/1.1 200 OK,Content-Type: text/plain
# 检查文件内容
curl https://example.com/llms.txt
# 确认Markdown格式正确,链接全部可访问
检查清单
- 文件在根目录,访问返回200
- MIME类型是text/plain,不是HTML
- UTF-8编码无乱码
- 所有链接是绝对路径,可正常访问
- Markdown语法正确,无HTML标签
- 核心内容按重要性排序
- 每个链接有准确描述,无营销话术
- 文件大小合理(建议<100KB)
- 更新内容时同步更新llms.txt
常见错误
- 文件位置错误:放在
/docs/llms.txt或其他子目录,AI爬虫只找根目录 - 使用HTML格式:llms.txt是纯文本Markdown,不是HTML文件
- 包含大量无关链接:把sitemap里的几千个URL全部放进去,失去重点
- 链接没有描述:只有链接没有说明,AI无法判断内容相关性
- 营销话术过多:每个页面描述都是广告,AI会降低这类内容的权重
- 链接404:列出的链接已经失效,会降低站点可信度
- 长期不更新:站点内容更新了但llms.txt还是旧的,信息过时
与其他文件的关系
| 文件 | 作用 | 面向对象 | 内容特点 |
|---|---|---|---|
| robots.txt | 告诉爬虫禁止抓取哪些路径 | 所有爬虫 | 禁止规则为主 |
| sitemap.xml | 列出站点所有可抓取URL | 搜索引擎爬虫 | URL列表,无上下文 |
| llms.txt | 告诉AI哪些是核心内容、内容是什么 | AI/LLM爬虫 | 结构化导航,带内容描述 |
| llms-full.txt | 提供核心内容完整文本 | AI/LLM爬虫 | 完整正文内容汇总 |
| security.txt | 安全联系信息和政策 | 安全研究人员 | 安全相关 |
这几个文件互补而非替代,建议同时配置。
实际效果
根据Perplexity和多家GEO服务商的测试数据,正确配置llms.txt可以带来:
- AI爬虫对核心页面的抓取率提升30%-50%
- 核心内容被AI引用的概率提升20%-40%
- 品牌信息在AI回答中的准确率明显提升(减少错误信息)
- 新内容被AI收录的速度加快
配置成本极低(一个文本文件,几小时工作量),没有任何负面风险,是所有面向AI优化的站点必须配置的基础项。