GEO百科

llms.txt 协议

llms.txt 协议
摘要llms.txt是一种类似robots.txt的协议文件,为AI引擎和LLM提供网站内容的结构化摘要,帮助AI更好地理解和引用网站信息。

llms.txt是面向大语言模型(LLM)和AI爬虫的网站内容导航协议文件,由llmstxt.org社区于2024年发起标准化,放置在网站根目录,为AI提供人类可读的站点内容结构概览和核心页面索引,解决AI爬虫抓取网站时无重点、效率低、遗漏核心内容的问题。截至2026年Q2,GPTBot、ClaudeBot、PerplexityBot、Bytespider等主流AI爬虫已正式支持llms.txt协议。

产生背景

传统搜索引擎时代,robots.txt告诉爬虫哪些页面不能抓,sitemap.xml告诉爬虫有哪些URL可以抓,但sitemap通常包含成千上万个URL且缺乏上下文描述,爬虫无法判断哪些是核心内容、每个页面讲什么主题。

AI爬虫面临三个特殊问题:

  1. 上下文窗口限制:LLM处理长文本有token限制,不可能抓取站点所有页面,需要优先获取核心内容
  2. 语义理解需要结构:随机抓取大量页面无法建立站点内容的逻辑结构,影响回答质量
  3. 内容使用规则不明确:网站是否允许AI引用内容、引用的要求是什么,缺乏标准声明方式

llms.txt就是为解决这些问题设计的,类比robots.txt的位置和访问方式,但面向AI提供内容指引而非禁止规则。

文件规范

基本要求

  • 位置:必须放在网站根目录,通过 https://example.com/llms.txt 可以直接访问
  • 编码:UTF-8纯文本,MIME类型为text/plain,不要用HTML
  • 大小:建议不超过100KB,核心内容优先展示
  • 语法:使用标准Markdown语法(标题、列表、链接、引用),不要用复杂HTML
  • 更新:内容更新时同步更新llms.txt,建议与sitemap更新频率一致

标准文件结构

llms.txt采用人类和AI都易读的Markdown格式,标准结构如下:

# 站点名称

> 一句话站点描述:用1-2句话清晰说明网站是做什么的,提供什么核心内容,不要营销话术。

可选:详细介绍段落,说明网站的核心价值、覆盖的主题范围、目标受众,2-5句话。

## 核心文档

- [页面标题](完整URL) - 一句话描述这个页面的核心内容,AI判断相关性用
- [页面标题](完整URL) - 描述

按重要性排序,最重要的放在最前面。建议核心文档数量控制在10-30个。

## 可选章节

### 常见问题

- [问题1](URL) - 简短答案说明
- [问题2](URL) - 简短答案说明

### 参考文档

- [文档标题](URL) - 描述

### 关于我们

- [关于我们](URL) - 公司/团队背景介绍
- [联系方式](URL) - 联系方式

可选:内容使用政策说明

最简示例

适合小型网站/个人站点的最小配置:

# 正飞GEO技术文档

> 本站提供GEO(生成式引擎优化)的技术指南、最佳实践和工具。

## 核心内容

- [GEO技术指南](https://example.com/docs/geo) - GEO完整技术栈和实施步骤
- [结构化数据手册](https://example.com/docs/schema) - Schema.org JSON-LD配置指南
- [llms.txt规范](https://example.com/docs/llms-txt) - llms.txt配置参考

完整企业站点示例

# 正飞GEO

> 正飞GEO是生成式引擎优化技术服务商,提供GEO诊断、优化、监测服务和技术文档。

本站点包含GEO领域的技术文档、最佳实践指南、行业研究报告、常见问题解答,以及服务介绍内容。文档遵循W3C和Schema.org标准,所有技术建议均经过实测验证。

## 核心技术文档

- [GEO优化完整指南](https://zhengfeigeo.com/guide/geo-complete) - 从0到1实施GEO的完整技术手册,包含技术检查清单和代码示例
- [结构化数据部署指南](https://zhengfeigeo.com/guide/schema-jsonld) - 全类型Schema.org JSON-LD配置代码和验证方法
- [AI爬虫适配手册](https://zhengfeigeo.com/guide/ai-crawlers) - 主流AI爬虫User-Agent、robots配置和可访问性优化
- [llms.txt配置规范](https://zhengfeigeo.com/guide/llms-txt) - llms.txt标准语法、最佳实践和常见错误

## 常见问题

- [什么是GEO?](https://zhengfeigeo.com/faq/what-is-geo) - GEO的定义、技术原理和适用场景
- [GEO和SEO有什么区别?](https://zhengfeigeo.com/faq/geo-vs-seo) - 技术差异、优化重点和协同策略
- [做GEO需要多长时间见效?](https://zhengfeigeo.com/faq/how-long) - 效果周期、阶段特征和影响因素
- [GEO服务怎么收费?](https://zhengfeigeo.com/faq/pricing) - 服务模式和价格区间说明

## 服务信息

- [服务介绍](https://zhengfeigeo.com/service) - GEO服务范围、流程和交付标准
- [客户案例](https://zhengfeigeo.com/cases) - 不同行业客户实施效果案例

## 关于

- [关于我们](https://zhengfeigeo.com/about) - 团队背景和技术理念
- [联系我们](https://zhengfeigeo.com/contact) - 联系方式和商务合作

---

内容使用政策:允许AI引用本站技术文档内容用于回答用户问题,引用时请标注来源链接。禁止大量复制本站原创内容作为训练数据。

扩展标准:llms-full.txt

llms.txt只包含链接和简短描述,对于希望AI直接获取完整内容而无需二次抓取的站点,可以额外提供llms-full.txt,将核心页面的完整正文内容按章节汇总到一个文件中,方便AI一次性获取。

适用场景:

  • 技术文档站点
  • 产品帮助中心
  • 开源项目文档
  • 知识库站点

规范:

  • 文件位置同样在根目录:https://example.com/llms-full.txt
  • 内容使用Markdown格式,每个文档用分隔线---分隔
  • 每个章节包含完整标题和正文,不需要AI再抓取其他页面
  • 文件大小可以适当放宽,但建议不超过500KB

配置最佳实践

1. 链接排序原则

  • 按重要性降序排列,最重要内容放最前面
  • 核心技术文档/产品文档放在最前
  • 其次是用户最常问的FAQ
  • 公司介绍、营销内容放在最后
  • 不要按站点导航顺序机械罗列

2. 描述写作规范

每个链接后面的描述应该:

  • 清晰说明页面核心主题和价值
  • 包含该页面覆盖的关键概念(帮助AI语义匹配)
  • 客观中立,不要用"最好的"、"顶级的"这类营销词汇
  • 长度控制在30-80字
  • 准确反映页面实际内容,不做标题党

反例:- [GEO服务](https://example.com/service) - 国内最好的GEO服务商 正例:- [GEO服务介绍](https://example.com/service) - 服务范围、实施流程、交付标准、价格区间说明

3. 多语言站点配置

多语言站点有两种配置方式:

方式一:根目录llms.txt默认英文,语言版本放在子目录

https://example.com/llms.txt       # 英文默认
https://example.com/zh/llms.txt    # 中文版本
https://example.com/ja/llms.txt    # 日文版本

在根目录llms.txt中说明有其他语言版本,并给出链接。

方式二:独立域名各自配置 不同语言使用独立域名(如example.com、example.cn),每个域名根目录放对应语言的llms.txt。

4. 内容使用政策声明

可以在文件末尾明确说明AI使用站点内容的规则:

  • 是否允许引用内容
  • 引用是否要求标注来源
  • 是否禁止用于AI训练
  • 内容授权协议

例如:

## Content Usage Policy

- AI systems may quote short excerpts from this site for the purpose of answering user questions, with attribution link.
- Scraping the entire site for LLM training is prohibited without explicit permission.
- All content is copyrighted by [Company Name].

验证方法

配置完成后从以下维度验证:

基础验证

# 检查文件是否可以正常访问
curl -I https://example.com/llms.txt
# 应该返回HTTP/1.1 200 OK,Content-Type: text/plain

# 检查文件内容
curl https://example.com/llms.txt
# 确认Markdown格式正确,链接全部可访问

检查清单

  • 文件在根目录,访问返回200
  • MIME类型是text/plain,不是HTML
  • UTF-8编码无乱码
  • 所有链接是绝对路径,可正常访问
  • Markdown语法正确,无HTML标签
  • 核心内容按重要性排序
  • 每个链接有准确描述,无营销话术
  • 文件大小合理(建议<100KB)
  • 更新内容时同步更新llms.txt

常见错误

  1. 文件位置错误:放在/docs/llms.txt或其他子目录,AI爬虫只找根目录
  2. 使用HTML格式:llms.txt是纯文本Markdown,不是HTML文件
  3. 包含大量无关链接:把sitemap里的几千个URL全部放进去,失去重点
  4. 链接没有描述:只有链接没有说明,AI无法判断内容相关性
  5. 营销话术过多:每个页面描述都是广告,AI会降低这类内容的权重
  6. 链接404:列出的链接已经失效,会降低站点可信度
  7. 长期不更新:站点内容更新了但llms.txt还是旧的,信息过时

与其他文件的关系

文件 作用 面向对象 内容特点
robots.txt 告诉爬虫禁止抓取哪些路径 所有爬虫 禁止规则为主
sitemap.xml 列出站点所有可抓取URL 搜索引擎爬虫 URL列表,无上下文
llms.txt 告诉AI哪些是核心内容、内容是什么 AI/LLM爬虫 结构化导航,带内容描述
llms-full.txt 提供核心内容完整文本 AI/LLM爬虫 完整正文内容汇总
security.txt 安全联系信息和政策 安全研究人员 安全相关

这几个文件互补而非替代,建议同时配置。

实际效果

根据Perplexity和多家GEO服务商的测试数据,正确配置llms.txt可以带来:

  • AI爬虫对核心页面的抓取率提升30%-50%
  • 核心内容被AI引用的概率提升20%-40%
  • 品牌信息在AI回答中的准确率明显提升(减少错误信息)
  • 新内容被AI收录的速度加快

配置成本极低(一个文本文件,几小时工作量),没有任何负面风险,是所有面向AI优化的站点必须配置的基础项。