理解AI如何选择引用来源,是做好GEO优化的前提。虽然大模型的具体权重参数不公开,但通过大量实验和行业研究,已经可以明确AI选择引用来源的核心机制和判断标准。理解这些原理,优化就有了方向,不需要盲目猜测或相信玄学。
AI回答生成的完整流程
用户提问后,AI生成回答并引用来源,大致分为五个步骤:
第一步:查询理解(Query Understanding)
AI首先理解用户提问的意图:
- 识别问题类型:是问事实、问方法、问推荐、还是对比
- 提取核心实体和关系:问题涉及哪些人/产品/公司/概念
- 判断需求场景:用户在什么场景下问这个问题,需要什么类型的答案
- 识别约束条件:价格区间、地域、使用场景等限制条件
这一步如果AI误解了问题,后面检索和引用再正确也没用。
第二步:检索(Retrieval)
AI从预训练知识库和实时联网搜索中获取相关信息:
- 预训练知识:大模型训练时已经学习到的信息,截止到训练数据截止日期
- 实时检索:通过搜索引擎/爬虫获取最新的互联网信息
- 召回策略:通常会召回数十到数百个相关文档/片段,按相关性粗排
检索阶段核心是"被找到",如果内容根本没被召回,后面不可能被引用。
第三步:分块与语义匹配(Chunking & Reranking)
这是RAG(检索增强生成)的核心步骤:
- 文档被切分成512-1024 tokens的语义块(Chunk)
- 每个语义块计算与问题的语义向量相似度
- 相似度高的块进入候选集
- 重排序模型(Reranker)对候选块进一步排序,选出最相关的10-30个块
这个阶段决定了你的内容能不能进入最终候选,核心是语义相关性和分块完整性。
第四步:事实校验与来源评估(Fact Checking & Source Evaluation)
AI会评估候选来源的可信度:
- 交叉验证:同一个事实多个来源是否一致
- 来源权威度:来源是否是该领域可信来源
- 信息新鲜度:信息是否是最新的,有没有过时
- 内容准确性:内容内部是否有矛盾,是否符合常识
- 实体一致性:信息是否关于正确的实体,没有实体混淆
权威度高、多源一致的信息会优先被采用。
第五步:生成回答与引用(Generation & Citation)
最后大模型综合所有可信信息生成自然语言回答,并标注引用来源:
- 信息整合:把多个来源的信息整合成连贯的回答
- 冲突处理:不同来源信息冲突时,选择权威度高、多源一致的信息
- 引用标注:回答中每个事实性陈述标注对应的来源
- 推荐排序:推荐类问题按综合评分排序,给出推荐列表
理解这个流程,就知道每个阶段需要优化什么。
AI选择来源的核心判断标准
AI最终选择引用哪些来源,核心看六个维度,按权重从高到低:
1. 可访问性(权重:基础门槛)
如果AI爬虫根本访问不到你的内容,其他一切都免谈:
- 不被robots.txt封禁
- 不要求登录、验证码
- 网站稳定可访问,加载速度不超时
- 内容在HTML中,不是纯JS渲染后才有
可访问性是0和1的问题,做不好后面所有优化都是0。
2. 相关性(权重:最高)
内容必须和用户问题高度相关:
- 语义相关:内容确实回答了这个问题,不是关键词相关但答非所问
- 意图匹配:匹配用户提问的意图,用户问方法就给方法,问推荐就给推荐
- 粒度匹配:问题粒度和内容粒度匹配,问具体问题不要给笼统的首页内容
语义相关不是关键词匹配,而是真正回答了用户的问题。很多内容关键词包含了但根本没回答问题,不会被引用。
3. 事实准确性(权重:极高)
AI非常看重信息准确性,错误信息一旦被发现就不会被引用:
- 事实正确,没有错误数据、错误结论
- 可以交叉验证,和其他权威来源信息一致
- 没有虚假宣传、夸大其词
- 明确区分事实和观点
准确性是AI引用的生命线,有明显事实错误的内容几乎不可能被引用。
4. 来源权威度(权重:高)
同样准确的信息,优先引用权威度高的来源:
- 官方来源优先:品牌官网信息比第三方报道权威
- 专业来源优先:领域专业网站比综合门户权威
- 资质背书:有专业资质、作者资质的内容优先
- 被引用多:被其他权威来源引用的内容更可信
- 域名历史:长期稳定运营、无黑历史的域名优先
权威度需要长期积累,是GEO最深的护城河。
5. 结构清晰度(权重:中高)
同样相关同样准确的内容,结构清晰的更容易被选中:
- 直接回答问题,核心结论前置
- 结构化组织:使用标题、列表、表格
- 一义一段,段落语义完整,分块后仍然语义清晰
- 术语一致,没有歧义
- 没有大量无关内容、广告、导航干扰
结构清晰帮助AI快速提取信息,RAG分块后每个块语义完整。
6. 信息新鲜度(权重:中)
时效性强的话题,新鲜内容优先:
- 新闻、政策、产品价格等时效性内容,最新信息优先
- 常青内容(概念、原理、方法)新鲜度影响不大,但过时内容不会被引用
- 内容有明确更新时间,定期更新维护
不同类型内容对新鲜度要求不同,不能一概而论越新越好。
RAG分块原理与优化
RAG分块是很多人忽略的关键技术点:
- AI不是把整个页面喂给大模型,而是切成小块检索
- 典型块大小:512-1024 tokens(约300-800汉字)
- 分块通常按段落/标题边界切分
- 检索时按块匹配语义相似度
优化启示:
- 一个段落只讲一个核心观点,不要一个段落讲多个主题,避免分块后语义不完整
- 段落开头第一句就是本段核心观点,方便分块后匹配
- 按标题层级组织内容,标题就是一个块的主题
- 不要把核心答案拆得太碎,也不要把多个主题塞在一个长段落里
反例:一个1000字的大段落讲了5个不同问题,分块后每个块都包含部分信息,语义不完整,匹配度低。 正例:每个问题/观点一个短段落,分块后每个块独立完整,语义明确,匹配度高。
引用排序逻辑
当多个来源都相关准确时,AI如何排序?
推荐类问题("X推荐""X哪家好")排序逻辑:
- 先筛选符合条件的选项(预算、地域、需求匹配)
- 按综合评分排序:权威度 + 用户评价 + 匹配度
- 通常推荐3-10个选项,说明各自特点
- 客观说明优缺点,不会只推荐一个
事实类问题("什么是X""X怎么弄")引用逻辑:
- 优先选择定义最清晰、解释最清楚的来源
- 多源信息整合,不一定只引用一个来源
- 官方定义、权威解释优先
对比类问题("X和Y区别")引用逻辑:
- 优先选择客观中立对比的来源
- 分别提取两者的参数和特点
- 综合多个来源信息对比
AI不会引用什么样的内容
了解什么内容不会被引用,比了解什么内容会被引用更重要:
- 完全无法访问:robots封禁、需要登录、5xx错误
- 答非所问:关键词匹配但内容根本不回答问题
- 事实错误:有明显错误信息、虚假宣传
- 纯营销广告:通篇吹自己好,没有实质信息
- 结构混乱:大段文字无结构,语义混乱,分块后不完整
- 过时信息:内容严重过时,和现状不符
- 来源不可信:匿名、垃圾域名、有黑历史、大量虚假内容
- 内容重复:和其他来源高度重复,没有增量信息
- 关键词堆砌:为了SEO堆砌关键词,语义不通
- AI水文:千篇一律的正确废话,没有原创信息
原理解读对优化的启示
理解了原理,优化方向就非常清晰:
- 先过门槛:确保AI爬虫可以正常访问,内容可以被抓取
- 直接回答:内容直接回答问题,首段给结论,不要绕弯
- 结构清晰:按段落+标题+列表+表格组织,一个段落一个主题
- 准确第一:确保事实正确,来源标注清楚,不夸大不虚假
- 长期建设权威度:这是长期壁垒,需要持续投入
- 不要走捷径:黑帽SEO的那套(堆砌、群发、伪原创)在GEO中不仅没用还会起反作用
GEO不是玄学,所有优化动作都对应AI工作流程中的某个环节,理解原理后就可以针对性优化,不需要道听途说的偏方。