你按下回车之后:AI 搜索的七道关卡

把 SEO、GEO 和「豆包/ChatGPT 到底怎么搜到东西」一次讲透——只用查得到出处的证据

leonardchow.work · 读物

2026-07-27

一句话:一次 AI 提问要过七道关卡,而市面上绝大多数「GEO 教程」只在「怎么让模型在已有材料里挑中你」这一步上做文章——那一步恰恰是零和的、证据最弱的一步;真正有因果证据的动作只有一件,而且朴素得多:先让爬虫进得来

说明:本文的核心数字与技术细节都指向可点开的一手出处(官方文档、美国司法部公开的法庭文件、arXiv 论文原文),集中列在文末「附:主要出处」;少数辅助数字未列入该清单,请以原始出处为准。查不到的地方直接写「查不到」——在这个题目上,「查不到」本身就是重要结论。查证日期:2026 年 7 月 27 日。


先约定四个词

后面反复要用,这里一次说清楚,读起来就不会卡:


0. 先说清楚:你问的其实是三个问题

大部分人问「AI 搜索怎么优化」的时候,脑子里是一个动作:我问它,它去搜,它给我答案。

但把整条链路拆开会发现,这里面藏着三个完全不同的问题:

  1. 传统搜索引擎是怎么排序的——因为 AI 搜索是长在它上面的;
  2. 你按下回车之后,AI 到底调用了什么工具、怎么把东西搜出来
  3. 一堆网页塞进模型之后,AI 凭什么挑中其中几条

这三个问题的答案,可查证程度天差地别。第一个有大量官方文档,甚至有美国反垄断案庭审时公开的 Google 内部文件;第二个只有各家 API 文档能逐字核对;第三个大部分是黑盒,只能靠论文从外部观测。

API,应用程序接口——简单说就是厂商开放给程序员按次付费调用的通道。为什么 API 文档特别可信?因为厂商要收钱,就必须把参数、返回什么、怎么计费写清楚,否则客户没法用。相比之下官方博客可以只讲漂亮话。这条差别是本文很多硬材料的来源。)

黑盒——你只能看到「输进去什么、出来什么」,中间怎么处理的完全看不见。)

把它们混在一起谈,就是所有误解的源头。

先给全貌。一次 AI 提问,最多要过七道关卡:

你打的那句话
  │
  ├─① 触发决策    要不要搜?(模型自己决定 / 外面有个分类器先判断 / 你手动开关)
  │
  ├─② 问题改写    你的原话 → 1~N 条真正拿去检索的关键词
  │
  ├─③ 检索        打到谁的索引库?(自建的 / 买别人的 / 搜索引擎自家的)
  │
  ├─④ 回传        给模型的是什么?(一句话摘要 / 正文片段 / 全文)几条?
  │
  ├─⑤ 重排        有没有第二轮打分筛选?
  │
  ├─⑥ 生成引用    那个 [1][2] 角标是模型自己写的,还是系统事后对齐的?
  │
  └─⑦ 爬取        用什么身份抓你的网页?你能不能拒绝?
一次 AI 提问要过的七道关卡。做内容的人真正能动的只有两道:第 ③ 道「进不进得了候选集」和第 ⑦ 道「让不让爬虫抓」。中间那段基本是黑盒——而市面上多数 GEO 教程恰恰在教你优化黑盒里的第 ⑥ 道。

记住这张图,后面所有内容都挂在它上面。

索引库:搜索引擎提前把全网网页抓回来、整理成一张能快速查的大表。你搜东西时它查的是这张表,不是当场去访问全网。)


1. 第一站:传统搜索到底怎么排序

要理解 AI 搜索,得先知道它踩在什么地基上。

1.1 Google 的排序不是「一个算法」,是一条分层漏斗

这件事以前只能靠 SEO 圈猜。2023 年美国司法部起诉 Google 垄断,庭审记录和内部文件被公开,外界第一次看到了真实结构。

Google 搜索副总裁 Pandu Nayak 在 2023 年 10 月 18 日的庭审上,被法官直接问「排序是不是在筛到几万篇之后才做的」,他的回答是:

「没错。下一阶段是——好,我现在有几万篇了。我要用一堆信号给它们打分,缩到几百篇。然后才送进下一阶段的排序,那一阶段用到机器学习。」

用什么信号从几万砍到几百?Nayak 说:「我们所有的核心主题相关性信号、PageRank 信号、地域信号。」

PageRank:Google 最早的招牌算法,简单说就是「被越多重要网页链接的网页越重要」。)

所以完整流水线长这样,每一层都有一手证据:

倒排索引求交          →  几万篇
    ↓
传统信号打分          →  几百篇
(主题相关性 + PageRank + 点击数据 + 地域)
    ↓
深度学习精排
(RankBrain / DeepRank / RankEmbed)
    ↓
Twiddler 重排
    ↓
Tangram 组装整页
    ↓
你看到的搜索结果页
Google 的分层漏斗。最关键的是第二刀:从几万篇砍到几百篇——没进这几百篇的页面,后面所有精排都碰不到它。这就是「收录了但不排名」的结构性原因。

倒排索引求交:把每个词对应的网页清单拉出来,取交集。搜「北京 天气」,就是把「北京」的清单和「天气」的清单对一遍,找同时出现两个词的网页。) (Twiddler:Google 内部叫法,指对已经选好的结果再做一次调整的小模块,比如把太旧的往下压。) (Tangram:决定搜索结果页上出现哪些板块(新闻框、图片包、「大家还在问」)以及它们的位置。原名 Tetris。)

1.2 2025 年的新材料:Google 工程师亲口讲的三个基础信号

2025 年 2 月 18 日,Google 工程师 Hyung-Jin Kim(负责搜索质量)与司法部专家的通话笔录被作为证据公开(编号 PXR0356)。这份材料几乎是一份内部排序架构说明书:

ABC 信号,这是三个最基础的信号,都是工程师做出来的,是原始信号: - Anchors(A)——指向某个页面的链接 - Body(B)——文档里的词 - Clicks(C)——历史上用户在某个链接页面停留了多久才退回搜索结果页

「ABC 信号是 topicality(主题相关性,也叫基础分) 的关键组成部分。」 「T*(主题相关性) 用一种相当手工的方式把这三个信号组合起来。」

关于站点质量分:

Q*(页面质量,也就是可信度这个概念)极其重要。……质量分在今天依然极其重要。」 「Q 基本上是静态的,主要跟站点有关,而不是跟具体查询有关。」

关于 PageRank 现在的角色,这句话是理解 2026 年外链价值的关键:

PageRank。这是一个关于「离已知优质源头有多远」的单一信号,它作为 Quality 分的输入使用。

这句话变了味。 它不再是 1998 年论文里那个「谁链接多谁重要」的算法,而更像是「你离一批种子权威网站有几跳」。含义是:一条链接的价值取决于它离已知优质源有多近,不取决于数量。

1.3 点击算不算排序信号?算,而且 Google 内部承认对外有一套说法

这是 SEO 圈吵了十几年的问题。法庭文件给了答案。

Google 内部 2020 年的演示文稿《Logging & Ranking》写着:

不止一个排序系统从搜索日志里学习。从日志学习是排序背后的主要机制。

而 2018 年 Eric Lehman 给研究部门的内部分享里,「敏感话题」那一页写着:

不要讨论搜索中对点击的使用,除非是必须知道的人、且对方明白不能对外谈这个话题。Google 有一个公开立场。这个立场是可争辩的。但请不要自己编一套说法。

这是回答「Google 为什么长期公开否认点击是排序信号」的最直接证据——内部文件把它称为一个「公开立场」,并承认「这是可争辩的」。

但不要过度解读。 同一批文件里也有反向证据。Nayak 2025 年的笔录说:

Google 避免简单地『预测点击』,因为点击很容易被操纵,而且是提升用户体验的糟糕代理指标。」

所以准确的判断是三条:

说法 判定
点击/用户交互数据是 Google 排序系统的输入 证实
Google 直接按点击率排序 证伪
刷点击能提排名 查无证据,且有反向证据:点击数据会按地区和设备分开统计(同一批人反复点,影响不了别的地区),泄露文档里还有专门区分「好点击 / 坏点击」的字段(说明系统会主动剔除异常点击

1.4 顺便澄清几个流行说法

读完全部材料,有几个 SEO 圈的常识需要修正:

说法 判定 依据
E-E-A-T 是排序因子 证伪 Google 官方明说「它不是排序因子」。但评分员打的分确实被用来训练几乎所有排序模型——所以照着它优化间接有效,把它当成一个能「加分」的开关是错的
有一个叫「页面体验」的排序信号 证伪 官方原话:「没有单一信号。
Core Web Vitals 全绿能提排名 证伪 官方原话:好分数「不保证你的页面排在前面」
PageRank 已经不用了 证伪 官方文档 + 2025 年法庭笔录双重证实仍在用
文章要 1500 字以上 与官方直接冲突 官方原话:「没有理想的页面长度。

E-E-A-T:Google 的一个概念标签,指经验、专业性、权威性、可信度。它是给人类评分员和创作者看的框架,不是一个能计算的分数。)

1.5 2024 年那次泄露:怎么用才对

2024 年 5 月,Google 内部的 Content Warehouse API 文档意外流到 GitHub 上,包含 2,596 个模块、14,014 个字段。SEO 圈据此写了海量文章。

它是真的——Google 发言人的回应只质疑「脱离上下文、过时、不完整」,没有否认真实性。更硬的证据是:2025 年那份法庭笔录里,Google 工程师自己提到了这次泄露:

「有过一次 Google 文档泄露,它命名了 Google 排序系统的某些组件,但这些文档没有涉及曲线和阈值的具体细节。」

这句话同时给了它的价值和它的边界:有名字,没有曲线和阈值。

「字段存在于文档」和「该字段在排序中被使用、而且权重可观」之间,隔着好几道坎。其中最有说服力的一道,来自泄露文档自己:里面有个 pagerank 字段,注释写着 「已废弃;只有 MustangBasicInfo 里的 pagerank 在用」

既然文档里会保留废弃字段,那么任何一个没标注的字段,也可能事实上不再使用。这是泄露文档自身提供的反证。

所以正确用法是排除法:它告诉你 Google 内部确实存在站点级质量分、点击信号、锚文本垃圾检测这些概念,从而排除掉「Google 完全不看这些」的说法。它不能告诉你任何一个优化动作能带来多少收益。


2. 按下回车之后:五家 AI 产品逐跳拆解

这一节回答「AI 收到一个信息之后开始搜索是调用什么工具」。

先立一条规矩,不遵守它写出来的东西必然是错的

公开 API 里的搜索工具 ≠ 你在 chatgpt.com 上用的那个搜索。

前者每个参数都能逐字核对,后者几乎全是黑盒。拿前者的参数去解释后者的行为,是中文「AI 搜索原理」文章最常见的错误。

2.1 ① 触发:谁决定「这题要不要搜」

答案五家都不一样,而且有一家跟流行说法相反。

ChatGPT 不是纯靠模型自己决定。 消费级 ChatGPT 前面有一个独立的轻量分类器在把关。证据来自两个互相独立的来源——芝加哥大学 SUPERgroup 整理的 ChatGPT 数据导出格式定义,以及一份真实抓包记录,两边给出的字段名完全一致:

sonic_classification_result:
  simple_search_prob:  0.9857      ← 判定「需要简单搜索」的概率
  complex_search_prob: 0.0017
  no_search_prob:      0.0125
  classifier_config:
    n_ctx: 2048                    ← 只看 2048 个词的上下文
    timeout: 1.0                   ← 1 秒超时
    max_action_length: 4           ← 一次最多 4 条查询
  decision_source: "classifier"    ← 这次的搜索决定来自分类器,不是模型

从这几行能直接读出工程事实:这是一个三分类器(不搜/简单搜/复杂搜),独立于主模型运行,上下文窗口只有 2048、超时 1 秒——典型的前置轻量关卡。

上下文,context——模型一次能「看在眼里」的全部文字,包括你的提问和搜来的资料。它有上限,叫上下文窗口。这个词是理解第 4 节的关键:搜来的网页最终都要塞进这个窗口,塞不下的、或者塞在中间位置的,模型就用不上。)最后那行 decision_source: "classifier" 明确说明这次的搜索决策来自分类器而不是模型的工具调用

所以消费级 ChatGPT 的完整触发链是三层:前置分类器 → 模型自主调用 → 用户手动覆盖(Search 按钮 / 输入 /

⚠️ 这里要诚实标注证据等级:字段名和数值有两个独立来源互证,可信度较高;但 sonic 这类内部代号没有任何官方文档确认,只出现在用户数据导出里。

其他四家:

产品 触发方式
Claude 模型自主。官方罕见地列出了搜索/不搜索的边界清单(会搜:近期事件、当前价格、可能变化的信息;不搜:既定事实、数学、创意写作、寒暄)。只有 max_uses 上限,没有强制下限
Gemini 新版模型自主;旧版 Gemini 1.5 有一个显式的打分器 dynamicThreshold默认阈值 0.3——这是全场唯一一个公开可配置的「外部分类器决定要不要搜」
Perplexity 唯一在公开 API 里把搜索分类器做成显式参数的disable_search(硬关)、enable_search_classifier(交给分类器判断)
OpenAI API 模型自主,且是唯一明确文档化了「怎么强制必须搜」的(tool_choice: "required"

2.2 ② 改写:你的原话不会被直接拿去搜

这是整篇最该记住的一节。

OpenAI 帮助中心给了一段逐字的改写示例,一次性回答了四个问题:

「ChatGPT 搜索通常会把你的问题改写成一条或多条更有针对性的查询再发给这些提供商。比如一个生物科技研究员问 ChatGPT『针对 CCR8 的抗癌药物研发最新进展是什么』,ChatGPT 可能先用『CCR8 immunotherapy drug development 2025』去查。看过初步结果之后,ChatGPT 搜索可能再向其他搜索提供商发出更具体的查询,比如『CHS-114 conference 2025』。」

同一页还确认了两件事:记忆(Memory)会参与改写——如果系统记得你是素食者、住旧金山,你问「附近有什么我会喜欢的餐厅」会被改写成「good vegan restaurants San Francisco」;IP 推断的地理位置也会注入

这对做内容的人意味着什么:同一个问题,不同用户打到搜索后端的查询是不一样的。你无法用一条固定查询复现用户看到的结果。

其他几家的改写形态结构性地不同,这个差别很关键:

产品 官方用词 形态
Google 「query fan-out」(查询扇出),“issuing multiple related searches concurrently” 并发,广度优先。AI Mode 官方量级约「a dozen(十来条)」,Deep Search「hundreds(数百条)」
Anthropic 「multiple progressive searches」,用前一轮结果决定后一轮 递进,深度优先。官方从未承诺并发
Microsoft 把提问压成「a few words(几个词)」 Deep Search 先用 GPT-4 把问题扩写成「理想结果应该长什么样」的完整描述,再按这个描述检索和重排

Google 这边还有一个不用看架构文档就能确认的硬证据:计费口径。官方条款说,如果模型为了回答一个问题执行了多条查询,「这算作该请求的两次可计费工具使用」。

计费口径和上面几条官方描述是吻合的。不过要克制一点:按条计费也可以纯粹出于成本对齐(每条查询本来就有真实成本),单靠它推不出「多查询是常态」。真正过硬的还是上面那几句官方原文。

还有一个更极端的事实,来自 Claude Code 的官方文档:

「该工具每次调用最多可以发起八次后端检索,在返回结果前于内部完成改写与筛选。」

这说明「一次工具调用」和「一次检索」根本不是一比一的。 模型看到的是一个工具调用,后端实际跑了最多 8 次检索——这一层对模型本身也是黑盒。

2.3 ③④ 检索打到谁、回来的是什么

产品 检索后端 回给模型/开发者的东西
Google 自家 Search 索引,没有独立的「AI 索引」 最不透明的一格:只给网址和标题,从不暴露检索到的正文,条数也无文档
ChatGPT 混合:官方点名的第三方只有 Bing 和 Shopify,同时有自建爬虫和索引 动作序列全公开:search(带复数的 queries)/ open_page(打开网页读正文)/ find_in_page(页内查找)。后两个只有推理模型才有
Claude 未公开。Anthropic 从未在任何文档正文里点名过(详见下方说明) 网址 + 标题 + 页面年龄 + 加密的正文块——正文对调用方是密文
Perplexity 自建:索引超过 2000 亿个网址,中位延迟 358 毫秒 唯一直接给明文摘要的{id, url, title, snippet, date}
Copilot Bing 开发者拿不到。官方逐字:「开发者和最终用户无权访问原始内容」

关于 Claude 用谁的索引,这里要多说两句,因为它是一个很好的「证据到什么程度才能下结论」的例子。

网上普遍说 Claude 用的是 Brave Search。可查的线索有三条,都指向同一个方向:2025 年 3 月 19 日,Anthropic 的第三方供应商变更公告新增了 Brave Search,并且把这一条的「更多信息」链接指向了自家联网搜索功能的帮助页;同期有人验证,Claude 对同一个问题给出的十条引用,与 Brave 的搜索结果完全一致;还有人在 Claude 的函数定义里看到了 BraveSearchParams 这个名字。

但这三条都不是 Anthropic 的正面声明,而且时间点停在 2025 年 3 月——距今一年多,供应商完全可能已经变了。核验过程中,我们还发现那个供应商名单页面是动态渲染的,独立复现读取失败了

所以本文的写法是:「未公开」。旁证很强,但强旁证不等于事实。

(唯一被 Anthropic 正面点名的是图片搜索——帮助文档逐字写着「图片搜索由 Bing 提供」。)

有一个参数把 OpenAI 的架构直接暴露了:external_web_access。官方说明是「控制搜索工具是抓取实时内容还是只用缓存/已索引的结果」,设成 false 就进入「离线/仅缓存模式」。

这个参数的存在本身就是结论:OpenAI 的搜索有两层——一层是已索引/已缓存的结果,一层是实时抓取。Codex 文档说得更直白:「缓存模式使用的是 OpenAI 维护的索引,而不是实时抓取任意页面。」

2.4 ⑤ 重排:全场最黑的一行

这一跳是「候选网页选出来之后,有没有第二轮更精细的打分」。

五家里只有 Perplexity 一家给出了明确的技术描述:先用两种方式粗筛出一批候选,最后用 cross-encoder 重排模型精挑。

粗筛在业内叫「召回」,用的是两种互补的办法:词面匹配——你搜的字,页面里有没有原样出现;向量匹配——意思像不像,就算用词完全不同也能命中。两种都要用,原因见 §4.1。)

cross-encoder(交叉编码器):把「问题」和「文档」拼成一整段送进模型,让每个词都能互相看见,从而判断「这段话到底有没有回答这个问题」。它比第一轮的粗筛准得多,但慢得多——所以只能用来精排少量候选,不能用来扫全网。)

其余四家:

为什么这一格最黑,是有原因的:重排模型是各家最核心的护城河,一旦公开就等于给优化从业者一张地图。这也解释了为什么 Perplexity 敢公开——它的商业模式是卖 API,技术透明本身是卖点。

还有一个更有意思的可能:这一跳可能压根被跳过了,而不是被藏起来了。三个主流开源 deep research 实现(LangChain 的 open_deep_research、gpt-researcher、dzhng/deep-research)没有一个用 cross-encoder 重排。它们用两样东西替代:搜索 API 自带的相关性分数,和 让大模型自己做摘要与过滤

2.5 ⑥ 引用角标是谁写的:四种架构,没有一种靠模型记忆

这一跳直接决定「AI 会不会引用一个它根本没读过的链接」。答案比想象中好:

产品 引用架构 能不能编造链接
Google 系统事后对齐。模型正文里根本没有 [1][2],引用是并列的另一套结构,用字节偏移量指向正文片段,还带 0–1 的置信分 不能。模型不参与写引用
Anthropic 系统回填。每条引用带 cited_text(被引原文,最多 150 字)和一个指回加密结果块的索引 结构上不可能。引用锚定在真实抓到的内容上
Perplexity 模型写编号,系统提供带稳定 id 的结果集,客户端查表 只能编错号,不能编 URL
Microsoft 系统给 annotation,且官方明令禁止让模型自己写:「不要让模型生成引用链接。 不能
OpenAI 混合:模型在正文里写内联引用,系统提供位置索引 唯一一个让模型直接参与写引用、且未承诺校验的

怎么判断 Google 那套是「系统事后对齐」而不是模型自己写的?看这个细节:引用的位置索引记录的是「从这段文字开头数过去第几个字符」

模型在一个字一个字往外吐的时候,不可能知道自己等会儿写出来的句子会落在第几个字符上——这种数字只有等整段文字已经完整存在之后,由另一个程序从头数一遍才能算出来。这就是「事后对齐」留下的指纹。

2.6 ⑦ 爬虫:三个身份已成行业标准

这一节是全文最能直接照做的一节,所以先把两个词说清楚:

robots.txt —— 放在你网站根目录下的一个纯文本文件(比如 example.com/robots.txt,任何人都能直接打开看)。爬虫来抓你网站之前,会先读这个文件,看看主人允许它抓哪些、不允许抓哪些。

里面最常见的两个词:User-agent「这条规则说的是哪个爬虫」Disallow「不许抓这些路径」

关键性质:它是「礼貌请求」,不是「技术封锁」。 守规矩的爬虫会照做,不守规矩的照样抓——后面第 4.5 节有实测数据表明,即便是大公司的爬虫也不总是遵守。

每家 AI 公司都会派出好几个不同身份的爬虫,各管各的事。OpenAI、Anthropic、Perplexity 的分工高度同构,已经形成事实标准:

用途 OpenAI Anthropic Perplexity
训练模型 GPTBot ClaudeBot 无(明确不用于训练)
搜索收录 OAI-SearchBot Claude-SearchBot PerplexityBot
用户实时触发 ChatGPT-User Claude-User Perplexity-User

(OpenAI 其实是四个——还有一个 OAI-AdsBot 专门校验被提交为广告的落地页,多数中文资料没提。)

对做内容的人,这里有三条能直接执行的硬结论:

第一,想进 ChatGPT 搜索答案,必须放行 OAI-SearchBot 官方逐字:「被 OAI-SearchBot 排除的站点不会出现在 ChatGPT 搜索答案里,虽然仍可能作为导航链接出现。」而挡 GPTBot(训练)和放行 OAI-SearchBot(搜索)是两个独立开关。把两个一起 disallow 是最常见的误配。另外,robots.txt 改动有约 24 小时的生效延迟

第二,挡「用户触发」那一类基本无效。 Google、OpenAI、Perplexity 三家官方文档都白纸黑字写了用户触发的抓取「一般忽略 robots.txt」。这在业内是公开的一致做法。

第三,Google-Extended 挡不住 AI Overviews。

AI Overviews = 你在 Google 搜东西时,结果页最上方那一段由 AI 直接写好的摘要,下面挂着几个来源链接。AI Mode 则是一个完整的对话式搜索页面。国内用户可能没见过,但它俩是本文后面反复出现的两个关键角色。)

grounding,直译「接地」——指让模型先去搜一遍真实资料,再基于搜到的东西回答,而不是凭记忆瞎编。本文说的「联网搜索」,在厂商文档里基本都叫这个词。)

这是流传最广的错误之一。官方原文说 Google-Extended 管的是三件事:训练 Gemini、Gemini Apps 里的 grounding、Vertex AI(Google 的企业级 AI 平台)上的 Grounding with Google Search。这份文档里完全没提 AI Overviews 和 AI Mode。 想退出 Google 的 AI 摘要,唯一手段是 nosnippet / data-nosnippet / max-snippet / noindex 这几个标签——它们写在网页的 HTML 里,作用分别是「别显示我的摘要」「这一段别显示」「摘要最多显示多少字」「干脆别收录我」。

而这些是全搜索生效的——用它们退出 AI 摘要,代价是普通搜索结果里你的摘要也一起没了。

「只退出 AI 摘要但保留普通搜索结果」这个开关,Google 没有提供。 Bing 那边同理:挡 bingbot = 同时退出 Bing 搜索和 Copilot。

⚠️ 顺带说一个必须澄清的争议:2025 年 8 月 Cloudflare 公开指控 Perplexity 绕过 robots.txt,取消了它的可信爬虫资格。但 Cloudflare 指控的不是「忽略 robots.txt」这件事本身(那是三家都在做的行业惯例),而是用未公示的伪装成 Chrome 的身份 + 未公示的 IP 轮换。这两件事不要混为一谈。


3. 中国这边:55% 查不到,但有人把答案写在了账单里

这一节回答豆包、DeepSeek 那部分。这也是全文幻觉风险最高的一节——中文互联网上关于这些产品内部实现的文章,大量是猜测和洗稿。

先给一个诚实的量化。把「七个环节 × 各家产品」逐格统计:

层级 可评估格子 有一手证据 只有间接证据 查不到
云平台 / 开发者 API 层 117 38(32%) 22(19%) 57(49%)
C 端 App 层 49 2(4%) 12(24%) 35(71%)
合计 166 40(24%) 34(20%) 92(55%)

这个数字本身就是结论:任何一篇声称完整讲清楚了豆包 / 元宝 / 文心内部怎么跑的中文文章,都在编。

3.1 必须先分清的三条链路

以 DeepSeek 为例,它有三条完全不同的链路,混为一谈就必错:

  1. DeepSeek 官方 App / 网页版 → 打到一个未公开的第三方搜索 API
  2. DeepSeek 官方 API根本不提供联网搜索
  3. 云厂商托管的 DeepSeek → 用的是该云厂商自己的搜索,与 DeepSeek 公司无关

第 2 条有官方原文:2024 年 12 月的官方公告写着「目前,API 暂不支持搜索功能。」截至 2026 年 7 月复核,官方文档目录里依然没有任何联网搜索工具。

第 1 条也有官方原文,来自 DeepSeek 自己的英文隐私政策:

我们集成第三方 API 来提供搜索服务,我们会共享你输入的关键词以提供这些服务。

这一句同时透露两件事:DeepSeek 没有自建搜索索引;传给第三方的是「关键词」而不是原始提问——侧面印证了改写环节的存在。至于第三方是谁,查不到。我核查了 DeepSeek 官方公示的第三方共享清单,8 项全是登录、风控类 SDK,没有任何搜索服务商。

DeepSeek 官方对改写策略的唯一公开描述是:「面对用户的复杂问题,模型将自动提取多个关键词并行搜索。」

3.2 「豆包用抖音短视频」这个说法要打个折

这条流传极广。而官方的资源明细表写的是抖音百科词条,不是短视频库。

火山方舟的官方参数注释逐字是:"douyin":抖音百科 / "moji":墨迹天气 / "toutiao":头条图文。资源说明那一栏更明确:「抖音 app 提供的 tob 合规的百科词条」(tob 是「to B」的省写,意思是「面向企业客户的」)。这一条我们用两条独立材料交叉验证过——官方页面的历史归档快照,以及火山引擎自己的开源 SDK 源码(sources: Literal["toutiao", "douyin", "moji", "search_engine"])。

⚠️ 但要诚实说清楚一件事,否则这个纠正会被一句话打穿:同一份官方文档的开头概述段,确实写了「视频资源」——原文是「支持实时搜索互联网公开域网页资源和字节系的图文、视频资源」「支持查看大模型引用的原文链接或视频视频化解读用户问题」。

所以准确的说法不是「官方文档里根本没提视频」,而是:官方的资源明细表把「抖音资源」定义为百科词条,同页概述段另有笼统的「视频资源」表述,两者没有打通。

计费页则顺带给出了另一个独立于「百科还是视频」之外的商业事实——字节自己给这些内容源标了价:

内容源 价格
联网资源(公开网页) 每月免费 2 万次,超出 4 元/千次
头条资源(今日头条图文) 6 元/千次
抖音资源(抖音百科) 6 元/千次

字节把自家封闭内容定价为公开网页的 1.5 倍,且公开网页有免费额度而自家内容没有。

⚠️ 但别过度解读这个价差:授权内容要跟内容方分账,公开网页抓取不用,所以差价完全可能只反映成本结构,推不出「自家内容更有分量」。

而「豆包 App 的联网搜索 = 头条搜索索引」这个说法,没有找到任何一手证据。能查到的只是「火山方舟平台上有一个卖给企业客户的头条搜索插件」,从它推到豆包 App 的内部链路,是一步推断,不是证据。

3.3 真正的发现:厂商把排序信号写在了 API 文档里

这是本次调研最有价值的一条,它推翻了「中国 AI 搜索排序完全黑盒」的说法。

核心洞察:厂商在面向站长的平台上什么都不说,但在把搜索能力当 API 卖的时候,必须把排序信号写进文档——否则客户没法用。

字节公开了一份《站点权威度分级说明》,逐条列出什么样的站点算「非常权威」:

站点类型 官方规则
政府网站 gov.cn 的各级网站
官方机构 组织机构、公立医院(二甲及以上)、公立博物馆
央媒 人民网、新华网、央视网、光明网、央广网等
大学院校 全国 985/211 大学官网
新闻门户中的认证账号 今日头条、腾讯新闻、网易新闻、搜狐新闻、新浪新闻五大门户中,认证类型为「新闻媒体/国家机构」的账号发文
头部企业官网 世界 500 强、中国 500 强

而且这个权威度能被客户当过滤器用——调用方可以直接指定「只给我非常权威的结果」。

意味着:如果你的内容不在上面那张表里,在这条链路上你会被整段过滤掉。

百度千帆的 AI Search API 直接返回两个分数:

字段 官方描述
rerank_score 原文片段相关性评分,取值 [0,1]
authority_score 网页权威性评分,取值 [0,1]

这两个字段回答了一个关键问题:排序至少看两件互不相干的事——内容跟问题有多相关,以及你这个站点本身有多权威。

「互不相干」是重点:内容写得再对题,站点不够权威也可能被压下去;反过来站点再权威,内容不对题一样没用。

3.4 模型实际「读」到的是什么

字节的响应字段说明里有一段话,应该被每个做内容的人看到:

对照另外两家:百度是「2000 字以内的相关信息原文片段」,阿里是正文上限 3000 字符。三家量级一致。

推论(这是推论,不是厂商声明):模型看到的不是你的 meta description(网页 HTML 里那段写给搜索引擎看的简介),也不是首段,而是正文里跟用户提问最相关的那 500~1000 字。所以传统 SEO 那套「把关键词堆进标题和描述」在这条链路上收益很低;正文里针对某个具体问题写清楚、写完整的一段,才是被抽出来的东西。

3.5 内容孤岛:一次 10 秒就能复现的实测

我直接抓取了各平台的 robots.txt(平台自己发布的一手声明,任何人都能复现)。结果推翻了两个流传很广的说法,也确认了一个:

平台 对 AI 爬虫 结论
微信公众号 全封闭(Disallow: / 🔒 最封闭——这也是腾讯元宝「能搜公众号」这个差异化在结构上真实成立的原因
百家号 除百度自家爬虫外全禁 🔒 百度独占
小红书 一个 AI 爬虫都没列,全部落入全禁 推翻「小红书对 AI 半开放」
知乎 未列名任何 AI 爬虫;且专门写了一条禁止 Google-Extended ⚠️ 搜索开放 / AI 封闭
微博 列名放行了主流 AI 爬虫(含 OAI-SearchBot、ChatGPT-User、DeepSeek、Kimi、Doubao 等),但只开放少数几个路径 ⚠️ 分级开放
抖音 明确列名放行 GPTBot、OAI-SearchBot、PerplexityBot、deepseekbot 等 推翻「抖音对 AI 完全封闭」
快手 同上,白名单式放行 ✅ 比传说中开放
今日头条 正文路径 /item//group/所有人关闭 🔒 正文封闭,但字节自己按 6 元/千次外卖
B 站 / 掘金 / CSDN 无特殊限制 ✅ 最开放
中国各平台对 AI 爬虫的开放度实测。最反直觉的两条:短视频平台(抖音、快手)明确列名放行主流 AI 爬虫,而小红书一个都没列。

⚠️ 重要限定:robots.txt 只约束守规矩的爬虫,且不代表实际索引状况。它能证明「谁明确关门」,不能证明「谁一定进不去」——字节把头条内容卖给方舟客户,就完全绕开了 robots 这一层。

3.6 中国有没有官方的「GEO 规则」?没有,而且是穷举确认过的

我对百度做了穷举核查:拉取搜索学堂全部 28 个分类、去重 1543 篇文档,加上 300 条平台公告,扫描「AI 搜索 / 大模型 / 生成式 / GPTBot」等关键词。

结果:1543 篇文档中,没有一篇讲 AI 搜索的抓取或引用规则。 平台公告 300 条,标题中无一条涉及 AI。llms.txtai.txt 之类的路径全部返回 404。

llms.txt 是一个社区提案:在网站根目录放一个专门写给 AI 读的说明文件。它到底有没有用,§5.4b 有完整答案——剧透:没有,而且没有任何一家主流引擎承认读它。)

所以:截至 2026 年 7 月,中国不存在类似 llms.txt 的机制,让内容方单独控制「被 AI 引用」而不影响普通收录。

由此推出一个判断:市面上所有中文 GEO 方法论(各类白皮书、「AI 引用率提升 X%」)在证据等级上一律是最低档——它们是服务商基于传统 SEO 经验对检索原理的逆向推测,没有任何平台官方背书

正确的做法不是去找「GEO 白皮书」,而是去读厂商卖搜索 API 时写的字段文档。 那里面才有可核查的一手信息。


4. AI 到底怎么选

现在到最后一个问题:一堆网页塞进模型之后,它凭什么挑中其中几条?

答案是:「选」不发生在一个地方,而是发生在至少五个地方,而且这几个地方的逻辑会互相打架。

① 改写问题时选  →  ② 召回时选  →  ③ 重排时选  →  ④ 排进上下文时选顺序  →  ⑤ 生成时选引用

只优化其中一环,可能在另一环把自己搞掉。这不是理论——后面第 5 节会看到实测数据。

4.1 检索这一侧:你的页面得先「像一篇好答案」

这里有个反直觉的机制,叫 HyDE:系统先让大模型凭空写一篇假想的理想答案,再拿这篇假文章去检索真实网页。

embedding / 向量:把一段文字变成一串数字,意思相近的文字数字也接近。检索时比的是数字之间的距离,而不是字面是否一样。)

含义:向量检索对齐的目标不是用户那句短问句,而是「一篇理想答案长什么样」。你的页面越像一篇写得好的完整答案,越容易命中。

但另一半同样重要。Anthropic 官方工程博客做过一组干净的对照实验(衡量「前 20 条结果里没有正确答案」的失败率):

配置 失败率 相对下降
基线 5.7%
加上下文的向量检索 3.7% −35%
再加词面匹配(BM25) 2.9% −49%
再加重排 1.9% −67%

官方给的理由是:向量模型擅长语义关系,但「会漏掉关键的精确匹配」。

BM25:一种经典的「按字面对得上不对得上」打分方法。搜「iPhone 17 Pro」时,页面里有没有这串字符,它说了算。)

对写内容的人:向量检索不会帮你补上你没写的词。 产品型号、错误码、法条编号、人名地名的精确写法只能靠字面匹配命中。同义改写救不了「页面里根本没出现这个字符串」。

4.2 切块:你控制不了别人怎么切你的文章

系统不会整篇喂给模型,而是把文章切成小块(chunk)再检索。切法有很多种,而你无法控制第三方用哪一种

有意思的是,工业界为此专门发明了两套补救技术:一套是在建索引前让大模型给每个小块加一句「这段在全文里是干什么的」前缀;另一套是先把全文编码完,在压缩成向量之前才切

这两套技术存在本身,就是证据:说明「小块脱离全文之后看不懂」是主要失败模式。

而你唯一能控制的是:让每一段本身就是自足的。一段里有完整主语(不是「它」「该产品」)、完整限定条件、完整结论——那么无论对方用哪种切法都成立。

4.3 生成这一侧:位置偏置是全篇证据最强的机制

有一篇论文叫《Lost in the Middle》(迷失在中间),发表在 TACL 期刊上,结论是:

「当相关信息出现在输入上下文的开头或结尾时,性能通常最高;而当模型必须访问长上下文中间的相关信息时,性能显著下降,即便是那些明确宣称支持长上下文的模型也一样。」

也就是一条 U 形曲线:首尾高,中间塌陷。

这个结论在 2024–2026 年被三个方向的后续工作强化而非推翻:机制被定位到注意力层面;现象被命名为「注意力盆地」;一篇 2026 年 6 月的论文开篇仍然认定这个问题尚未解决

还有一个被忽略的层次。2026 年才有研究直接测了文档内部的位置偏置,发现向量模型「早段被过度代表,后段被边缘化」,机制是「向量池化时的注意力分布前置化」。

这里必须把两种「位置」分开,否则会得出错误的结论。

第一种是「文档之间」的位置——你的网页在模型上下文里排第几。前面说的 U 形曲线、以及重排环节的偏置,都属于这一种。 第二种是「文档内部」的位置——你的关键结论写在文章的哪一段。刚说的向量编码前置化属于这一种。

这两种偏置不在同一个坐标轴上,不能相加,更不能相乘。(我没有找到任何同时测量这几段复合效应的实验,所以也不该断言它们会叠加。)

分开之后,能推出的建议其实是两条,而且性质完全不同:

这也正是本文反复说的那件事:位置极其重要,但重要的那部分你多半动不了。

⚠️ 那篇研究还有一个不舒服的附带发现:非英语内容在同一份文档里会被系统性边缘化。 对中文站点做多语言页面时,这是个真实的可发现性风险。

4.4 模型对内容特征的偏好:三份研究,结论互相打架

这是最容易被 GEO 营销文章歪曲的一块。我把三份研究并排放,因为不一致本身就是结论

研究 A(ACL 2024):构建了一个「有争议问题 + 结论相反的证据文档」数据集做反事实实验,结论是:

「现有模型严重依赖网页与问题的相关性,而基本忽略人类看重的风格特征,比如文章里有没有科学引用、语气是否中立。」

研究 B(KDD 2024,就是那篇著名的 GEO 论文):说加引语能提升 41%、加统计数字 +30.6%、标注来源 +27.5%(这几个数是用论文 Table 1 的原始值除出来的:27.2、25.2、24.6 各自比基线 19.3)。

研究 C(SIGIR 2026):设计严格得多——252,000 次配对试验,6 个大模型,每次只让两个候选文档在 18 个因子中的一个上有差异,还做了品牌匿名和顺序对照来剥离位置偏置。结果分三层:

① 门槛因子(缺任何一条几乎归零,六个模型一致):主题是否匹配、有没有提到价格、时间戳新旧、在列表里的位置

② 强区分因子:含规格参数、含问题里的原词、语气确定而非含糊、有证据、覆盖深、有对比。

③ 效果微弱的(最反直觉的一条)排版是否结构化——多数模型上不显著。作者原话:「格式类修改在优化投入上的回报极小。

怎么调和?这一点不需要我推测——两篇论文的作者自己说了。

研究 A 的作者在论文讨论章节里直接点名了那篇 GEO 论文,原文是:

「我们的反事实扰动也可以用于搜索引擎优化式的用途,来提高某个产品或公司在检索增强大模型答案中被提及的频率。事实上,同期工作已经探索过这类想法(Aggarwal 等人,2023),他们的目标是优化长答案中的『impressions』,即最大化某个特定段落中出现在输出里的词元数量。我们研究的则是模型的答案如何被操纵。

Aggarwal 等人,2023 就是那篇 GEO 论文。也就是说:一个测「答案里复述了谁的字」,一个测「模型最后信了谁」——是两个不同的因变量,两条曲线可以同时成立。

一句话:可信度 ≠ 可见度。

三份研究的共同点是「主题相关性排第一」。但要诚实地指出,它们之间存在一个真实的、尚未解决的矛盾:

关于关键词堆砌,GEO 论文测出来是九种手法里唯一为负的(份额从 19.3 掉到 17.7);而研究 A 把「加入与问题相关的关键词句子」归入相关性扰动组,并测到这一组「对模型有显著的正向效果」。

两篇论文在关键词堆砌上给出了方向相反的结果。 这不是可以糊过去的分歧——所以本文后面说到「关键词堆砌无效」时,会明确限定是「那篇 GEO 论文自己的数据」,而不写成「学界共识」。

至于加引文和统计数字为什么有效,我倾向于这样理解(这是推断,不是论文结论):加具体数字之所以管用,可能不是因为数字显得可信,而是因为具体数字让你的页面和用户的问题多了几个能对上的点,同时也让模型更容易从你这儿直接抠出一句能用的话——它提高的其实是「相关」和「好抽取」,不是「有说服力」。研究 C 里「有规格参数」效应极强、而「权威语气」在 GEO 论文里只排倒数第二,都和这个解释相容。

4.5 一个必须知道的事实:引用本身就不可靠

四份独立研究,三年,两种评测范式:

研究 年份 方法 核心数字
Stanford(Findings of EMNLP 2023) 2023 人工审计 4 个生成式搜索引擎 生成的句子只有 51.5% 被引用完整支持;只有 74.5% 的引用真的支持它所附的句子
ALCE(EMNLP 2023) 2023 自动基准 在 ELI5 数据集上,最好的模型仍有 50% 的时候引用支持不完整
Tow Center / 哥伦比亚新闻评论 2025 1,600 次人工核对,8 个商业产品 综合错误率 超过 60%;最好的 Perplexity 37% 错误,最差的 Grok-3 94%;Grok-3 有 77% 的引用链接指向错误页面
DeepTRACE(Salesforce) 2025 自动审计 + 支持矩阵 引用准确率 40–80%

作者用了一个很准的说法:这些系统有一层「可信的假象」。

而 MIT 的一项预注册随机实验(约 12,000 条查询、80,000 条实时结果)发现:

引用会显著提升用户对生成式 AI 的信任,即使那些链接和引用是错的或者是幻觉出来的。

把这两条放在一起,得到一个不舒服的结论:引用角标的主要功能不是「可验证」,而是制造可信感,而且这种效果不依赖于引用是否正确。

对写内容的人的实际含义:不要指望被引用 = 被完整准确地转述。让核心事实句自带出处和限定条件(「根据 X 2025 年的数据,Y 是 Z」),这样即使被截断转述,关键限定也会跟着走;品牌名和产品名在关键句里写全称,因为你无法保证上下文会被一起带走。


5. 那么 GEO 到底是什么

GEO(Generative Engine Optimization,生成式引擎优化)是最近两年最热的词。把学术源头和商业叙事分开看,会看到一条很清楚的裂缝。

GEO 的证据链只有最上面一格被证实,而且是零和的;中间那一步不但没有正面证据,端到端实测还是负的。右边是更根本的问题:你根本测不准。

5.1 那篇著名论文,到底测了什么

行业里反复引用的「普林斯顿 GEO 论文,可见度提升 40%」,论文是真的——KDD 2024,代码和数据集都开源。

它测的东西和大家以为的不是一回事

它测试了 9 种改写手法,实验设定是:对每个问题从 Google 取前 5 个网页 → 把这 5 篇正文喂给 GPT-3.5 生成带引用的回答 → 看改写其中一篇能让它在回答里占多少字。

论文原始数据(基线 19.3):

手法 位置加权词数
加引语 27.2(+41%)
加统计数字 25.2
提升流畅度 24.7
标注来源 24.6
加技术术语 22.7
简化语言 22.0
权威语气 21.3
加生僻词 20.5
关键词堆砌 17.7(比基线还差)

关键在于这个指标的定义:它衡量的是「在一个已经生成好的回答里,你占了多少字、位置多靠前」。它完全不衡量:你有没有被检索到、用户点没点、有没有流量。

而且所有份额被归一化到总和 = 1——这是一个零和指标

归一化——把一组数字按比例缩放,让它们加起来正好等于 1,也就是换算成「占比」。一旦这么做,你多占一点,别人就必然少一点。这颗螺丝钉很关键:它解释了为什么下面那张表里,排第一的会变成负数,而排第五的能翻倍。)

论文自己的 Table 2 把这件事证明得非常干净。当所有 5 个来源同时优化时,按原本的搜索排名分组看收益(我下载论文原文逐行核对过):

手法 原排第 1 第 2 第 3 第 4 原排第 5
标注来源 −30.3% +2.5% +20.4% +15.5% +115.1%
加引语 −22.9% −7.0% +3.5% +25.1% +99.7%
加统计数字 −20.6% −3.9% +8.1% +10.0% +97.9%

注意这不是个别现象——效果最好的三种手法,全都让原本排第一的网站变负,同时让原本排第五的接近翻倍。

换句话说:GEO 的本质是「排名靠后的人抢排名靠前的人的份额」。一旦大家都做,头部网站是净亏的,整体收益被稀释到零。

这一点几乎没有任何 GEO 服务商在销售材料里提——因为它意味着这个服务的价值会随着客户数量增加而归零。而 NeurIPS 2025 的 C-SEO Bench 用独立实验复现了同一个结论:「随着采用者数量增加,整体收益下降,呈现出拥挤的、零和的性质。」

还有一个细节值得注意:论文确实在 Perplexity 上验证过,但原文写得很清楚——由于 Perplexity 不允许指定来源网址,他们是把 5 篇文本作为文件上传的,禁用了联网。所以验证的仍然是「给定材料内的份额竞争」,不是真实检索链路。

而这组 Perplexity 实验里藏着一个论文自己提供的、很少被人提起的反证:

「标注来源」这个手法,在主实验里的主观印象分(论文的第二个指标:让另一个模型给「这条来源看起来有多重要」打分,区别于前面那个数字数的指标)是 +14%;换到 Perplexity 那一组设定,同一个手法从基线 24.7 掉到 19.0(−23%),是全表唯一的大幅负值。而「关键词堆砌」在主实验里是负的,到了 Perplexity 那组反而涨到 28.1。

同一篇论文、同一种手法,换一个引擎就直接翻号。

这是「GEO 手法跨引擎不稳定」最硬的证据——它不来自任何批评者,就来自这篇被行业当作 GEO 圣经的论文自己的附录。

5.2 端到端跑一遍:只改正文是净负效应

2026 年 2 月有一份预印本(SAGEO Arena)做了一件之前没人做的事:把检索 → 重排 → 生成整条链路都放进评测,而不是假设文档已经在上下文里。

⚠️ 先标清楚它的分量:这是一份尚未经过同行评审的预印本预印本=作者自己先挂到网上的论文稿;同行评审=交给同领域其他专家审过、挑过毛病才发表。前者没经过这道关,可能有错没被发现——这是本文给证据分等级的主要标尺)(arXiv 的 Comments 字段写着 “Work in Progress”,PDF 页眉里还留着没替换掉的会议模板占位符)。它的实验设计是目前最贴近真实链路的,但证据等级低于下面会提到的 NeurIPS 论文,不该并列引用。

结果非常反直觉。以下是论文 Table 2 的平均值(我下载论文原文逐格核对过):

优化方式 检索命中率 重排命中率 最终被引用率
基线 0.58 1.00 0.50
只改正文(10 种 GEO 手法平均) 0.53(−9%) 0.84(−16%) 0.47(−6%
只改结构化字段(标题等) 0.71(+22% 0.83(−17%) 0.52(+2%
两者都改 0.67(+15%) 0.75(−25%) 0.48(−5%

(括号里的百分比是论文表格自己标注的相对变化。表里的命中率只保留了两位小数,所以你拿两位小数自己去除,可能和它标的百分比对不上——以论文标注的为准。)

先看最后一列,这才是这张表真正的头条结论:三种优化范围,没有一种能让最终被引用率明显为正。(−6%、+2%、−5%)

行业讨论这篇论文时几乎只引前两列——「改正文有害、改标题有益」。但把整张表读完会看到,无论你改哪儿,走到最后一步的收益都在零附近。

再看第二行:只改正文,三个阶段全是负的。

原因不难理解:加引语、加统计、改语气这类改写会破坏原文与问题的字面和语义匹配,让你根本进不了候选集。而「进不了候选集」这件事,在只测「已在上下文内」的实验里是看不见的

论文正文的原话是:只改正文「不但没能提升生成阶段的可见度,反而主动损害了检索表现,导致被优化的文档掉出检索结果、根本到不了生成器那里」。

第三行则是最容易被断章取义的一行。

行业里有一种说法是「那就别改正文,改标题和结构化字段就行了」。数据不支持这个简化:只改结构化字段确实让检索 +22%(全表最大的正向格子),但在重排阶段是 −17%,走到最后一步只剩 +2%

⚠️ 还有一个方法论细节必须交代,否则「重排 −16%」会被过度解读:论文注明重排阶段的基线本身就是 1.00(因为目标文档都是从前十候选里挑出来的)。所以那一列是个构造出来的天花板,只能往下掉,不可能上升。不能把它读成「重排环节在惩罚优化」——那是把实验设计当成了实验发现。

论文自己给出的结论是「互补」而不是「替代」:

结构化信息驱动检索,而有信息量的正文仍然是重排和生成阶段的关键因素。」 「有效的优化需要针对每个流水线阶段分别定制。」

换句话说:不存在一个「改这里就行」的位置。 你在某一阶段做的优化,很可能在另一阶段把自己搞掉——这正是本文开头那张七道关卡图想说的事。

另一篇 NeurIPS 2025 的基准(C-SEO Bench)在多领域、多竞争者条件下测了 10 种手法,结论更直接:

当前大多数对话式 SEO 方法不仅基本无效,而且经常对文档排名产生负面影响,与预期相反。」 「随着采用者数量增加,整体收益下降,呈现出拥挤的、零和的性质。」

54 个「手法 × 领域」组合中,只有 3 个的排名提升在统计上显著。

统计上显著——测出来的差别大到不太可能是碰巧造成的。反过来说,不显著就等于「和没做过没区别」。这是本文判断证据强弱的通用尺子,后面还会反复用到。) 而且这 3 个例外的位置很说明问题:全部集中在商品推荐任务的零售与游戏两个领域,问答任务上一个都没有。论文同时发现:传统 SEO 手段明显比专门的 GEO 手段更有效。

⚠️ 这里要给一个反向的诚实交代,否则我自己就成了选择性引用。有一篇 2026 年的批判性综述专门警告过两个方向相反的误引——它在批评「把 40% 说成能在 ChatGPT 里排第一」的同一段,紧接着写道:

反过来,Puerto 等人(即 C-SEO Bench)的相反发现,有时也被当作对 GEO 的驳斥来呈现,尽管他们评估的是一个不同的结果指标。一旦区分开流水线的不同阶段和因果估计对象,这两批证据是可以调和的。」

也就是说:C-SEO Bench 自己跑出来的实验结果是硬的(54 组只有 3 组显著),但不能说「它推翻了那篇 GEO 论文」——两者测的因变量本来就不是一回事(一个测排名变化,一个测答案里占了多少字)。

这两句话我都引,是因为只引前半句而不引后半句,恰恰是这个领域最典型的毛病

5.3 一个必须点名的高频引用错误

GEO 论文测的 9 种手法逐字是:权威语气、加统计数字、关键词堆砌、标注来源、加引语、简化语言、提升流畅度、加生僻词、加技术术语。

其中没有任何一种是「切块」「答案前置」「FAQ 格式」或「多用列表表格」。

拿这篇论文的「+40%」去给 chunk-friendly 写法、答案前置写法背书,是引错了论文。这是这个领域最高频的引用错误。

5.4 平台官方怎么说:四家否认或沉默,一家承认

厂商 立场
Google 明确否认。官方原文:「要出现在 AI Overviews 或 AI Mode 里,没有额外要求,也不需要其他特殊优化。」「从 Google 搜索的角度,为生成式 AI 搜索做优化就是为搜索体验做优化,因此仍然是 SEO。」
OpenAI 只谈准入,不谈排序。全部可操作建议就一条:别屏蔽 OAI-SearchBot。选源机制:查不到
Perplexity 只有形容词(「顶级来源」「权威来源」),无任何可操作标准
Anthropic 完全沉默。一个字都没提如何挑选或排序引用来源
Microsoft 唯一实质承认的:grounding「在其上增加了一个新的优化层」,「这些模块化的内容片段才是被排序的对象」,并把 GEO 工具写进了 Bing 站长工具路线图。但同一批文章也说「并不存在被 AI 选中的秘密策略

净结论:没有任何一家承认存在你能买、能刷、能稳定占住的固定位次。

有一个时间点很说明问题:Google 在 2026 年 5 月 15 日专门上线了一份官方指南,其更新日志逐字写明目的是「破除常见的 AEO/GEO 迷思」。

它的「不用做」清单直接点名:

别做 官方原话
llms.txt 及各种「AI 专用」文件 「你不需要创建新的机器可读文件、AI 文本文件或标记……Google 搜索会忽略它们。
为 AI 做内容切块 「没有必要把内容切成小块来让 AI 更好理解……不存在理想的页面长度。
为 AI 专门改写文风 「你不需要为生成式 AI 搜索用特定方式写作。」
刷「品牌提及」 「在全网寻求不真实的『提及』,并没有看上去那么有用。」
为 AI 堆结构化数据 结构化数据不是生成式 AI 搜索的必需品,也没有你需要添加的特殊 schema 标记。」

关于结构化数据,还有目前唯一一个带对照组的公开实测:追踪 1,885 个新增结构化标记的页面,对照组 4,000 个从未加过的页面,比较前后各 30 天——结果是 Google AI Overviews −4.6%,AI Mode +2.4%,ChatGPT +2.2%,后两者「在统计上与零无法区分」。

5.4b 顺便解开 llms.txt 这个误会

llms.txt 是流传最广的一个「AI 优化」做法:在网站根目录放一个给 AI 读的说明文件。

事实是:它是一个 2024 年 9 月提出的社区提案,而提案网站自己从来没有声称任何搜索引擎或大模型厂商支持它。 Google 官方文档里的措辞是「既不会伤害也不会帮助你的可见度或排名,因为 Google 搜索会忽略它们」。OpenAI、Anthropic、Perplexity、微软的官方爬虫文档里,则一个字都没提过 llms.txt

那为什么这个说法传得这么广?核验过程中找到了一个很可能的解释:

OpenAI、Anthropic、Perplexity 三家自己的开发者文档站,都放了 llms.txt(这三个文件都是真实存在的,可以直接打开看。)

从业者看到「AI 公司自己都在放这个文件」,很自然地推论「那它们一定会读别人的」。

发布 ≠ 消费。那些文件的用途是让 Cursor、Claude Code 这类编程助手在写代码时方便地读取它们自家的 API 文档,和「你的网站能不能被 AI 搜索引用」是两件毫不相干的事。

5.5 最关键的一击:你根本测不准

这是本文主论点所在。

瑞士圣加仑大学(非厂商)做了一项研究,测的是同一个问题问多次,AI 引用的来源有多稳定

24 小时之内重复提问同一个问题,两次回答引用来源的重合度:

引擎 来源重合度(Jaccard)
ChatGPT 0.233
Perplexity 0.282
Google AI Mode 0.318
Gemini 0.505

Jaccard 相似度:两个集合重叠的比例。0.233 意味着两次回答引用的来源里,只有约 23% 是重合的——约 77% 每次都在变。)

⚠️ 这张表有一个限定,而它让结论更强而不是更弱:论文注明,来源相似度的计算已经排除了「零引用」的那些运行。也就是说,0.233 是在「两次都真的联网并给出了引用」的前提下算出来的。

因为同一篇论文还有一个更狠的数字:

ChatGPT 只对特定查询启动网页搜索,导致它 57.8% 的运行(指每一次提问)返回零引用。

超过一半的提问根本不触发检索。 此时答案来自模型参数里的记忆——你今天改网页对它没有任何影响,要等下一次训练更新。这一层是所有 GEO 手段完全够不着的。

把这几条合起来: - 任何「单次快照」型的 AI 可见度报告,都是从一个方差极大的分布里抽了一个样本,然后当成排名报给客户。 - 客户看到的「这周我们从第 5 升到第 3」,在统计上大概率是噪声

所以本文的核心判断是:AI 搜索真正改变的不是优化手段(Google 说得对,那还是 SEO),而是可观测性。「优化 → 测量 → 迭代」这个 SEO 赖以成立的闭环,在 AI 搜索上是断的。GEO 行业卖的,很大程度上是这个断掉的闭环的幻觉。

但要给一个反向平衡,避免矫枉过正:另一项研究(43,000+ 关键词,每个至少 16 次观测)发现,AI 摘要虽然网址层面极不稳定(约 45.5% 的来源是全新的),但语义层面相当稳定(余弦相似度 0.95——这个数越接近 1 表示「说的意思越是同一回事」,0.95 属于非常接近)。

实践含义:以「我这个网址被引了没有」为考核指标,几乎全是噪声;以「这一类问题的答案里,我这个品牌在不在候选集里」为指标,信噪比要好得多——但仍需重复采样。


6. 所以到底该做什么

按证据强度排序。只有第一组有官方背书加实证支持。

第 1 组:有证据,该做(本质是「别把门锁上」)

  1. 确认 robots.txt 里没有屏蔽 OAI-SearchBot / PerplexityBot / Claude-SearchBot / Googlebot / bingbot。特别注意别把「训练爬虫」和「搜索爬虫」一起屏蔽——它们是两个独立开关
  2. 确认页面能被索引、能出摘要(Google 明说这是被 AI Overviews 引用的前提条件)
  3. 确认没有全站打 NOARCHIVE(Bing 侧会直接从 Copilot 答案里消失)
  4. Google Search Console 里确认没关掉生成式 AI 开关

这一组唯一的量化实证也在这里:一项研究实测发现,屏蔽了 Google AI 爬虫的网站,被 AI Overviews 检索到的概率显著更低

这是本次调研中找到的、关于「GEO 手段有因果效应」最扎实的一条证据——而它的内容恰恰是「别把爬虫挡在门外」,不是任何写作技巧。

第 2 组:有条件证据,可做但别高估

  1. 标题和结构化字段优化——注意三点:这其实就是经典 SEO 的标题优化;它只在检索阶段有效(检索 +22%,是全表最大的正向格子),同一实验里重排阶段是 −17%、走到最后的被引用率只剩 +2%;⚠️ 而且该实验是尚未同行评审的预印本,证据等级低于下面第 6 条
  2. 提高内容与问题的主题相关性(三项独立研究一致把它排第一)
  3. 写出真实的数字、规格、参数(证据中到强,但以真实为前提
  4. 一个页面聚焦一个主题,不要一页覆盖所有相关问题
  5. 每段写成能脱离全文单独读懂的自足单元(有完整主语、完整限定、完整结论)
  6. 用查询里会真实出现的原词(型号、错误码、法条号的精确写法),但不堆砌——堆砌在 GEO 论文自己的数据里是唯一为负的手法
  7. 时效性内容加上可见的更新时间,但真更新了才改时间
  8. 做 Bing SEO——Copilot 走 Bing 索引,而且 Bing 是唯一给了官方 AI 引用数据工具的(其中的「Grounding queries」指标是目前唯一由主流 AI 搜索方直接向站长开放的「改写后的查询」数据)

第 2.5 组:有强相关性、无因果证据

  1. 争取真实的第三方提及(包括无链接的提及)。一项 75,000 个品牌的研究发现,无链接的品牌提及与 AI 露出的相关性达 0.664,远高于外链的 0.218

0.664 和 0.218 是「相关系数」:范围 0 到 1,越接近 1 表示两件事越是一起涨一起跌。0.664 算比较强的同步,0.218 算很弱。)

这是本次调研中与传统 SEO 直觉差异最大的一条。⚠️ 但有五个限制,不说清楚就很容易推出过头的结论:

  1. 这只是「一起出现」,不是「因为所以」。 作者自己在文章里就写了「相关不等于因果」。
  2. 这两个数字其实不是用同一把尺子量的。 按这份研究自己的说明,「品牌提及」统计的范围是某一个关键词上的表现,而「外链」统计的是整个域名的。范围不一样,把两个数并排比高低,本身就不公平。
  3. 样本只挑了大品牌。 入选条件是「域名权重 40 以上、且最热门的那个关键词每月至少被搜 800 次」——小品牌一开始就被筛掉了。在一堆本来就有名的品牌里,「全网提到你多少次」和「AI 摘要提到你多少次」,很可能测的是同一件事:你到底有多有名。也就是说这 0.664 里,有多少其实是「名气跟名气自己相关」,这份研究没法拆开,也没有尝试拆。
  4. 发布方是卖 AI 可见度监测工具的公司,有利益关系。
  5. 找不到任何因果实验——没有人做过「让一批品牌增加提及、另一批不变,再看结果」这样的对照试验。

正确的执行方式是公关和产品口碑,不是刷提及——Google 明确点名「不真实的提及」无效。

第 3 组:没有证据,别花钱

别做 原因
llms.txt Google 明确说不读,其余四家无任何表态
为 AI 专门加结构化数据 Google 说不需要;唯一的对照实验测到 AI Overviews −4.6%
「权威语气」改写 综述评为不稳定,且与准确性冲突
在页面里嵌入给 AI 看的隐藏指令 这是学术上被归类为攻击的行为,命中 Google 的隐藏文本条款可致人工处罚、完全移出搜索;而且真实链路里多数已被过滤——高风险低回报

单独说一条:关键词堆砌

它不属于上面任何一组,因为它的证据状况和其他几条不一样

所以严格讲,这一条学界没有共识,把它归进「没有证据」是不准确的——有证据,只是方向相反。

但结论仍然是别做,理由换一个:它是 Google 明令禁止的垃圾手法,写进了官方的垃圾内容政策,可能招致人工处罚。

不做的理由是合规风险,不是「没效果」。 这两件事应该分开说。

一条必须说出口的伦理边界

所有「提高被引概率」的技术都是双向的:让真实优质内容更容易被引用的机制,与让虚假内容更容易被引用的机制是同一套

有研究实测:一个被污染的页面就能让最高 27% 的推荐被骗;替换掉前三条结果时升至 73.8%。而且模型会自己编造「大家都说好」这类理由(比如凭空生成一句「用户普遍反映」)来给这个假推荐背书。

所以建议链条应当止步于「让真实内容更容易被机器理解」,而不能延伸到「让内容更有说服力」那一侧。后者与投毒之间没有技术边界,只有意图边界。


7. 一个意外发现:这个领域本身被污染得很厉害

最后说一件调研过程中的事,它可能比上面任何一条结论都实用。

本次调研派了多个独立的调查员,他们互不通气,却各自撞上了同一个现象:GEO / SEO 领域的二手内容里,编造论文、编造机构、编造百分比的密度异常高

具体到可以点名的程度:

而真实数据的方向和流行叙事相反:实测 Reddit 占比是 ChatGPT 约 1.8–2.4%、AI Overviews 约 2.2–7.4%、Perplexity 约 6.6%。皮尤研究中心用 900 名美国成年人的真实浏览行为(68,879 次搜索)测得,维基百科 + YouTube + Reddit 合计只占 AI 摘要来源的 15%,而普通搜索结果是 17%——几乎无差别

这些假引用会互相转载,形成「共识假象」。

所以最实用的一条建议是:看到任何 GEO 数字,第一件事是点开链接。而且 HTTP 200 不等于内容对得上——要核对页面标题和正文是不是真的讲了那件事。

7.1 一个现场演示:我把这个问题交给了 AI 搜索

写到这里,我做了一件顺手的事:用一个真实的 AI 搜索工具(Google 搜索接地)问了一句中文——「生成式引擎优化 GEO 到底有没有效果 实证研究」。

它给了一份条理清晰、看起来很专业的回答。而这份回答,几乎逐条踩中了本文核验出来的每一个错误

AI 的回答 实际情况
引用来源(Cite Sources)是最有效的策略,能使可见度提升 40% 以上 论文里最有效的是加引语(+41%)。「标注来源」是 +27%,排第四。数字张冠李戴了
「提升被 AI 引用并作为答案来源的概率 那个指标是答案里的字数份额,不是概率。这正是本文 §5.1 说的最典型误读
「低排名网站的逆袭……GEO 为中小网站提供了绕过传统权重壁垒的机会」 零和说成了单赢。论文数据里排第五的确实 +115%,但同一张表上排第一的 −30.3%——那是从别人那里抢来的,不是凭空多出来的
论文出自「普林斯顿大学、佐治亚理工学院 作者单位是印度理工德里分校 + 普林斯顿 + 独立研究者。没有佐治亚理工
「针对 10,000 个查询进行了实验」 数据集是 10,000 条,但结果只在其中 1,000 条的测试集上跑
结构化数据:使用 Schema 标记帮助 AI 理解」 与 Google 官方明确否认冲突,也与唯一一个带对照组的实测冲突(该实测测到 AI Overviews −4.6%)
「GEO 不仅有效,而且是未来 3-5 年内容营销的必经之路 无证据的断言

而 C-SEO Bench、SAGEO Arena 这些反证,以及「零和」这个论文自己写明的性质,它一条都没提

然后我又用英文问了同一个问题,想看看会不会好一点。

英文版确实好一些——它提到了「零和设定」、方法论批评、零点击问题,这些中文版一条都没有。但核心事实依然错:

英文版的回答 实际情况
Statistics Addition (+41%) 是最有效的手法,Quotation Addition (+28%)」 两个数字被错配了。+41% 和 +28% 其实是同一个手法(加引语)在两个不同指标上的成绩,被拆开安到了两个手法头上
「排第一的网站从 GEO 中获得的收益很小(minimal gains) 排第一的是 −30.3%,是负的。把一个负数说成了「微小的收益」——恰好抹掉了零和这个最关键的性质
论文出自「Princeton、Georgia Tech、IIT Delhi、Allen Institute for AI 作者单位只有 IIT Delhi、Princeton 和独立研究者。Georgia Tech 和 Allen Institute 都是编的
「Seer Interactive 研究发现 CTR 下降超过 60%」 这恰好是本次调研中因为该站点拒绝抓取、无法核实而被明确弃用的一个来源

最值得注意的是第三行:中文版说「普林斯顿、佐治亚理工」,英文版说「Princeton、Georgia Tech」——两个语言版本编造了同一个不存在的作者单位。

这说明它不是随机的幻觉,而是语料层面的污染:网上大量二手文章都这么写,AI 只是忠实地复述了这个错误。

还有一个细节,我觉得比上面所有错误都更能说明问题——看它引用了谁

英文版给出了 7 个来源,分别是几家 GEO 服务商的博客、一个内容代理机构、Medium 上的一篇文章。

7 个来源里,没有一个是论文原文,没有一个是 arXiv,没有一个是官方文档。

而这个问题(GEO 到底有没有效果)恰恰是有大量可查论文的——本文引用的那十几篇,每一篇都公开可下载。

⚠️ 诚实标注这个观察的边界:这是各一次采样,而本文 §5.5 刚刚论证过单次采样方差极大;它只反映 Google 搜索接地这一条链路,不能外推到 ChatGPT 或豆包。

但它踩中的是事实错误,不是抽样波动——上面每一条我都能指出正确答案在论文的哪一张表里。

这就是本文最后想说的那件事:AI 搜索会忠实地复述网上流传最广的说法。而在 GEO 这个话题上,流传最广的说法恰恰是错的。

于是形成一个闭环:错误的二手内容 → 被 AI 检索到 → 被 AI 复述得更权威、更有条理 → 被更多人当作答案引用 → 变成更多的二手内容。

这也是为什么本文所有数字都要给出可点开的一手链接——不是为了显得严谨,而是因为在这个具体的题目上,二手信息的错误率高到不做这件事就没法写。


小结

如果只记三句话:

  1. AI 搜索是七道关卡,不是一个动作。 做内容的人真正能动的只有两道:第 ⑦ 道(让爬虫抓得到你)和第 ③ 道(进得了候选集)。市面上大多数 GEO 教程教的是第 ⑥ 道——让模型在已有材料里挑中你——而那一道是零和的。

  2. 优化手段基本没变(还是 SEO),变的是你测不准了。 ChatGPT 同一天问同一个问题,引用来源有约 77% 会变,且超过一半的提问根本不触发联网。任何拿单次快照当排名的报告都应该被怀疑。

  3. 真正可查证的一手材料,藏在你想不到的地方:美国反垄断案的庭审笔录、各家 API 的字段文档、厂商卖搜索能力时的计费页。而不是任何一份「GEO 白皮书」。

最后一句,也是写完这篇之后最深的一个感受:

我在文章末尾把这个问题原样交给了一个真实的 AI 搜索工具,它给出的答案条理清晰、语气笃定,并且几乎每一条都错——因为它忠实复述了网上流传最广的版本。

AI 搜索不会帮你分辨真假,它会把大多数人的说法讲得更像真的。 这既是本文所有数字都必须给出一手链接的原因,也是「AI 搜索时代该怎么做内容」这个问题最诚实的答案:先保证你写的是对的,因为错的东西同样会被高效地传播出去。


附:主要出处

本文写作方式是先派多个互不通气的调查员分头取证,每条主张按证据强度分三档标注,再做一轮交叉核验。以下是关键出处,均可点开核对。

法庭文件(美国司法部诉 Google 案,公开证据)

⚠️ 取证提示:justice.gov 对自动化抓取工具返回 403,但对带正常浏览器标识的 curl 返回 200。只用浏览器工具会误以为这批文件拿不到。

平台官方文档

中国厂商文档

学术论文(标题、作者、年份、发表处均已逐一核对)

第三方实测