境迅

2 章 / 共 3

中国五大 AI 平台的信源机制

AI 回答里的引用是从哪儿来的?本章把五个平台的通道结构与一次覆盖五平台的信源实测合成一张图:没有一家给官网开直连,企业官网在被引条目中只占个位数。

境迅研究团队

本章目录

  1. 先问一个前置问题:AI 的答案是从哪儿来的
  2. 通道图:五家没有一家给官网开直连
  3. 被引内容来自哪里:五类信源的真实分布
  4. 平台之间的差别比想象中大
  5. 引用密度与集中度:席位不是一样多的
  6. 三条反直觉的观察
  7. 官网侧仅有的主动通道
  8. 这张图能用来做什么判断
  9. 数据口径与局限

企业开始关心 AI 可见性的时候,提出的第一个问题通常是"怎么让 AI 提到我们"。这个问题没法直接回答,因为它跳过了一个前置问题:AI 在回答关于你的问题时,它引用的内容是从哪儿来的?

这一章讲的就是这个前置问题。内容分两部分:一部分是各平台公开可查的机制事实——谁有自己的爬虫、谁借用谁的索引、站长有没有提交入口;另一部分是一次信源结构的实测——把五个平台的回答里实际出现的引用条目拆开,看它们分别来自什么类型的站点。

这两部分合起来,构成一张通道图。有了这张图,"怎么让 AI 提到我们"才变成一个可以讨论的问题。

先问一个前置问题:AI 的答案是从哪儿来的

生成式回答里出现的信息,大体有两个来源:模型训练时固化在参数里的知识,以及回答当下通过联网检索取回的内容。对企业可见性有操作意义的是后者——训练数据的截止时间与更新周期不受任何企业控制,而联网检索取回的是当前网络上存在的页面。

于是问题变成:这些平台联网检索的时候,检索的是谁的索引?

这个问题的答案决定了后续所有动作的方向。如果一个平台有自己的爬虫和索引,企业至少有一条可以主动作用的路径;如果它外采第三方的检索能力,那么企业能做的事情就完全不同了。

通道图:五家没有一家给官网开直连

先看五个主流平台的通道结构。下表内容为各平台公开渠道可查的机制事实:

平台自有爬虫索引来源站长可主动提交自家生态偏好
豆包同集团搜索的自有索引 + 自家内容生态有(集团搜索站长平台)最强
腾讯元宝借道同集团搜索与社交内搜有(该搜索的站长平台)
通义千问借道同集团的两个搜索产品有(对应站长平台)
DeepSeek外采第三方检索 API无任何入口无自有生态
Kimi内置检索工具,外采为主无任何入口无自有生态

这张表最需要注意的是最后两行。DeepSeek 与 Kimi 没有自己的爬虫、没有自己的索引、没有站长平台。这意味着在官网侧,不存在任何技术手段可以直接影响它们——唯一的路径是被它们外采的检索服务收录。企业如果把预算投在"针对某个平台做官网技术优化"上,对这两个平台是完全落空的。

由此得出本章第一个结论,也是最容易被服务商话术绕过去的一个:

五家平台没有一家提供"读你的官网 → 直接进我的引用池"的独立通道。全部借道搜索索引。官网必须先被搜索引擎正常收录,才谈得上被 AI 引用。

换句话说,在通道层面上,所谓"AI 优化"没有绕开搜索引擎收录的独立路径。被搜索引擎正常收录是准入门槛,不是可选项。区别只在于优化的目标不同——传统搜索优化的是"排在第几位",生成式场景优化的是"被摘出来当答案的那一段"。前者仍然是后者的前提。

被引内容来自哪里:五类信源的真实分布

机制事实说明了通道,但没有回答权重问题:实际被引用的内容,主要来自什么类型的站点?

下面这组数字来自一次覆盖五个平台的信源结构测量。口径写在本章末节,先看结果——把全部被引条目按信源类型归为六类:

信源类型占比
垂类专业媒体45.3%
综合新闻门户18.6%
平台生态内的用户内容15.9%
未分类长尾13.3%
企业独立官网4.4%
权威机构(监管、交易所等)2.5%

三点值得读一读。

第一,主导者是垂类专业媒体,不是平台自家的用户内容。这与行业里流传的"生态内容压倒一切"的说法不一致。垂类专业媒体 45.3% 加上综合新闻门户 18.6%,合计 63.9% 是媒体主导;平台生态内的用户内容只有 15.9%。

第二,企业官网的真实权重是个位数。4.4%。这个数字对很多企业是个意外,也常常被理解为"那官网就不用做了"。这个推论是错的,但它错在什么地方需要说清楚——见本章第七节。

第三,权威机构信源只有 2.5%,但它的性质不同。占比低不等于价值低:监管机构、交易所的公开披露文件被引用时,它承载的是不可替代的权威确认功能。在样本中还观察到一个具体现象——合规披露类文件确实进入了引用池,而它对企业是零成本的既有资产。

平台之间的差别比想象中大

把同一组数据按平台拆开,会看到一件比总量分布更有操作意义的事:五个平台的信源偏好差异极大,不能当成同一个对象处理。

平台生态用户内容垂类媒体新闻门户企业官网权威机构长尾
豆包34.0%34.9%15.6%5.4%2.5%7.6%
DeepSeek0.3%53.2%16.7%5.3%2.7%21.8%
通义千问3.1%69.8%9.7%1.9%2.7%12.8%
腾讯元宝14.3%24.6%42.2%4.1%1.6%13.2%
Kimi10.2%42.6%23.4%4.2%2.1%17.4%

逐行读出来的事实:

  • 豆包是唯一生态偏好显著的平台——自家内容生态占到 34.0%。在这个平台上,自家生态的权重与垂类媒体几乎持平。
  • DeepSeek 几乎完全不碰平台型用户内容(0.3%),超过一半的引用来自垂类专业媒体。它的信源质量门槛是五家里最高的。
  • 通义千问最集中——垂类媒体接近七成,信源池最窄,也因此最容易预测。
  • 腾讯元宝偏综合门户(42.2%),与其他四家的形状明显不同。
  • 企业官网在所有平台都是个位数,区间 1.9% 至 5.4%,平台间差异不大。官网不是任何一家的主要信源。

这张矩阵的实际含义是:"提升 AI 可见性"不是一个单一动作。同一份资源投在不同平台上,回报结构完全不同——面向 DeepSeek 与千问的路径和面向豆包的路径,几乎是两件事。任何把五个平台当成一个整体来承诺的方案,都跳过了这张表。

引用密度与集中度:席位不是一样多的

还有两个结构性事实,决定了"挤进去"这件事的难度。

其一,各平台每次回答给出的信源数量差异很大。同一批问题下,平均每次回答引用的信源数:

平台平均每次回答引用信源数
豆包16.3
通义千问8.8
DeepSeek7.9
腾讯元宝5.1
Kimi4.7

豆包一次回答给出的引用位是 Kimi 的 3.5 倍。用一个比喻:豆包席位多、门槛相对低,Kimi 席位少、竞争更烈。这直接决定了对不同平台应当有不同的预期——用同一个预期去衡量五个平台,本身就是方法错误。

其二,信源池的头部高度集中。在这次测量的样本里:

  • 排名前 10 的域名覆盖了 52.1% 的被引条目;
  • 前 50 覆盖 81.0%;
  • 而全部去重域名中,有近三分之二只出现过一次。

这条集中度曲线说明:被引用的机会不是均匀分布的。少数高频域名占掉了大半席位,长尾里挤着大量只被引用过一次的站点。进入头部信源名单的价值,远大于在长尾里再增加一个站点。

三条反直觉的观察

在同一次研究中,我们对一批实际被引用过的页面做了技术形态探测,想看看"能被 AI 引用的页面长什么样"。结果与行业普遍说法相反。

观察一:结构化数据不是被引用的必要条件。在探测的样本里,JSON-LD 结构化数据的部署数为零,Open Graph 标签同样为零。市面上流传的"部署 Schema 让引用率提升 X 倍"一类说法,在这批样本里得不到支持。

观察二:正文极短的纯 JS 渲染页面也能被引用。样本中最少的一个页面正文不足百字,且依赖 JS 渲染,仍然出现在引用列表里。合理的解释是:检索侧拿到的内容未必来自页面 HTML 本身,也可能来自搜索引擎已有的索引摘要。

观察三:已经失效的链接仍在被引用。样本中有页面已无法访问,但它的 URL 仍出现在回答的引用列表中。这说明信源池存在滞后——引用的是索引快照,不总是实时页面。

推理边界必须写清楚:以上只能证明结构化数据与服务端渲染不是被引用的必要条件,不能证明它们无用。逻辑上仍然可能是"做了会更好"。可以确定的只有一件事:它们不足以作为效果承诺的技术依据。任何把结构化数据部署与引用率提升画上因果箭头的说法,在这批数据面前都缺少支撑。

这三条观察对企业的实际价值是省钱:它们划掉了几项常被推销、但缺少证据支持的技术投入。这些工作成本低,顺手做不亏,但不该作为付费理由,更不该作为效果预期的依据。

官网侧仅有的主动通道

把前面几节合起来看,官网侧真正能主动做的事其实很少,而且都很朴素。按"有证据支持"到"合理推断"排序:

第一优先级,确保能被搜索引擎正常收录。这是全章唯一被证实的通道前提,也是所有后续动作的门槛。具体是三件事:页面走服务端渲染或静态化,保证 HTML 源码里有完整正文,不依赖 JS 才能看到内容;robots.txt 配置正确,尤其不要误屏蔽前述几家搜索的爬虫;部署 sitemap 并保持有效。

这三件事听上去像十年前的搜索优化常识——它确实就是。第二节的通道图已经说明了原因:五个平台全部借道搜索索引,没有一条例外。

第二优先级,在有入口的站长平台主动提交。这是官网侧仅有的一条主动通道。回看第二节那张表:三家有对应的站长平台可以提交,另外两家没有任何提交入口——对它们,官网侧不存在主动手段,只能等待其外采的检索服务自然收录。这个不对称值得写进任何一份 AI 可见性方案:能主动做的事,只覆盖五个平台中的三个。

第三优先级,页面事实自洽、可独立抽取。每个页面能独立回答一个问题,不依赖上下文才能读懂。这一条与第六节的观察三呼应:引用的往往是索引里的一段快照,而不是完整页面——一段话如果离开上下文就不成立,被摘出来时就会失真。

不建议投入的:为"给 AI 读"专门做的技术改造,例如面向 AI 的独立内容接口或专用渲染层。没有任何一家平台会消费它们。结构化数据一类的低成本项可以顺手做,但如第六节所述,它们不构成效果承诺的技术依据。

这张图能用来做什么判断

回到第三节留下的那个问题:企业官网只占 4.4%,是不是意味着官网不值得做?

不是。但需要把官网的职能重新定位一次。

4.4% 说明的是:官网不是流量入口——指望通过优化官网让 AI 大量引用你的官网,数据不支持这条因果链。但同一份数据也说明了另一件事:剩下 95.6% 的引用来自媒体、门户、生态内容与长尾站点,而这些内容里关于你的事实陈述,需要一个可以校准的源头

这就是官网的真实位置:

  • 权威锚点——当 AI 从各类内容里读到关于你的说法时,官网是它交叉验证的落点;
  • 事实校准源——产品参数、资质、经营数据以官网为准,减少传播链条中的失真;
  • 承接面——各渠道内容引发的检索需求,需要一个可信落点。

一句话概括这个区别:官网的价值在于被引用时说的是对的,而不在于成为被引用的那一个。这两件事对应的工作方法完全不同,预算结构也完全不同。

顺着这张图往下,还有两条判断是数据直接支持的:

其一,资源重心的问题有了依据。媒体类信源合计 63.9%,是企业官网 4.4% 的十四倍。这不构成"官网不必做"的结论,但它确实说明:如果一个方案把绝大部分预算压在官网技术改造上,它的资源配置与信源结构的实际形状是错位的。

其二,平台要分开看。第四节那张矩阵已经说明,五个平台的信源偏好不同、席位数量不同。一个负责任的方案应当按平台分别设定预期,而不是给出一个笼统的整体承诺。

数据口径与局限

本章引用的实测数据出自境迅自研监测系统的历史生产测量记录,口径如下:

  • 样本量:五平台批量提问,共 3,120 条被引条目,2,279 个去重 URL,309 个去重域名。
  • 平台:豆包 / DeepSeek / 通义千问 / 腾讯元宝 / Kimi 五个平台。
  • 采样方式:在真实用户环境下以独立会话提问,记录回答中实际给出的引用源。
  • 时间切片:数据截至 2026 年 6 月。
  • 技术形态探测:对 24 个实际被引用过的页面做单次探测(其中 14 个为企业官网页面、10 个为垂类媒体页面作对照)。

需要如实标注的局限:

  1. 行业集中。样本集中在金融与医疗两个赛道。垂类媒体占比偏高可能有行业特性放大的成分,其他行业的企业官网权重可能高于 4.4%,本章数字不宜直接外推到全行业。
  2. 时间切片。AI 平台的检索与排序机制持续变化,引用偏好会漂移。本章数字描述的是特定时间窗内的状态,不是稳定常量。
  3. 技术形态探测的样本量小。24 个页面、单次探测,只能支撑"不是必要条件"这一否定性结论,支撑不了任何肯定性结论。
  4. 颗粒度上限。本章只发布聚合结果——分类占比、平台矩阵、引用密度与集中度。涉及具体域名与具体主体的明细不对外发布。

最后一条不是技术限制,是选择。信源结构分析里最有说服力的部分恰恰是具名明细,但公开它会带来第三方主体的识别风险。我们宁可让结论少一分说服力,也不把可核验性建立在别人的可识别性上。

← 返回指南目录

想聊聊具体怎么做?

可用下面的电话与邮箱直接联系我们。