CN-GEO引用生态报告

Data Research · Release 2026.07

国内生成式 AI
引用生态全景报告

从平台规模、信源结构、问题类型、页面特征与时间新鲜度五个层面,拆解国内生成式 AI 的可观察引用模式,并形成可执行的 GEO 数据挖掘路线。

数据版本 默认口径 精确去重 报告形式 离线单文件 HTML更新时间
原始引用观察
精确去重引用
标准问题
AI 平台
规范信源
规范页面

关键率指标

所有比例仅描述当前报告样本,点击可查看对应分析模块与分母说明。

全局分析口径

筛选会联动带有“联动”标记的图表;平台总览类图表始终保留全量比较。

正在载入分析口径…

01数据底座与分析适用性

先理解题库的分类逻辑,再确认样本规模、字段可用性、链接可解析性和处理状态。后续每类分析按照所需字段确定样本边界。

本章用途:建立问题分类、引用观察、规范页面与分析口径之间的阅读顺序。

01.1 · Question taxonomy

620 个问题覆盖 6 个研究维度、31 个有效类型

先说明题库如何组织。当前每个问题继承一个原始目录标签,行业、意图、时效、风格和场景属于不同观察角度。

标准问题
研究维度
有效问题类型
未分类问题

分类边界:31 个有效类型与 1 个未分类存量桶合计形成 32 个目录组合。未分类是数据治理状态,其中多为带年份或促销节点的高时效问题。

查看 32 类代表问题按研究维度、类型与题数展开
研究维度问题类型题数代表问题

代表问题取每个原始类别中编号最早的实际问题;题数以 620 个标准问题为统计粒度。

01.2 · Processing funnel

214,119 条原始观察经过精确去重后保留 189,845 条唯一记录

展示原始记录、去重记录、有效 URL 与规范页面之间的数量关系。让读者理解每一层数据粒度。

有效 URL 以 HTTP(S) 且完成规范化为准;规范页面按 canonical_url 汇总。重复观察在原始层保留,汇总层默认去重。

01.3 · Field availability

核心标识完整,内容与时间元数据按平台选择性提供

比较关键字段的有效值覆盖率。字段未知只限定依赖该字段的分析。

分母为 214,119 条原始引用观察;发布时间可用表示已成功规范化为日期。

01.4 · Analysis applicability

不同分析任务拥有各自的可用样本边界

按照分析所需字段计算可用比例。说明每类结论覆盖了多少记录。

引用观察统计可使用全部记录;页面、域名、标题、摘要、位置和时间分析分别应用对应字段条件。

01.5 · Platform availability

平台提供的引用元数据具有稳定的结构差异

对照 12 个平台的六类字段可用率。平台差异反映采集接口与展示能力边界。

深色表示该平台字段可用率更高。字段未知记录继续用于不依赖该字段的统计。

01.6 · Processing status

采集状态、清洗状态和页面冲突采用不同处理方式

将常见状态映射到明确的保留、排除或复核规则,防止多个百分比被合并成一项总缺失率。

每项使用自己的分母,记录级状态与页面级状态不相加。

02AI 平台引用全景

平台样本规模与问题覆盖存在显著差异。规模、覆盖、信源广度和单问题密度需要同时观察。

本章用途:识别各平台的引用供给强度、覆盖边界,以及同产品 Web/移动端的结构差异。

02.1 · Citation scale
口径联动

头部平台贡献了更密集的样本,平台规模差距需与问题覆盖共同解释

排序比较平台引用量和样本引用份额。建立平台样本权重基线。

样本引用份额的分母为 12 个平台在当前原始或精确去重口径下的引用总量,用于描述本报告样本结构,不能外推为市场份额。

02.2 · Question coverage

六个平台覆盖接近完整,长尾平台的比较范围更窄

比较问题覆盖数和覆盖率。约束跨平台结论的可比范围。

覆盖率分母为数据集内 620 个标准问题。

02.3 · Source breadth

引用量、信源数与页面数共同刻画平台的检索广度

观察平台规模与信源广度关系。区分“高频集中”与“广泛覆盖”。

横轴为规范信源数,纵轴为去重引用量,气泡大小为规范页面数。

02.4 · Per-question density口径联动

单问题引用密度呈长尾分布,中位数比均值更适合横向比较

展示各平台每问题引用数的五数概括。识别典型密度与极端高值。

箱体依次表示下四分位数、中位数和上四分位数,须线表示最小值与最大值。

02.5 · Terminal pairs口径联动

同产品电脑端与移动端的样本体量并不一致

对照具备双端数据的产品。支持终端差异研究与采集配额规划。

移动端样本引用占比以产品双端当前口径引用合计为分母;问题覆盖差以电脑端覆盖问题数为分母。只纳入同时存在电脑端与移动端记录的产品家族。

03信源生态与集中度

9,878 个规范信源已经形成完整的一级类型地图。域名规模、引用贡献、主体自有来源渗透、头部集中与生态归属共同解释信源供给结构。

本章用途:先判断各类信源在生态中的规模与影响,再识别平台偏好、稳定信源和新增内容进入头部生态的难度。

03.1 · Source taxonomy overview固定口径:全局精确去重

域名规模与引用贡献共同揭示九类信源的生态位置

对照每个一级类型的域名占比和去重引用占比。识别少量域名形成高影响的集中型供给,以及域名多、单站贡献分散的长尾型供给。

规范主域名
拥有明确一级类型的域名
拥有明确类型的信源去重引用
品牌与企业官网引用占比
主体自有来源引用占比

正在载入逐域治理范围…

类型结构使用可关联规范域名的信源表去重引用作为分母。主体自有来源包括品牌与企业官网、政府与公共机构。

03.2 · Official source penetration
固定口径:全局精确去重

12 个平台对企业官网与公共机构来源的引用强度差异明显

把各平台去重引用拆分为品牌与企业官网、政府与公共机构两部分,并以平台全部去重引用作为分母。用于观察不同平台对主体自有信息的可见依赖程度。

正在载入平台差异与置信度敏感性…

03.3 · Top sources平台 / 类型 / 口径联动

头部信源排名会随平台与信源类型发生明显变化

按当前筛选条件展示头部信源,并同时显示样本引用份额。形成平台级信源优先名单。

样本引用份额使用当前平台、信源类型和记录口径下的全部可关联信源引用作为分母;问题覆盖率使用当前筛选集合覆盖的问题数作为分母。图中仅展示 Top 20,分母保留完整集合。

03.4 · Source types
平台 / 口径联动

二级类型继续拆解各类内容与服务供给

比较二级信源类型的引用规模和样本构成率。观察一级生态内部的内容角色、服务形态和平台差异。

构成率以当前平台和记录口径的全部类型引用合计为 100%。全库逐域治理包含 500 个人工复核、55 个历史映射、8,644 个模型辅助标注和 679 个政府域名规则分类。

03.5 · Pareto

头部少量信源吸收了较高比例的去重引用

展示信源排名与累计引用份额。评估头部集中度和长尾扩展空间。

累计份额按精确去重引用量排序计算。

03.6 · Source × platform

同一头部信源在 12 个平台上的引用强度分布不均

对照头部信源的平台分布。寻找平台偏好与跨平台扩展线索。

选取全局去重引用量最高的 16 个信源;颜色为平台内去重引用数。

03.7 · Ecosystems

已归属信源与未归属生态长尾结构

对照已归属生态规模,并拆解生态归属空缺长尾的头部与低频结构。

信源表去重引用来自未归属生态信源
未归属生态域名仅产生 1 至 5 条引用
未归属生态 Top 50 的引用占比

已归属生态引用规模

未归属生态信源 Top 10

“未归属生态”仅描述集团或内容生态标签尚未标注。信源类型分类覆盖与未分类长尾见 03.1。

04四大 AI 产品的信源偏好与终端差异

以八端共同问题建立公平基线,再以豆包和 DeepSeek 四个高活跃端点的头部信源作为锚点,观察元宝与千问的承接情况,并展开各端真实 Top 10/20 排行、终端倾向和一级类型构成。Kimi 不进入本章的数据、筛选和结论。

本章用途:识别核心信源的跨产品迁移机会,对照每个端点的真实头部结构,并形成面向具体产品和终端的 GEO 信源初筛名单。

固定口径:精确去重、共同问题、问题等权。选择具体产品后,差异图与行动清单聚焦该产品,锚点和八端排行保留完整对照并突出所选产品。

八端均有可识别信源的共同问题
电脑端与移动端终端
具备双端数据的产品
达到筛选门槛的信源
04.1 · Preference matrix产品联动

八端偏好指数定位跨端差异较大的信源候选

以八端平均占比为 100,比较筛选达标信源在各端点的相对权重。点击有引用的单元格或使用键盘选择器可联动锁定信源。

每个问题先在可识别信源中归一化,再按问题等权汇总。八端偏好指数的理论范围为 0 至 800;矩阵从筛选达标信源中展示跨端差异度最高的 20 个,颜色在指数 200 处封顶,悬停显示实际指数、引用量和覆盖问题数。极高指数可能来自较小覆盖样本,需要结合明细读取。窄屏可横向滑动图表。

04.2 · Anchor migration锚点 / 信源联动

豆包与 DeepSeek 的 17 个头部锚点在八端呈现不同承接深度

合并豆包电脑端、豆包移动端、DeepSeek 电脑端和 DeepSeek 移动端各自 Top 10,得到 17 个去重锚点,再观察这些信源在元宝与千问双端的排名和份额。

锚点继承率 = 进入当前端点 Top 20 的锚点数 ÷ 17。单元格数字为共同问题口径下的真实排名,点号表示未进入该端完整信源排行;悬停还可查看该信源在四个锚定端的 Top 10 出现率。

04.3 · Top source ranks口径 / 数量 / 信源联动

八端 Top 10/20 排行还原每个终端的真实头部信源

共同问题使用 334 个八端均有可识别信源的问题,适合横向公平比较;全量范围使用各端全部有效信源问题,呈现端内真实分布。

口径
数量

当前使用 334 个共同问题,八端分母一致,适合比较端点偏好。

份额先在单个问题内按可识别信源归一化,再对问题等权汇总。选择产品时保留八端完整结构,并突出对应双端。点击其他产品列的信源会自动切换产品范围,同一 source_id 随后在矩阵、终端倾向和 GEO 清单同步高亮。

04.4 · Terminal tilt产品 / 信源联动

同一产品的电脑端与移动端呈现不同的部分信源权重

使用双端均有可识别信源的共同问题,比较信源在电脑端和移动端的等权占比。全部产品模式展示每个产品差异最大的信源。

双端可识别共同问题
全量信源重合度
筛选达标信源重合度
全量双端共同信源

左侧为电脑端,右侧为移动端。全量重合度使用共同问题内出现过的全部可识别信源;达标重合度仅保留累计不少于 20 条去重引用且覆盖不少于 5 个问题的信源。两层口径用于区分长尾差异和稳定信源差异。

04.5 · Source type mix产品联动

一级信源类型构成显示不同终端的内容入口倾向

把每个终端的等权引用占比分解为九个一级分类,并单列信源未规范化记录。悬停可继续查看一级分类中的二级类型构成。

八端共同问题等权口径的分类覆盖率
八端共同问题等权口径的规则分类份额
八端共同问题等权口径的未分类长尾
八端共同问题等权口径的信源未规范化
9,199 + 679逐域参考标签与政府域名确定性规则

每个终端合计为 100%。一级分类保证跨端可读性,二级类型保留主体与内容形态细节。150 个证据仍不足的域名保留“未分类长尾”;无法关联规范域名的记录单列为“信源未规范化”。

04.6 · GEO shortlist产品 / 信源联动

覆盖规模与终端倾向共同形成信源初筛清单

汇总信源在具体产品中的优势终端、倾向强度和共同问题覆盖率,形成内容研究与终端专项验证名单。全部产品模式为每个产品保留 5 个候选。

信源产品优势终端终端倾向指数终端差异覆盖问题共同问题覆盖率去重引用初筛建议

共同问题覆盖率 = 信源覆盖问题数 ÷ 该产品双端均有可识别信源的问题数。终端倾向指数以产品双端平均值为 100,范围为 100 至 200。双端份额相对差不超过 15% 时标记为接近;指数不低于 150 且覆盖少于 15 个问题时标记为高倾向低覆盖;其余信源按份额较高的终端进入专项验证。Kimi 不进入本章计算、筛选和结论。

05跨平台重合与共识

跨平台共享的“问题与页面”组合整体有限,少数平台对具有更高重合。共识信源因此更适合作为跨平台策略起点。

本章用途:区分平台独有供给、平台间共享供给和跨平台共识信源。

05.1 · Jaccard matrix

平台间问题与页面集合的重合普遍偏低

比较任意两个平台的 Jaccard 相似度。定位最接近的平台对与相对独立的平台。

Jaccard = 共享问题与页面组合数 ÷ 两平台问题与页面组合并集;0 表示没有共享组合,对角线表示平台自身。

05.2 · Network

平台关系网络由少数较强连接和大量弱连接组成

把相似度转为关系网络。观察平台簇与桥接节点。

只显示相似度高于样本中位数且大于 0 的连接,线宽随相似度增加。

05.3 · Shared pairs

最高重合的平台对贡献了主要共享问题与页面组合

排序展示共享组合数量。筛选适合做迁移验证的平台对。

图中展示共享组合数最高的 16 个平台对。

05.4 · Shared vs unique

多数平台同时拥有大量独有问题与页面组合

分解各平台共享与独有组合。估算单平台专项优化的必要性。

共享表示同一问题与同一规范页面同时出现在至少两个平台。

05.5 · Consensus sources

高问题覆盖与高平台覆盖共同定义跨平台共识信源

综合信源的平台数和问题数。形成跨平台优先合作与内容研究名单。

共识分数 = 覆盖问题数 × 覆盖平台数,仅用于本数据集内筛选。

06问题类型与场景差异

620 个问题按照来源分层映射到七类维度。不同标签的引用密度、信源多样性和平台供给具有独立结构。

本章用途:把平台与信源研究落到具体需求场景,建立按问题类型分层的数据挖掘单元。

06.1 · Taxonomy问题维度联动

问题分类采用分层来源,每个维度覆盖不同问题子集

呈现维度与标签的结构。避免把不同分层误当成同一套全量标签。

面积表示标签内问题数;当前版本每个问题只保留其来源分层对应的一个标签。

06.2 · Label scale
问题 / 口径联动

同一问题维度下,各标签的引用供给强度存在差异

比较当前维度的标签引用规模和题均引用。筛选高供给与低供给场景。

题均引用以标签内标准问题数为分母;悬停同步展示题均信源、题均页面和题均平台数。

06.3 · Label × platform问题 / 口径联动

问题标签与平台之间形成差异化供给矩阵

比较当前问题维度在 12 个平台上的引用量。定位平台场景优势和采集空白。

颜色为当前口径下的引用观察数;样本覆盖差异需与第 2 章结合阅读。

06.4 · Source diversity问题维度联动

高引用量标签并不一定拥有更高题均信源多样性

对照每个标签按问题先聚合后计算的题均信源数与题均页面数。识别供给集中和内容补位空间。

横轴为单问题不同规范信源数的标签均值,纵轴为单问题不同规范页面数的标签均值,气泡大小为标签问题数。

06.5 · Leading sources问题标签联动

当前场景的头部信源可以直接转为内容与竞品研究清单

列出当前维度或标签的高频信源。支持页面拆解和信源合作优先级。

信源标签去重引用覆盖问题

选择具体问题标签时显示该标签前 8 位;选择全部时展示当前维度的代表性信源。

07内容形态与页面表现

本章以页面标题中的可观察信号为基础,将每个页面归入一个主要内容类型,并同时保留可重叠的多项标题特征。当前数据未包含完整正文,分类结果用于结构研究和样本筛选。

本章用途:先建立内容类型与标题特征地图,再用真实标题解释规则,并对照长度、平台差异、页面覆盖和特征共现。

07.1 · Content taxonomy平台 / 点选联动

九类主要内容形态构成页面分类全景

比较互斥主类型的页面量与引用表现。点击条形可在下方查看真实标题。

每个页面按固定优先级归入一个主类型;标题未提供页面独立保留。分类版本为 deterministic_v2。

07.2 · Title feature map点选联动

时效、决策、商业、可信度和场景信号可以重叠出现

比较 11 项标题特征在标题可用页面中的覆盖率。点击条形可查看触发该特征的标题。

规则基于关键词、年份和问号模式;分母为 已提供标题的页面

07.3 · Real title evidence平台联动

真实标题把分类规则转成可以直接核验的页面证据

按主类型或标题特征浏览代表页面。实例保留原始标题,并补充域名、问题覆盖和平台覆盖。

正在载入实例

实例筛选条件:标题长度 12 至 62 个字符、至少覆盖 2 个平台、覆盖 2 至 15 个问题,并优先保留不同域名。实例用于解释规则,不代表内容质量背书。

07.4 · Title length

标题长度区间与平均引用表现存在可观察差异

比较标题长度区间的页面量与平均引用。为标题结构实验提供区间参考。

标题未提供为独立区间;相关性用于筛选,未控制平台、主题和域名权重等混杂因素。

07.5 · Snippet length

摘要长度在摘要已提供页面内反映初步信息密度

比较摘要长度与页面平均引用。为正文抓取优先级提供线索。

摘要未提供为独立区间;max_snippet_length 是同一规范页面的最大引用摘要长度。

07.6 · Feature × platform

11 项标题特征在不同平台呈现不同覆盖结构

对照平台级页面特征覆盖率。识别时效、决策、商业、可信度和地域表达的差异。

分母为各平台去重引用涉及且标题已提供的不同规范页面数。

07.7 · High-coverage pages

高覆盖页面为正文深挖和页面解构提供样本池

气泡图呈现问题数、平台数与引用量,右侧直接列出五个全库代表页面。

气泡大小为精确去重引用数;标题列表按问题覆盖数与平台覆盖数的乘积排序。

07.8 · Feature co-occurrence

高频特征对揭示标题结构中常见的组合方式

比较共同页面量最高的 14 组特征对,并以 Jaccard 系数衡量共现强度。

Jaccard = 共同页面数 ÷ 至少包含其中一项特征的页面数。特征对用于描述共同出现,不承载因果结论。

08发布时间覆盖与内容新鲜度

107,659 个规范页面中,63,314 个拥有一致发布时间,43,675 个时间未知,670 个存在日期冲突。已知时间页面主要集中于 2025 和 2026。

本章用途:先确认时间字段覆盖,再分析已知时间样本内部结构,并把未知与冲突页面保留在其他适用分析中。

页面拥有一致发布时间
页面发布时间未知
页面存在多个发布时间
08.1 · Publication months月度识别

月度分布显示 2026 年 5 月形成显著峰值

按月拆解拥有唯一一致日期且不晚于数据截止日的页面,识别发布时间样本的新鲜内容重心、月度拐点和异常日期。

峰值月份与页面量
2025 年页面位于下半年
2026 上半年相对 2025 上半年样本倍数
晚于数据截止日的异常页面

月度特征2025 年下半年承载该年主要发布时间样本;2026 年 5 月出现跨平台峰值,6 月回落后仍高于 4 月。该序列描述被引用页面的发布时间构成,不代表全网内容生产量。

主图展示 2024 年 1 月以来的连续月份,覆盖截止日前可靠日期样本的 94.7%。发布时间未知和日期冲突页面不进入月度序列;晚于数据截止日的日期单列为异常,不进入趋势计算。

08.2 · Freshness bands时间联动

已确认发布时间的页面中,2025 和 2026 占 88.8%

同时展示全体页面状态和已知时间样本内部构成。建立内容更新与存量分析口径。

图中同时标注占全部页面比例;已知时间段额外显示其在 63,314 个可靠时间页面中的占比。

08.3 · Label freshness问题 / 时间联动

问题标签的时间覆盖与新鲜度构成可以揭示更新压力

比较当前问题维度内各标签的时间状态占比。识别高时效场景的旧内容与补采空间。

每行以该标签的问题与页面关联总数为 100%,悬停显示占比和关联数。

08.4 · Source-type freshness时间联动

信源类型比较使用各类型内部时间构成

比较主要信源类型的时间状态占比。判断更新型内容、常青内容和字段覆盖差异。

每类信源以自身页面数为 100%;展示页面量最高的 12 类信源。

08.5 · Title year audit

标题中的年份需要与可靠页面发布时间交叉核验

审计标题年份和发布时间的一致性。日期冲突与未知状态独立呈现。

标题取首个四位年份;年份一致只表示标题年份与唯一页面日期年份相同。

09GEO 机会地图

机会筛选同时考虑已有覆盖强度、平台覆盖缺口、问题供给密度和内容形态。所有评分用于形成候选队列,后续仍需人工验证。

本章用途:把描述性分析转成信源扩展、场景补位、内容模板和跨平台迁移四类行动清单。

09.1 · Source quadrant

高问题覆盖率、高平台渗透率的信源构成优先研究象限

按问题覆盖率和平台渗透率定位信源。区分共识型、平台型与长尾型信源。

问题覆盖率以 620 个标准问题为分母,平台渗透率以 12 个平台为分母;虚线分别位于问题覆盖率 6.5%(40 个问题)和平台渗透率 50%(6 个平台),气泡大小为精确去重引用量。

09.2 · Platform whitespace平台联动

其他平台已验证、当前平台尚未出现的信源形成扩展候选

列出当前平台未覆盖的高潜信源。设计跨平台迁移验证清单。

候选信源类型现有平台问题数

全部平台模式展示综合候选;选择具体平台后展示该平台空白。

09.3 · Category gaps问题维度联动

高引用需求与低页面供给的组合形成内容补位候选

比较每问题引用量与每问题页面量。筛选需求密集、供给相对集中的场景。

右上表示高需求高供给;左上更适合作为新增页面的初筛方向。

09.4 · Format opportunity

平台与内容形态之间存在可观察的引用密度差异

比较各平台每种内容形态的每页引用数。为平台定制内容模板提供候选依据。

单元格 = 去重引用数 ÷ 不同规范页面数;页面量较小时需谨慎解读。

09.5 · Expansion candidates

已有一定问题覆盖、仍有平台空间的信源适合进入扩展验证

综合问题覆盖率、平台渗透率和平台空白率。生成跨平台扩展候选队列。

筛选分 = 覆盖问题数 ×(12 − 已覆盖平台数),用于保持原有排序;条形标签补充平台空白率,悬停显示问题覆盖率和平台渗透率。

10结论、行动建议与方法说明

本报告提供一套可以反复更新的分析骨架:平台比较、信源分层、场景拆解、页面特征和机会筛选均可随新数据版本重算。

本章用途:把当前发现转成下一轮数据采集、内容研究和 GEO 实验的执行顺序。

    Platform

    平台研究

    优先对问题覆盖接近的电脑端与移动端产品做配对比较;引用序号只在平台内部使用。

    Source

    信源策略

    建立跨平台共识、产品与终端特色、空白候选三类信源名单,并按月复算。

    Content

    内容加工

    从高问题覆盖页面抽样抓取正文,补充结构、实体、事实密度、表格和作者权威性特征。

    Collection

    数据补采

    按研究目的补充响应边界、模型版本、采集时间和页面正文;发布时间作为时间分析的可选增强字段。

    方法与边界

    • 默认统计粒度为精确去重后的引用观察;原始口径保留重复采集事实。
    • 平台规模反映当前样本覆盖,不能作为产品市场份额或用户规模。
    • 信源偏好表示共同问题样本中的相对引用份额。它不能外推为平台固定抓取规则、市场整体偏好或因果关系,指数为 0 仅表示当前样本未观察到。
    • 信源偏好章节只覆盖豆包、DeepSeek、腾讯元宝和千问。腾讯元宝手机版与千问手机版的终端映射由代码配对规则推定,Kimi 未进入该章节。
    • 发布时间未知的记录继续参与平台、问题和引用观察统计;时间分析只使用可靠时间样本。
    • 同一规范页面出现多个日期时标记为发布时间冲突,不直接选取最早日期。
    • 标题或摘要未提供的页面单独标记,不进入对应的特征占比和组合分析。
    • 页面特征由标题和摘要规则生成,支持相关性筛选,不承载因果结论。
    • 响应表目前为空,无法恢复一次回答中的完整引用边界。
    • 信源分类包含 500 个人工复核、55 个历史映射、8,644 个模型辅助标注和 679 个政府域名规则分类;150 个证据仍不足的域名保留未分类长尾。

    核心数据表