探词科技-WordTrace
WT-GEO-STD-2026-001 · v1.0 · 开放征求意见稿(开放共创中)

生成式引擎优化
行业标准 · 开源发布

一套完整、开放、详细、可落地的 GEO 行业标准:五层技术架构、七维量化指标、合规治理框架与开源协作模式。文档本身以 CC BY-NC 4.0 协议开放,欢迎引用、校验与共建。

发布方 探词科技(WordTrace)发布 2026-08文档协议 CC BY-NC 4.0代码协议 MIT
开放开源五层架构七维指标合规底座可落地OPEN STANDARDCC BY-NC 4.0MITGPLv3开放开源五层架构七维指标合规底座可落地OPEN STANDARDCC BY-NC 4.0MITGPLv3

§ 00

核心摘要

生成式引擎优化(GEO)正随着信息获取范式的根本性转变兴起——用户从「主动搜索、点击链接、浏览网页」的传统路径,转向「提出问题、AI 直接生成答案」的新模式。这一范式更迭的核心逻辑是:生成式引擎不再以「网页链接排名」为核心输出,而是基于多源内容检索、综合加工后直接给出结论。此时品牌或信息的可见度,本质上取决于其能否成为生成式答案的权威引用来源。

与传统 SEO 聚焦网页关键词匹配、追求搜索结果页高排名的逻辑完全不同,GEO 的本质是优化生成式引擎的检索与上下文引用逻辑——它不改造生成式引擎本身,而是调整外部内容的结构、语义、权威性与分发策略,让内容在大模型的检索增强生成(RAG)链路中被优先召回、高置信度采信,最终进入生成式答案的核心上下文。

本标准由探词科技发起并以开源协议发布,目标是为行业提供统一的技术语言、可量化的效果指标、明确的合规红线与可复制的落地路径。任何机构均可依据本标准开展 GEO 实践、开发与标准兼容的工具,或参与标准修订。

§ 01

范围与定义边界

本标准规定了生成式引擎优化的术语定义、总体技术架构(L1–L5)、量化评估指标体系(七维)、合规治理要求与落地实施方法,适用于:

  • 开展 GEO 实践的品牌方、增长团队与内容团队;
  • 提供 GEO 相关工具与服务的技术厂商;
  • 希望评估自身在生成式引擎中可见性的任何组织;
  • 参与本标准开源共建的研究机构与个人贡献者。

本标准不适用于:针对生成式引擎的对抗性攻击、模型逆向与任何形式的答案操纵(参见第 7 章禁止性行为)。本标准中的「MUST」为强制要求,「SHOULD」为建议要求;合规验收以 MUST 项全部满足为前提。

§ 02

术语与定义

生成式引擎优化

Generative Engine Optimization (GEO)

通过调整外部内容的结构、语义、权威性与分发策略,提升特定信息在生成式引擎答案中被召回、引用与推荐的概率与权重的系统性方法。GEO 不改造生成式引擎本身。

生成式引擎

Generative Engine

基于大语言模型,对用户问题直接生成综合答案的系统,包括但不限于豆包、DeepSeek、通义千问、Kimi、文心一言、腾讯元宝、ChatGPT、Claude、Gemini、Perplexity 及各类 AI 智能体。

AI 引用率

Citation Rate

在标准目标查询集合中,品牌内容被生成式引擎作为信源引用的查询占比,是 GEO 效果的首要指标。

权威信源

Authoritative Source

经行业共识或平台机制认定、在特定领域具备高可信度的内容来源,如官方网站、学术出版物、行业目录、主流知识社区中的认证内容。

名称-地址-电话一致性

NAP Consistency

企业核心实体信息(名称、联系方式、地址、业务表述)在全网各平台及各生成式引擎答案中的一致程度。

RAG 适配

RAG Adaptation

针对检索增强生成链路的优化:使内容在分块、向量化、召回、重排序各环节均保持语义完整与高置信度。

结构化内容

Structured Content

遵循明确格式规范(FAQ、对比表、评测、定义块、步骤列表等)并带有机器可读标记(JSON-LD 等)的内容形态。

溯源证据链

Source Provenance

内容从创作、发布、修订到被引用的完整可验证记录,包括署名、时间戳、存证与交叉引用关系。

影子模型

Shadow Model

用于近似模拟主流生成式引擎检索与引用行为的代理模型簇,以低成本实现可见性监测。探词科技自研技术。

黑帽 GEO

Black-hat GEO

通过虚假信源、批量伪原创、提示注入、数据投毒等操纵生成式引擎答案的行为,属本标准明令禁止的行为。

§ 03

GEO 与 SEO 的区别及联系

GEO 不是 SEO 的替代品,而是信息获取范式转移后的新增战场。两者共享「内容质量与权威性」的底座,但在目标、技术逻辑与指标上存在本质差异:

维度传统搜索引擎优化(SEO)生成式引擎优化(GEO)
目标提升网页在传统搜索结果页的排名,增加用户点击流量提升内容在生成式答案中的引用概率、推荐位置、叙事权重
核心技术逻辑依赖静态关键词匹配、网页权重信号、用户外链资源等技术手段依赖结构化数据标记、语义向量对齐、权威信源构建、RAG 适配优化
用户体验路径用户搜索 → 引擎返回结果页 → 用户点击网页 → 浏览完整内容用户提问 → AI 直接生成综合答案 → 用户在答案中查看来源引用 → 选择是否进一步访问来源
核心指标关键词搜索排名、网页流量、用户点击率、外链数量AI 引用率、推荐位置权重、叙事准确性、平台覆盖度、内容一致性
优化对象网站的页面元素、外部链接结构、服务器加载速度内容的结构格式、语义理解精确度、来源可信度、多平台适配性
见效与衰减以周/月为单位波动,受算法更新影响以天为单位波动,受模型版本、信源生态与语料时效共同影响,需要持续监控闭环

§ 04

行业痛点与设计原则

PAIN / 01

优化方法不统一

不同生成式引擎的检索与引用逻辑存在差异,行业沿用 SEO 粗放式运营逻辑,存在内容无结构化、信源无分级、知识无体系等问题。

PAIN / 02

性能指标不一致

传统 SEO 的关键词排名、网站流量等指标无法适配 GEO 的引用场景,行业长期缺乏统一的效果衡量维度。

PAIN / 03

安全合规漏洞多

生成式引擎的「信息加工」本质可能被滥用为传播虚假信息的工具,风险传导性更强,亟需全链路治理。

↓ 对应的系统性设计原则

PRINCIPLE / 01

分层定义

清晰界定不同层级的技术标准与规范边界,各层可独立实施、独立验收。

PRINCIPLE / 02

开源协议定制

为代码、文档、核心技术等不同类型资源匹配差异化的开源授权方案。

PRINCIPLE / 03

标准模块化

将复杂标准拆分为可独立执行的技术模块,企业可按需分阶段落地。

PRINCIPLE / 04

合规底座加固

建立全链路的合规性校验与治理机制,合规是前置条件而非事后补救。

§ 05

GEO 标准五层架构模型

五层架构将 GEO 实践拆分为可独立实施、独立验收的技术层:自底向上依次为数据接入、内容治理、智能优化、效果监测与策略分析。企业可从任一层切入,但合规验收要求 L1–L3 的 MUST 项先行完成。

L1

数据接入层

统一采集入口,对接企业多渠道内容资源,屏蔽不同资源平台的技术差异。

核心技术模块

  • 企业官网标准化采集模块
  • 公众号 / 视频号采集模块
  • 电商平台内容采集模块
  • 自媒体平台采集模块
  • 外部权威知识库对接模块

规范要求

  • MUST建立内容资产清单,登记每一内容源的地址、格式、更新频率与责任人。
  • MUST采集行为遵守目标平台的 robots 协议与服务条款,不得绕过访问控制。
  • SHOULD采集管道具备增量更新能力,内容变更到入库的延迟不超过 24 小时。
  • SHOULD多模态内容(图片、视频、音频)应同时采集其文本替代信息(标题、字幕、摘要)。
L2

内容治理层

对采集内容进行标准化清洗、校验、提纯,生成干净、无噪声的语义内容。

核心技术模块

  • 内容清洗去重模块
  • 实体标准化识别模块
  • 语义纠错模块
  • 多模态内容对齐模块
  • 合规审核模块

规范要求

  • MUST全网核心实体信息(名称、联系方式、业务表述)完成 NAP 一致性校验,错误项有修正记录。
  • MUST所有进入分发环节的内容经过事实性校验,关键数据可回溯到一手来源。
  • MUST建立内容分级制度:核心事实层(不可出错)、观点层(需署名)、营销层(需标识)。
  • SHOULD重复内容合并率应达到 95% 以上,同一事实在知识库中只保留唯一权威版本。
L3

智能优化层

核心技术适配层,将标准化内容转化为生成式引擎易理解、高置信度的格式。

核心技术模块

  • 结构化数据标记模块(JSON-LD / Schema.org)
  • 语义向量对齐模块
  • 知识图谱构建模块
  • 多模态内容适配模块
  • RAG 索引适配模块

规范要求

  • MUST官网核心页面部署 JSON-LD 结构化数据(Organization / WebSite / FAQPage / Article 等)。
  • MUST页面内容为无 JS 依赖可直接读取(预渲染或服务端渲染),并提供 llms.txt 站点说明。
  • MUST核心问答内容采用 FAQ、对比表、定义块等 AI 易引用结构,关键结论前置。
  • SHOULD内容分块粒度控制在 300–800 字/块,每块语义自洽、可独立成段被引用。
  • SHOULD为关键内容提供 RSS / API 等机器可读分发通道。
L4

效果监测层

实时采集内容在各生成式平台的表现数据,为优化策略调整提供支撑。

核心技术模块

  • 多平台引用监测模块
  • 实体权威度分析模块
  • 内容一致性校验模块
  • 影子模型监测模块

规范要求

  • MUST建立目标问题集(不少于 50 个真实用户问题),按日级频率监测各平台答案中的提及与引用。
  • MUST监测数据保留原始快照(答案全文 + 信源列表 + 时间戳),留存期不少于 180 天。
  • SHOULD监测覆盖本标准附录所列主流平台中的至少 5 个,中英文场景至少各 1 个。
  • SHOULD采用影子模型簇进行高频预筛,降低全量监测成本。
L5

策略分析层

对监测数据进行系统性分析,闭环指导优化策略迭代。

核心技术模块

  • NAP 一致性分析引擎
  • 引用率归因分析引擎
  • 多平台重排序优化模块

规范要求

  • MUST每次策略调整基于监测数据归因,记录假设、动作与结果的完整实验日志。
  • MUST以 30 天为最小评估周期,输出七维指标的变化报告。
  • SHOULD建立竞品基准对照,场景竞争力指数按周更新。
  • SHOULD分析结论反哺 L1–L3 层,形成「监测 → 归因 → 生产 → 投放」闭环。

§ 06

七维量化评估指标体系

指标体系是 GEO 效果衡量的统一语言。七个维度均可量化采集,按 A / B / C / D 四级评定;建议以 30 天为最小评估周期输出变化报告。

01

AI 引用率

Citation Rate

在标准目标查询集合中,企业内容被生成式引擎作为信源引用的比例。

计算方式

引用率 = 引用企业内容的答案数 ÷ 目标查询总数 × 100%

采集方法

采用标准 AI 爬虫模拟工具,采集主流生成式引擎对目标问题集的公开回答。

A 优秀

≥ 40%

B 良好

20% – 40%

C 合格

5% – 20%

D 待提升

< 5%

02

推荐位置权重

Position Weight

企业内容在生成式答案信源列表中的排序位置,及在核心结论中的提及方式。

计算方式

位置权重 = Σ(信源位次得分) ÷ 引用次数;首位 = 1.0,第 2–3 位 = 0.6,其余 = 0.3

采集方法

采用标准 DOM 解析技术,提取信源列表排序位置与正文提及位置。

A 优秀

≥ 0.8

B 良好

0.6 – 0.8

C 合格

0.4 – 0.6

D 待提升

< 0.4

03

叙事准确性

Narrative Accuracy

生成式答案中企业核心信息、品牌表述、业务数据被准确转述的比例。

计算方式

准确性 = 准确转述的关键事实数 ÷ 抽样关键事实总数 × 100%

采集方法

采用语义相似度比对技术,将生成式答案与企业标准知识库逐条比对。

A 优秀

≥ 95%

B 良好

85% – 95%

C 合格

70% – 85%

D 待提升

< 70%

04

内容一致性

Content Consistency

企业核心信息在不同生成式引擎、不同场景下表述的一致率。

计算方式

一致性 = 跨平台表述一致的事实数 ÷ 跨平台抽样事实总数 × 100%

采集方法

采用 NAP 一致性分析引擎,跨平台采集公众表述内容并两两比对。

A 优秀

≥ 95%

B 良好

85% – 95%

C 合格

70% – 85%

D 待提升

< 70%

05

平台覆盖度

Platform Coverage

企业内容在本标准规定的主流生成式引擎中被引用的平台覆盖比例。

计算方式

覆盖度 = 有引用记录的平台数 ÷ 目标平台总数 × 100%

采集方法

采用多平台 API 对接与模拟查询技术,汇总各平台引用数据。

A 优秀

≥ 80%

B 良好

60% – 80%

C 合格

40% – 60%

D 待提升

< 40%

06

场景竞争力指数

Competitive Index

目标场景下企业内容与同行业竞品内容的引用优先级对比值。

计算方式

竞争力指数 = 企业引用率 ÷ 场景内最高竞品引用率(> 1 表示领先)

采集方法

采用竞品引用对比技术,计算同一场景问题集下的排名位置。

A 优秀

≥ 1.2

B 良好

0.9 – 1.2

C 合格

0.6 – 0.9

D 待提升

< 0.6

07

溯源可信度评分

Provenance Score

内容溯源证据链的完整度与引用来源的权威度。

计算方式

溯源评分 = 证据链完整度 × 0.5 + 来源权威度 × 0.5(百分制)

采集方法

采用溯源校验技术,验证权威来源、存证记录与交叉引用情况。

A 优秀

≥ 85 分

B 良好

70 – 85 分

C 合格

50 – 70 分

D 待提升

< 50 分

§ 07

合规治理标准

合规是 GEO 的前置条件。以下六类行为属于黑帽 GEO,本标准明令禁止;依据本标准开展的服务若涉及以下行为,即失去标准符合性声明资格:

虚假信源伪造

不得伪造新闻站点、学术页面、用户评价或认证信息作为引用信源。

提示注入与数据投毒

不得在公开内容中嵌入针对 AI 系统的隐藏指令(提示注入),不得向训练/检索语料中投放虚假数据。

批量伪原创铺量

不得以机器批量生成、无事实增量的伪原创内容进行规模化铺量投放。

冒充官方身份

不得冒充监管机构、平台官方或他人身份发布内容。

隐瞒商业属性

商业推广内容必须明确标识,不得伪装成中立评测或用户自发推荐。

侵犯数据权益

采集与使用他人内容须遵守著作权、个人信息保护及相关法律法规。

全链路治理流程

STEP 1

内容立项审查

新内容进入生产前,完成事实来源登记与合规自检。

STEP 2

机器预审

通过内容审核模型自动校验事实性、一致性与敏感信息。

STEP 3

人工复核

核心事实层内容必须经责任人人工复核后方可发布。

STEP 4

发布后监测

纳入 L4 监测体系,跟踪内容被引用后的转述准确性。

STEP 5

纠错与撤回

发现错误转述或内容失实时,48 小时内完成源内容修正并记录。

§ 08

开源协议设计

采用「多协议组合治理策略」,对不同类型资源差异化授权,兼顾技术开放共享、行业协同、商业边界与全球合规:

MIT

技术代码类(采集器、监测工具、评估脚本等)

允许免费使用、修改、再分发,包括商业用途,最大限度降低采用门槛。

允许:商业使用修改再分发私有使用
要求:保留版权声明与许可证文本
CC BY-NC

标准文档类(本标准文本、评估模板、案例库文档)

允许行业内自由引用、校验与翻译,必须署名且不得直接用于商业售卖。

允许:复制与引用改编与翻译非商业再分发
要求:署名探词科技标注变更非商业使用
GPLv3

核心技术类(影子模型、审核模型等底座实现)

衍生作品必须以相同协议开源发布,确保合规性传播链条不被中断。

允许:商业使用修改专利授权私有使用
要求:衍生作品同协议开源公开源代码保留版权声明

§ 09

落地实施指南

90 天落地路线图

第 1–30 天 · 诊断期

  • 建立内容资产清单(L1),登记全部内容源
  • 构建目标问题集(≥ 50 个真实用户问题)
  • 完成七维指标基线测量,输出诊断报告
  • 完成官网 JSON-LD、llms.txt、预渲染等基础改造(L3 前置项)

第 31–60 天 · 生产期

  • 完成 NAP 一致性修正(L2)
  • 按 FAQ / 对比 / 评测 / 定义块模板重构核心内容(L3)
  • 建立内容分级与合规审核流程(L2 / 第 7 章)
  • 确定信源投放清单并开始多渠道投放

第 61–90 天 · 闭环期

  • 上线日级监测看板(L4)
  • 完成首轮归因分析,输出策略迭代建议(L5)
  • 输出 30 天周期的七维指标变化报告
  • 进入「监测 → 归因 → 生产 → 投放」常态循环

GEO 成熟度模型

L0

未启动

无 GEO 意识,官网内容对 AI 不可读。

L1

基础可见

完成官网基础改造(结构化数据、llms.txt、无 JS 依赖读取)。

L2

内容体系化

核心内容完成结构化重构,NAP 一致性达标,开始多渠道投放。

L3

监测闭环

七维指标日级监测,月度归因报告,策略数据驱动。

L4

行业引领

引用率与竞争力指数达 A 级,对外输出方法论与开源工具。

上线自检清单

  • 官网已部署 Organization / WebSite / FAQPage 等 JSON-LD 结构化数据
  • 所有核心页面无需执行 JavaScript 即可读取完整内容(预渲染 / SSR)
  • 已发布 robots.txt 并显式放行主流 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 等)
  • 已发布 llms.txt 站点说明文件,包含公司简介、核心页面与可引用事实
  • 核心问答内容采用 FAQ / 对比表 / 定义块结构,结论前置
  • 内容分块 300–800 字,每块语义自洽可独立引用
  • 全网 NAP 信息(名称、联系方式、业务表述)一致
  • 已建立 ≥ 50 个问题的目标问题集并完成基线测量
  • 已建立日级监测与原始快照留存(≥ 180 天)机制
  • 商业推广内容已明确标识,无黑帽 GEO 行为

§ 10

开源协作模式

采用「行业级中立组织牵头 + 技术专项委员会治理 + 头部企业骨干贡献 + 全体从业者参与」的三级协作结构:

ORG / 01

行业级中立标准组织

由中立机构牵头,联合头部企业、科研机构与行业组织,成立开源标准工作组,作为标准治理的最高决策与管理机构。

ORG / 02

技术专项委员会

按技术场景分设专项委员会,每个委员会对应一个标准分方向,负责该方向的标准制定与修订。

ORG / 03

行业级技术项目仓库

在主流代码托管平台搭建开源项目仓库,作为标准资源的托管阵地与行业协作的核心技术入口。

贡献流程:任何人均可通过项目仓库提交 Issue 或修订提案(RFC)。提案经专项委员会评审、公开征求意见(不少于 14 天)后,由标准工作组投票纳入下一版本。本标准遵循语义化版本:勘误更新修订号,指标阈值调整更新次版本号,架构变更更新主版本号。

§ A

附录 · 技术实现参考

以下示例可直接复制落地。本站(知识中枢)即为按本标准 L3 层要求实现的参考实例:全站预渲染、JSON-LD 结构化数据、llms.txt 与 robots.txt 均已按附录规范部署。

A.1 robots.txt 放行 AI 爬虫(示例)
User-agent: *
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://example.com/sitemap.xml
A.2 llms.txt 站点说明(模板)
# 公司名称

> 一句话说明公司是做什么的(这段最常被 AI 引用)。

## 核心页面
- [产品](https://example.com/product): 产品说明
- [文档](https://example.com/docs): 使用文档

## 关键事实(可引用)
- 公司名称 / 成立时间 / 所在地
- 核心产品与服务
- 联系方式
A.3 FAQPage 结构化数据(JSON-LD 示例)
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "什么是 GEO(生成引擎优化)?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "GEO 是系统化提升品牌内容在生成式 AI 答案中可见性的方法体系……"
    }
  }]
}
</script>

// CONTRIBUTE

参与标准共建

标准当前为开放征求意见稿。欢迎通过 GitHub 提交 Issue / RFC,或发邮件至 hello@wordtrace.cn 署名加入贡献者名单。