§ 00
核心摘要
生成式引擎优化(GEO)正随着信息获取范式的根本性转变兴起——用户从「主动搜索、点击链接、浏览网页」的传统路径,转向「提出问题、AI 直接生成答案」的新模式。这一范式更迭的核心逻辑是:生成式引擎不再以「网页链接排名」为核心输出,而是基于多源内容检索、综合加工后直接给出结论。此时品牌或信息的可见度,本质上取决于其能否成为生成式答案的权威引用来源。
与传统 SEO 聚焦网页关键词匹配、追求搜索结果页高排名的逻辑完全不同,GEO 的本质是优化生成式引擎的检索与上下文引用逻辑——它不改造生成式引擎本身,而是调整外部内容的结构、语义、权威性与分发策略,让内容在大模型的检索增强生成(RAG)链路中被优先召回、高置信度采信,最终进入生成式答案的核心上下文。
本标准由探词科技发起并以开源协议发布,目标是为行业提供统一的技术语言、可量化的效果指标、明确的合规红线与可复制的落地路径。任何机构均可依据本标准开展 GEO 实践、开发与标准兼容的工具,或参与标准修订。
§ 01
范围与定义边界
本标准规定了生成式引擎优化的术语定义、总体技术架构(L1–L5)、量化评估指标体系(七维)、合规治理要求与落地实施方法,适用于:
- ›开展 GEO 实践的品牌方、增长团队与内容团队;
- ›提供 GEO 相关工具与服务的技术厂商;
- ›希望评估自身在生成式引擎中可见性的任何组织;
- ›参与本标准开源共建的研究机构与个人贡献者。
本标准不适用于:针对生成式引擎的对抗性攻击、模型逆向与任何形式的答案操纵(参见第 7 章禁止性行为)。本标准中的「MUST」为强制要求,「SHOULD」为建议要求;合规验收以 MUST 项全部满足为前提。
§ 02
术语与定义
生成式引擎优化
Generative Engine Optimization (GEO)通过调整外部内容的结构、语义、权威性与分发策略,提升特定信息在生成式引擎答案中被召回、引用与推荐的概率与权重的系统性方法。GEO 不改造生成式引擎本身。
生成式引擎
Generative Engine基于大语言模型,对用户问题直接生成综合答案的系统,包括但不限于豆包、DeepSeek、通义千问、Kimi、文心一言、腾讯元宝、ChatGPT、Claude、Gemini、Perplexity 及各类 AI 智能体。
AI 引用率
Citation Rate在标准目标查询集合中,品牌内容被生成式引擎作为信源引用的查询占比,是 GEO 效果的首要指标。
权威信源
Authoritative Source经行业共识或平台机制认定、在特定领域具备高可信度的内容来源,如官方网站、学术出版物、行业目录、主流知识社区中的认证内容。
名称-地址-电话一致性
NAP Consistency企业核心实体信息(名称、联系方式、地址、业务表述)在全网各平台及各生成式引擎答案中的一致程度。
RAG 适配
RAG Adaptation针对检索增强生成链路的优化:使内容在分块、向量化、召回、重排序各环节均保持语义完整与高置信度。
结构化内容
Structured Content遵循明确格式规范(FAQ、对比表、评测、定义块、步骤列表等)并带有机器可读标记(JSON-LD 等)的内容形态。
溯源证据链
Source Provenance内容从创作、发布、修订到被引用的完整可验证记录,包括署名、时间戳、存证与交叉引用关系。
影子模型
Shadow Model用于近似模拟主流生成式引擎检索与引用行为的代理模型簇,以低成本实现可见性监测。探词科技自研技术。
黑帽 GEO
Black-hat GEO通过虚假信源、批量伪原创、提示注入、数据投毒等操纵生成式引擎答案的行为,属本标准明令禁止的行为。
§ 03
GEO 与 SEO 的区别及联系
GEO 不是 SEO 的替代品,而是信息获取范式转移后的新增战场。两者共享「内容质量与权威性」的底座,但在目标、技术逻辑与指标上存在本质差异:
§ 04
行业痛点与设计原则
PAIN / 01
优化方法不统一
不同生成式引擎的检索与引用逻辑存在差异,行业沿用 SEO 粗放式运营逻辑,存在内容无结构化、信源无分级、知识无体系等问题。
PAIN / 02
性能指标不一致
传统 SEO 的关键词排名、网站流量等指标无法适配 GEO 的引用场景,行业长期缺乏统一的效果衡量维度。
PAIN / 03
安全合规漏洞多
生成式引擎的「信息加工」本质可能被滥用为传播虚假信息的工具,风险传导性更强,亟需全链路治理。
↓ 对应的系统性设计原则
PRINCIPLE / 01
分层定义
清晰界定不同层级的技术标准与规范边界,各层可独立实施、独立验收。
PRINCIPLE / 02
开源协议定制
为代码、文档、核心技术等不同类型资源匹配差异化的开源授权方案。
PRINCIPLE / 03
标准模块化
将复杂标准拆分为可独立执行的技术模块,企业可按需分阶段落地。
PRINCIPLE / 04
合规底座加固
建立全链路的合规性校验与治理机制,合规是前置条件而非事后补救。
§ 05
GEO 标准五层架构模型
五层架构将 GEO 实践拆分为可独立实施、独立验收的技术层:自底向上依次为数据接入、内容治理、智能优化、效果监测与策略分析。企业可从任一层切入,但合规验收要求 L1–L3 的 MUST 项先行完成。
数据接入层
统一采集入口,对接企业多渠道内容资源,屏蔽不同资源平台的技术差异。
核心技术模块
- ▸企业官网标准化采集模块
- ▸公众号 / 视频号采集模块
- ▸电商平台内容采集模块
- ▸自媒体平台采集模块
- ▸外部权威知识库对接模块
规范要求
- MUST建立内容资产清单,登记每一内容源的地址、格式、更新频率与责任人。
- MUST采集行为遵守目标平台的 robots 协议与服务条款,不得绕过访问控制。
- SHOULD采集管道具备增量更新能力,内容变更到入库的延迟不超过 24 小时。
- SHOULD多模态内容(图片、视频、音频)应同时采集其文本替代信息(标题、字幕、摘要)。
内容治理层
对采集内容进行标准化清洗、校验、提纯,生成干净、无噪声的语义内容。
核心技术模块
- ▸内容清洗去重模块
- ▸实体标准化识别模块
- ▸语义纠错模块
- ▸多模态内容对齐模块
- ▸合规审核模块
规范要求
- MUST全网核心实体信息(名称、联系方式、业务表述)完成 NAP 一致性校验,错误项有修正记录。
- MUST所有进入分发环节的内容经过事实性校验,关键数据可回溯到一手来源。
- MUST建立内容分级制度:核心事实层(不可出错)、观点层(需署名)、营销层(需标识)。
- SHOULD重复内容合并率应达到 95% 以上,同一事实在知识库中只保留唯一权威版本。
智能优化层
核心技术适配层,将标准化内容转化为生成式引擎易理解、高置信度的格式。
核心技术模块
- ▸结构化数据标记模块(JSON-LD / Schema.org)
- ▸语义向量对齐模块
- ▸知识图谱构建模块
- ▸多模态内容适配模块
- ▸RAG 索引适配模块
规范要求
- MUST官网核心页面部署 JSON-LD 结构化数据(Organization / WebSite / FAQPage / Article 等)。
- MUST页面内容为无 JS 依赖可直接读取(预渲染或服务端渲染),并提供 llms.txt 站点说明。
- MUST核心问答内容采用 FAQ、对比表、定义块等 AI 易引用结构,关键结论前置。
- SHOULD内容分块粒度控制在 300–800 字/块,每块语义自洽、可独立成段被引用。
- SHOULD为关键内容提供 RSS / API 等机器可读分发通道。
效果监测层
实时采集内容在各生成式平台的表现数据,为优化策略调整提供支撑。
核心技术模块
- ▸多平台引用监测模块
- ▸实体权威度分析模块
- ▸内容一致性校验模块
- ▸影子模型监测模块
规范要求
- MUST建立目标问题集(不少于 50 个真实用户问题),按日级频率监测各平台答案中的提及与引用。
- MUST监测数据保留原始快照(答案全文 + 信源列表 + 时间戳),留存期不少于 180 天。
- SHOULD监测覆盖本标准附录所列主流平台中的至少 5 个,中英文场景至少各 1 个。
- SHOULD采用影子模型簇进行高频预筛,降低全量监测成本。
策略分析层
对监测数据进行系统性分析,闭环指导优化策略迭代。
核心技术模块
- ▸NAP 一致性分析引擎
- ▸引用率归因分析引擎
- ▸多平台重排序优化模块
规范要求
- MUST每次策略调整基于监测数据归因,记录假设、动作与结果的完整实验日志。
- MUST以 30 天为最小评估周期,输出七维指标的变化报告。
- SHOULD建立竞品基准对照,场景竞争力指数按周更新。
- SHOULD分析结论反哺 L1–L3 层,形成「监测 → 归因 → 生产 → 投放」闭环。
§ 06
七维量化评估指标体系
指标体系是 GEO 效果衡量的统一语言。七个维度均可量化采集,按 A / B / C / D 四级评定;建议以 30 天为最小评估周期输出变化报告。
AI 引用率
Citation Rate在标准目标查询集合中,企业内容被生成式引擎作为信源引用的比例。
计算方式
引用率 = 引用企业内容的答案数 ÷ 目标查询总数 × 100%
采集方法
采用标准 AI 爬虫模拟工具,采集主流生成式引擎对目标问题集的公开回答。
A 优秀
≥ 40%
B 良好
20% – 40%
C 合格
5% – 20%
D 待提升
< 5%
推荐位置权重
Position Weight企业内容在生成式答案信源列表中的排序位置,及在核心结论中的提及方式。
计算方式
位置权重 = Σ(信源位次得分) ÷ 引用次数;首位 = 1.0,第 2–3 位 = 0.6,其余 = 0.3
采集方法
采用标准 DOM 解析技术,提取信源列表排序位置与正文提及位置。
A 优秀
≥ 0.8
B 良好
0.6 – 0.8
C 合格
0.4 – 0.6
D 待提升
< 0.4
叙事准确性
Narrative Accuracy生成式答案中企业核心信息、品牌表述、业务数据被准确转述的比例。
计算方式
准确性 = 准确转述的关键事实数 ÷ 抽样关键事实总数 × 100%
采集方法
采用语义相似度比对技术,将生成式答案与企业标准知识库逐条比对。
A 优秀
≥ 95%
B 良好
85% – 95%
C 合格
70% – 85%
D 待提升
< 70%
内容一致性
Content Consistency企业核心信息在不同生成式引擎、不同场景下表述的一致率。
计算方式
一致性 = 跨平台表述一致的事实数 ÷ 跨平台抽样事实总数 × 100%
采集方法
采用 NAP 一致性分析引擎,跨平台采集公众表述内容并两两比对。
A 优秀
≥ 95%
B 良好
85% – 95%
C 合格
70% – 85%
D 待提升
< 70%
平台覆盖度
Platform Coverage企业内容在本标准规定的主流生成式引擎中被引用的平台覆盖比例。
计算方式
覆盖度 = 有引用记录的平台数 ÷ 目标平台总数 × 100%
采集方法
采用多平台 API 对接与模拟查询技术,汇总各平台引用数据。
A 优秀
≥ 80%
B 良好
60% – 80%
C 合格
40% – 60%
D 待提升
< 40%
场景竞争力指数
Competitive Index目标场景下企业内容与同行业竞品内容的引用优先级对比值。
计算方式
竞争力指数 = 企业引用率 ÷ 场景内最高竞品引用率(> 1 表示领先)
采集方法
采用竞品引用对比技术,计算同一场景问题集下的排名位置。
A 优秀
≥ 1.2
B 良好
0.9 – 1.2
C 合格
0.6 – 0.9
D 待提升
< 0.6
溯源可信度评分
Provenance Score内容溯源证据链的完整度与引用来源的权威度。
计算方式
溯源评分 = 证据链完整度 × 0.5 + 来源权威度 × 0.5(百分制)
采集方法
采用溯源校验技术,验证权威来源、存证记录与交叉引用情况。
A 优秀
≥ 85 分
B 良好
70 – 85 分
C 合格
50 – 70 分
D 待提升
< 50 分
§ 07
合规治理标准
合规是 GEO 的前置条件。以下六类行为属于黑帽 GEO,本标准明令禁止;依据本标准开展的服务若涉及以下行为,即失去标准符合性声明资格:
虚假信源伪造
不得伪造新闻站点、学术页面、用户评价或认证信息作为引用信源。
提示注入与数据投毒
不得在公开内容中嵌入针对 AI 系统的隐藏指令(提示注入),不得向训练/检索语料中投放虚假数据。
批量伪原创铺量
不得以机器批量生成、无事实增量的伪原创内容进行规模化铺量投放。
冒充官方身份
不得冒充监管机构、平台官方或他人身份发布内容。
隐瞒商业属性
商业推广内容必须明确标识,不得伪装成中立评测或用户自发推荐。
侵犯数据权益
采集与使用他人内容须遵守著作权、个人信息保护及相关法律法规。
全链路治理流程
STEP 1
内容立项审查
新内容进入生产前,完成事实来源登记与合规自检。
STEP 2
机器预审
通过内容审核模型自动校验事实性、一致性与敏感信息。
STEP 3
人工复核
核心事实层内容必须经责任人人工复核后方可发布。
STEP 4
发布后监测
纳入 L4 监测体系,跟踪内容被引用后的转述准确性。
STEP 5
纠错与撤回
发现错误转述或内容失实时,48 小时内完成源内容修正并记录。
§ 08
开源协议设计
采用「多协议组合治理策略」,对不同类型资源差异化授权,兼顾技术开放共享、行业协同、商业边界与全球合规:
技术代码类(采集器、监测工具、评估脚本等)
允许免费使用、修改、再分发,包括商业用途,最大限度降低采用门槛。
标准文档类(本标准文本、评估模板、案例库文档)
允许行业内自由引用、校验与翻译,必须署名且不得直接用于商业售卖。
核心技术类(影子模型、审核模型等底座实现)
衍生作品必须以相同协议开源发布,确保合规性传播链条不被中断。
§ 09
落地实施指南
90 天落地路线图
第 1–30 天 · 诊断期
- ›建立内容资产清单(L1),登记全部内容源
- ›构建目标问题集(≥ 50 个真实用户问题)
- ›完成七维指标基线测量,输出诊断报告
- ›完成官网 JSON-LD、llms.txt、预渲染等基础改造(L3 前置项)
第 31–60 天 · 生产期
- ›完成 NAP 一致性修正(L2)
- ›按 FAQ / 对比 / 评测 / 定义块模板重构核心内容(L3)
- ›建立内容分级与合规审核流程(L2 / 第 7 章)
- ›确定信源投放清单并开始多渠道投放
第 61–90 天 · 闭环期
- ›上线日级监测看板(L4)
- ›完成首轮归因分析,输出策略迭代建议(L5)
- ›输出 30 天周期的七维指标变化报告
- ›进入「监测 → 归因 → 生产 → 投放」常态循环
GEO 成熟度模型
L0
未启动
无 GEO 意识,官网内容对 AI 不可读。
L1
基础可见
完成官网基础改造(结构化数据、llms.txt、无 JS 依赖读取)。
L2
内容体系化
核心内容完成结构化重构,NAP 一致性达标,开始多渠道投放。
L3
监测闭环
七维指标日级监测,月度归因报告,策略数据驱动。
L4
行业引领
引用率与竞争力指数达 A 级,对外输出方法论与开源工具。
上线自检清单
- ✓官网已部署 Organization / WebSite / FAQPage 等 JSON-LD 结构化数据
- ✓所有核心页面无需执行 JavaScript 即可读取完整内容(预渲染 / SSR)
- ✓已发布 robots.txt 并显式放行主流 AI 爬虫(GPTBot、ClaudeBot、PerplexityBot 等)
- ✓已发布 llms.txt 站点说明文件,包含公司简介、核心页面与可引用事实
- ✓核心问答内容采用 FAQ / 对比表 / 定义块结构,结论前置
- ✓内容分块 300–800 字,每块语义自洽可独立引用
- ✓全网 NAP 信息(名称、联系方式、业务表述)一致
- ✓已建立 ≥ 50 个问题的目标问题集并完成基线测量
- ✓已建立日级监测与原始快照留存(≥ 180 天)机制
- ✓商业推广内容已明确标识,无黑帽 GEO 行为
§ 10
开源协作模式
采用「行业级中立组织牵头 + 技术专项委员会治理 + 头部企业骨干贡献 + 全体从业者参与」的三级协作结构:
ORG / 01
行业级中立标准组织
由中立机构牵头,联合头部企业、科研机构与行业组织,成立开源标准工作组,作为标准治理的最高决策与管理机构。
ORG / 02
技术专项委员会
按技术场景分设专项委员会,每个委员会对应一个标准分方向,负责该方向的标准制定与修订。
ORG / 03
行业级技术项目仓库
在主流代码托管平台搭建开源项目仓库,作为标准资源的托管阵地与行业协作的核心技术入口。
贡献流程:任何人均可通过项目仓库提交 Issue 或修订提案(RFC)。提案经专项委员会评审、公开征求意见(不少于 14 天)后,由标准工作组投票纳入下一版本。本标准遵循语义化版本:勘误更新修订号,指标阈值调整更新次版本号,架构变更更新主版本号。
§ A
附录 · 技术实现参考
以下示例可直接复制落地。本站(知识中枢)即为按本标准 L3 层要求实现的参考实例:全站预渲染、JSON-LD 结构化数据、llms.txt 与 robots.txt 均已按附录规范部署。
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://example.com/sitemap.xml# 公司名称
> 一句话说明公司是做什么的(这段最常被 AI 引用)。
## 核心页面
- [产品](https://example.com/product): 产品说明
- [文档](https://example.com/docs): 使用文档
## 关键事实(可引用)
- 公司名称 / 成立时间 / 所在地
- 核心产品与服务
- 联系方式<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "FAQPage",
"mainEntity": [{
"@type": "Question",
"name": "什么是 GEO(生成引擎优化)?",
"acceptedAnswer": {
"@type": "Answer",
"text": "GEO 是系统化提升品牌内容在生成式 AI 答案中可见性的方法体系……"
}
}]
}
</script>// CONTRIBUTE
参与标准共建
标准当前为开放征求意见稿。欢迎通过 GitHub 提交 Issue / RFC,或发邮件至 hello@wordtrace.cn 署名加入贡献者名单。
