一条 GEO 意图从发现到被引用有五个环节且顺序不能换:收集真实提问、登记进意图注册表、指定主答块并写标准答案、落到页面、实测引用状态并回写。跳过登记会导致同一问题在多个页面各写一遍,LLM 拿到矛盾证据后不引用任何一份;不做实测回写则这张表三个月后就是死表,因为 GEO 没有 GSC 这样的官方数据源。
从问题到答案块:一条 GEO 意图的生命周期
从供应商资料到网站产品页那篇讲过一条链:供应商资料 → 抽成事实 → 核对 → 登记关键词 → 生成页面 → 校验发布,五步顺序不能换。
这篇是同一套规矩在 GEO 侧的对应物。链条不同,但“为什么顺序不能换”的逻辑是同一套——每一步都在为下一步消除一类不可逆的错误。
真实提问 → ① 收集 → ② 登记入表 → ③ 指定主答块 + 写标准答案
↓
④ 落到页面 → ⑤ 实测回写
① 收集:来源要诚实排序
大部分讲 GEO 的内容会从“去 AI 里搜相关问题”开始。这个排序是错的。
| 来源 | 信号质量 | 说明 |
|---|---|---|
| 自己的询盘 / WhatsApp / 邮件记录 | ★★★★★ | 最高信号、独家、免费,而且已经在你手里 |
| 工程师专业论坛(Eng-Tips 等) | ★★★★★ | 真正在做选型的人在讨论 |
| 销售被反复追问的问题 | ★★★★★ | 和第一条同源,但常常没人记录 |
| AI 引擎自己的追问建议 | ★★★★ | 问一个问题,看它推荐的 related questions |
| GSC 里的长尾 query | ★★★☆ | 已经是压缩过的词形,但能反映真实提问方式 |
| Reddit 等综合社区 | ★★★ | 量大、语言鲜活,工业细分密度不如专业论坛 |
| 关键词工具 | ★☆ | 基本无效,它给的是词不是问 |
第一条最常被跳过,理由通常是“那些记录太乱了”。后面的真实需求挖掘会完整展开来源和清洗方法;这里先给结论:如果只做一件事,应该把过去两年的询盘往来倒出来做聚类,而不是先去爬论坛。
这一步的产出是一个 raw list,不需要整理、不需要分类、不需要改写成标准问句。整理是下一步的事,在这一步做整理只会拖慢收集。
一条门槛:同一个纠结点至少在 3 个独立来源出现过,才值得进入下一步。单条提问可能是个例,频次是唯一可靠的普遍性信号。
② 登记:这一步最容易被跳过,跳过的代价最大
拿到一批问题之后,最自然的冲动是:挑几个好的,直接去写 FAQ。
别。先登记。
跳过登记会发生什么
同一个问题会在三个页面各被写一遍。不是因为有人偷懒,而是因为三个人(或三次会话)分别处理了三个页面,每次都觉得“这个问题该答一下”。
结果就是第 74 篇里那个例子:
/products/cp-100/ 标准配置最高 120°C
/applications/chemical/ 最高工作温度 120°C (248°F)
/blog/high-temp-pumps/ 可以做到 125°C 左右
LLM 一次检索拿到三个 chunk,三个数字不完全一致。它的处理方式是:随便挑一个、含糊地说“说法不一”、或者挑了那个错的。
这就是 GEO 版的 Cannibalization。 但它和 SEO 侧的表现完全不同——SEO 侧的抢词表现为排名分散,你能在 GSC 里看到;GEO 侧的自相矛盾不表现为任何可见指标,它表现为“你就是不被引用”,而你不知道为什么。
登记时做三件事
- 去重:这个问题是不是已经在表里?注意查
variants,同一个意图会有多种问法 - 判断是否已有主答块:如果有,这次要做的是给某个页面加复述块,不是新建主答
- 分类:按第 75 篇的六类打一个
intent_class,单值
登记不等于要写。 表里可以有一批 status: draft 的问题,登记了但还没排期。这比“想到了但没记”强得多——没记的问题半年后会被重新发现一遍,然后被重新写一遍。
后面的第 69 篇会在产品上新流程里应用同一条规矩:先登记,再生成页面。 差别在于:SEO 侧对账的是会不会抢词,GEO 侧对账的是会不会矛盾。
③ 指定主答块并写标准答案
主答块归属:看提问者的处境,不看页面主题
两个页面都想主答同一个问题时,用一个判据:
谁的上下文更接近提问者当时的处境?
不是“谁的主题更相关”,也不是“谁的信息更全”。
举例:问“60% 硫酸 80°C 该用什么材质”的人,正在做选型。这条意图的主答块应该在应用选型页(/applications/chemical-transfer-pump/),而不是 SKU 页——尽管 SKU 页的参数更全、材质表更完整。
理由:被检索到之后,LLM 要给的是一个选型建议。应用页的上下文是“化工输送场景下怎么选”,天然贴合;SKU 页的上下文是“CP-100 这个型号的规格”,它能提供数据,但提供不了判断。
如果两边都合理,判定顺序是:应用页 > 资源页 > SKU 页 > Pillar 页。越靠近具体工况的,越优先。
冲突不能静默处理
两个页面都声称主答同一条意图,脚本发现之后,要么标记冲突等人裁决,要么拆成两条不同的意图。不能随便留一个。
后面的第 69 篇会在供应商参数冲突场景里应用同一条规矩——静默取值是把一个“你知道自己不知道”的问题,变成“你以为自己知道”的问题。
写标准答案:数字来自事实层,散文来自模型
AI 的边界划在哪的规矩在这里原样生效:
✅ 交给模型:把问题改写成自包含的问句标题、组织句子结构、
调整语气、生成 variants
❌ 绝不交给模型:任何一个数字、认证编号、温度上限、材质牌号
具体做法是模板占位符——模型只准填占位符,值从事实层取:
模板:The {model} operates from {temp_min} to {temp_max}
({temp_min_f} to {temp_max_f}) in its standard configuration.
填值:products.cp-100.temp_min / temp_max(由脚本注入)
一条 GEO 特有的补充规矩
第 74 篇讲过 confidence:对外说话的确定性不能超过手上事实的确定性。
在这一步它变成一个具体动作:confidence 是 verbal 或 estimated 的,⑤ 资格合规型问题一律不答,把 status 留在 draft,去查证。
写一个没有证书支撑的“Yes, it’s ATEX certified”,最好的结果是没人引用,最坏的结果是被引用之后客户按它做了合规申报。
④ 落到页面
格式规范全部沿用FAQ 模块设计和模块化 FAQ 设计两篇,这里不重复。只补两条 GEO 注册表特有的:
第一,落地时必须同时写入 anchor。 没有 anchor 的答案块永远无法被审计——脚本不知道去哪里找它。这一步偷懒,第 ⑤ 步和第 78 篇的所有检查都会失效。
<h3 id="max-operating-temperature">What is the maximum operating
temperature of the CP-100 centrifugal pump?</h3>
第二,复述块要带回链。上一篇讲过原因:chunk 被单独提取后,块里的链接决定 LLM 能不能拿到更完整的上下文。
⑤ 实测回写:这张表唯一的“排名数据”
SEO 有 GSC——排名、曝光、点击,官方数据,每天更新。
GEO 什么都没有。
没有官方工具告诉你“你的内容这个月被引用了多少次”。GA4 里能看到一点 referral 流量(来自 perplexity.ai、chat.openai.com 之类),但那只是被引用之后有人点了链接,远远不是全貌——大量 AI 引用是不产生点击的。
所以 citation_status 字段就是你唯一的排名数据。不回写,这张表三个月后就是一张死表。
实测的规模必须自我克制
这是最容易做崩的一步。看到“要实测”,很容易定成“每月把表里所有问题跑一遍”。第三个月就没人跑了。
推荐规模:20–40 条,季度一次。
挑选判据(三条同时满足):
priority≥ 4self_answerable: true- 有
fact_refs或evidence(即答案有依据,值得被引)
② 条件选型型的问题应该在这个集合里占大头——它们离成交最近,值得花时间测。
变量必须固定
不固定变量,测了也没法比较:
- 固定问题集:这个季度测的 30 条,下个季度还是这 30 条。想加新的,加在集合外单独记
- 固定引擎:选 2–3 个(如 Perplexity + ChatGPT 搜索 + Google AI Overview),每次都测这几个
- 固定记录字段:是否引用 / 引用了哪个 URL / 信息准不准
- 固定提问方式:用表里的
question原文,不要临场改写
三种结果,三种处置
| 结果 | 含义 | 处置 |
|---|---|---|
not_cited |
没被引 | 检查结构(自包含?有 anchor?)和证据(有没有标准引用)。参考第 78 篇的三层审计 |
cited |
被引且准确 | 记下来,别动。已经在被引用的答案,改写有风险 |
miscited |
被引但信息错了 | 最高优先级。 回查是不是复述块和主答块分叉了 |
第三种为什么最急,GEO 覆盖审计那篇已经说过:错误信息在替你损害品牌,而且它比“没被引用”更难被发现——因为从外部看,你确实“被 AI 引用了”,看起来是好事。
更新和新增是两件事
一条意图上线之后,会经历两类变化,处理方式不同。
事实变了(供应商换版、参数修订、证书更新):
反查 fact_refs,找出所有引用了这个字段的意图,主答块和所有复述块一起改。如果你按上一篇做了渲染式复述,这是一次修改;如果还在手写,这是 N 次修改,且必然漏。
答案的表达要优化(实测发现没被引用,想改写措辞):
只改 canonical_answer 和主答块,页面上已经润色过的展开段落不该被覆盖。
这两件事的边界必须事先划清,否则会陷入“每次改一个数字都要重写一整页”。后面的第 69 篇会把同一条边界应用到产品上新流程:哪一块归机器管,哪一块归人管。
落到日常:怎么把这条链跑起来
理想形态不是每一步都手动做,而是把 ①②③ 串起来跑,在 ③ 之后停一次。
一次典型的批量处理:
输入:一份 raw list(30 条从询盘记录里倒出来的问题)
AI 执行:
① 聚类去重 → 12 个反复出现的问题
② 与现有注册表比对 → 8 条新意图 / 3 条已有主答(建议加复述)/ 1 条重复
③ 按六类分类 + 建议主答块归属 + 标出 self_answerable
⏸ 停在这里,输出待确认清单
你确认:
- 主答块归属对不对(这是唯一必须人来定的)
- self_answerable 的判断对不对
- 哪几条这个季度要做,哪几条留 draft
AI 继续:
③后半 写 canonical_answer(占位符版,数字留空)
④ 生成页面块并注入 anchor
你执行:
数字从事实层填入,发布
为什么闸门放在 ③ 之后,而不是最后:AI 的边界划在哪讲过这条原则——人机闸门要放在信息最容易被验证的那一步。主答块归属这件事,看着一张 12 行的清单,你几分钟就能判完;等生成了十几个页面块,你面对满屏内容无从下手,审核就退化成走过场。
提示词要点(完整版在工具箱篇):
- 强制输出「聚类 + 原始表述 + 频次 + 六分类 + 建议主答块 + 冲突标记」
- 显式禁止它回答技术问题——它的任务是归类和归属,不是判断某个技术说法对不对
- 显式要求「找不到对应事实层字段就标
fact_refs: MISSING,不要编」
小结
五步的顺序,各自在防一类不可逆的错误:
| 步骤 | 不做会怎样 |
|---|---|
| ① 收集 | 选题来自关键词工具,永远拿不到带约束条件的真问题 |
| ② 登记 | 同一问题多处各写一遍 → 自相矛盾 → 谁都不引 |
| ③ 指定主答块 | 没有基准版本,一致性无从谈起 |
| ④ 落到页面(带 anchor) | 无法审计,后面所有检查失效 |
| ⑤ 实测回写 | 没有观测,这张表三个月后就死了 |
两个加粗的是最常被跳过、代价最大的。② 跳过之后你不会看到任何报错,只会慢慢发现自己在 AI 里没有存在感;⑤ 跳过之后表还在,但已经没人知道它准不准了。
下一篇讲怎么把这些检查自动化:GEO 审计从“结构合规”升级到“覆盖 + 一致 + 引用”三层。
→ GEO 审计升级:从「结构合规」到「有没有被引用」
RELATED / 相关推荐
接着读这些
按同一分类、系列与标签为你挑选。
GEO 意图注册表设计:问题、答案块与一致复述约束
这张表的一行不是关键词,是「一个问题 → 一个主答块」的绑定。主答块精确到 slug + anchor,标准答案只存一句话,句子里每个数字指回产品事实层。这篇讲全部字段的设计逻辑、一致复述的三条规矩、以及为什么必须有一个「这个问题我们赢不了」的标记位。
GEO 意图分类:为什么不能照抄 SEO 三仓
SEO 三仓按词形分类——含 manufacturer 归商业、含 what is 归知识。这套规则切不动 AI 里的提问,因为人对着 AI 说的话带条件、带情境、带纠结,词形特征全被稀释了。这篇给出按约束条件完整度重新划分的六类意图,以及每一类对应的答案写法。
为什么关键词注册表管不了 AI 搜索:词与问的三层错位
注册表覆盖率 100%、GEO 审计全绿,去 Perplexity 问一句带条件的问题,引用的还是别人。因为关键词注册表索引的是"词—页面",AI 搜索匹配的是"问题—答案块"。这篇讲清楚两者之间的三层错位,以及为什么第三层决定了必须建第二张表,而不是给注册表加几个字段。