关键词注册表索引的是"词—页面"绑定,AI 搜索检索的是"问题—答案块"匹配,两者有三层错位:粒度(词 vs 带约束条件的整句)、归属(页面 vs 页面上的一个块)、唯一性约束方向(一词一页禁止重复 vs 同一条答案必须一致地出现在多处)。第三层决定了这不是加字段能解决的问题,必须建第二张表。
为什么关键词注册表管不了 AI 搜索:词与问的三层错位
一个让人想不通的场景
假设你已经完成关键词注册表、Pillar-Cluster、页面级 GEO 规范,并跑过第 49 篇的结构审计。
注册表建得很规范:sulfuric acid pump 这个词归属明确,写在 /applications/chemical-transfer-pump/ 名下,NKW 里挡掉了 manufacturer 和 what is,priority 打了 4 分。GEO 覆盖审计跑下来六项全绿——robots.txt 放行了所有 AI 爬虫、页面是服务端渲染、FAQ 全用 H3 标签、参数表带 caption、hreflang 双向自引用、JSON-LD 完整。
然后你去 Perplexity 问一句:
We're transferring 60% sulfuric acid at 80°C. Is a mag drive pump
overkill here, or should I just spec a double mechanical seal?
回答引用了三个来源:一家德国泵厂的选型指南、一个化工论坛的帖子、一份 NACE 的材料手册。没有你。
你的注册表里找不到任何一行对应这句话。不是因为你漏了这个词——而是因为这句话根本不是一个词。
这就是本篇要讲的事:关键词注册表和 AI 搜索之间隔着三层错位。前两层是粒度和归属的问题,能靠细化解决;第三层是约束方向的问题,解决不了——只能再建一张表。
错位一:粒度——词是意图的残骸
搜索框教会了所有人一件事:把话说短。
一个工程师脑子里的真实问题是“60% 浓度的硫酸、80 度、要连续运转、预算有限,磁力泵和双端面机封哪个划算”。他往 Google 搜索框里敲的是:
sulfuric acid pump
三个约束条件(浓度、温度、成本考量)在敲进搜索框的那一刻全被扔掉了。你的关键词工具看到的是扔掉之后的残骸,你的注册表索引的也是残骸。
对着 AI 说话,不需要压缩。
❌ 搜索框里:sulfuric acid pump
✅ AI 对话框里:We're transferring 60% sulfuric acid at 80°C, continuous
duty, and cost is a real constraint. Is a mag drive pump overkill,
or is a double mechanical seal with barrier fluid good enough?
三个约束条件原样保留了下来。这带来两个后果:
后果一:这类提问在关键词工具里显示零搜索量。 因为它不是一个“搜索词”,没人这样敲搜索框。你用 Ahrefs 或 Semrush 扒竞品,永远扒不出这句话。
后果二:这类提问离成交最近。 一个能把浓度、温度、工况、预算一次说清楚的人,是已经在做选型的人,不是在做科普调研的人。他缺的不是知识,是一个敢下结论的建议。
所以这里有一个反直觉的推论:
在 B2B 工业品里,零搜索量的提问往往比高搜索量的词更值钱。 一个采购工程师的一次提问,可能值几万美金;
sulfuric acid pump每月 800 的搜索量里, 大部分是学生、竞品和随便看看的人。
后面的真实需求挖掘会专门讲这类问题该去哪里找;这篇先解决另一半:问题挖到之后,现有关键词注册表装不下它。
错位二:归属——Google 排页面,AI 引块
关键词注册表最核心的字段是 page_slug:这个词归哪个页面。
这个设计是对的,因为 Google 就是这么工作的——它给页面打分,排名靠前的页面获得点击。归属对象是页面,天经地义。
AI 搜索不是这样。模块化 FAQ 设计那篇讲过 RAG 的机制:
- 把页面切成 chunk(通常 300–800 token)
- 用户问题和每个 chunk 做语义匹配
- 取最相关的几个 chunk 进上下文
- LLM 基于这些 chunk 生成答案并标注来源
被引用的是 chunk,不是页面。
这个差别在实践中比听起来大得多。举个具体的:
你的 /products/cp-100/ 页面上有八个问答块、一张参数表、三段正文。Google 眼里这是一个页面,它整体排名。AI 眼里这是十二个独立的候选片段,它们各自去竞争不同的问题。
于是就出现了一种在 SEO 世界里不存在的状态:
同一个页面,可以在一个问题上被引用,同时在另一个问题上完全隐形。
排名不存在这种事——一个页面要么排在第 3 位,要么排在第 30 位,它是一个整体。
所以当你说“这个页面负责这个问题”的时候,你其实什么都没说清楚。这个页面上的哪一块负责?如果审计脚本要检查“这条答案落地了没有”,它该去页面的什么位置找?如果这条答案同时出现在三个页面上,哪一份是准的?
要回答这些问题,归属对象必须精确到块:
❌ 归属:/products/cp-100/
✅ 归属:/products/cp-100/#max-operating-temperature
带上锚点之后,“这条答案在哪、落地没有、和别处一不一致”才从一句空话变成三个可以用脚本回答的问题。
错位三:唯一性约束的方向是相反的
前两层错位,理论上还能靠“把注册表做细”来应付——加一个 question 字段存原话,加一个 anchor 字段存锚点,看起来问题就解决了。
第三层错位堵死了这条路。
注册表的约束:禁止重复
中央关键词注册表设计那篇写得很清楚,注册表的存在理由就一句话:
这个词,永远只属于这个页面。
一个词出现在两个页面上,就是 Cannibalization,就是两个页面互相削弱、最后一起排不进前三页。所以注册表的核心约束是唯一归属:一词一页,禁止重复。NKW 字段的全部意义,就是主动把别的页面挡在门外。
GEO 的约束:必须重复,但只能有一个版本
AI 搜索这边,规则反过来了。
因为检索是块级的,用户可能从任何一个入口进来。一个正在看 CP-100 型号页的人,会问“这个泵能不能上 120 度”;一个正在看化工输送应用页的人,也会问同一件事;一个在看材质对比文章的人,还是会问同一件事。
这三个页面都应该有这条答案。 谁都不知道 RAG 会命中哪一块——如果只有型号页写了,另外两页的读者提问时,被引用的就是别人。
在 SEO 世界里,同一条内容出现在三个页面叫内耗;在 GEO 世界里,这叫覆盖。
但重复立刻带来新的风险。三个页面各写各的,半年之后会变成这样:
/products/cp-100/ 标准配置最高 120°C
/applications/chemical/ 最高工作温度 120°C (248°F)
/blog/high-temp-pumps/ 可以做到 125°C 左右
第三条是八个月前写的,当时问的是另一家供应商。现在 LLM 一次检索拿到三个 chunk,三个数字不完全一致,它会做三件事之一:随便挑一个、含糊地说“报道不一”、或者挑了那个错的。
第三种是最坏的——GEO 覆盖审计那篇已经点过这个判断:被引用但信息错误,比完全不被引用更该优先处理,因为它在替你对客户散播错误参数。
所以 GEO 侧的约束不是“禁止重复”,而是:
该重复的地方必须重复,但全站只能有一个版本。
两条约束没法写进同一张表
把两条约束并排放,问题就一目了然了:
| 关键词注册表 | GEO 侧需要的约束 | |
|---|---|---|
| 记录单位 | 词 | 完整问句(含约束条件) |
| 归属对象 | 页面 | 页面上的某一个块 |
| 唯一性约束 | 一词一页,禁止重复 | 一问一主答块,但必须在多处一致复述 |
| 失败模式 | Cannibalization(自相残杀) | Contradiction(自相矛盾)+ 被引错 |
| 可观测性 | GSC 有排名、曝光、点击 | 无官方数据,只能定期实测 |
| 竞争形态 | 零和:一个位次只能给一个页面 | 非零和,但位子极少:一个答案通常引 3–5 个来源 |
看第三行。同一张表,同一列数据,不可能同时服从“这条内容不许出现在第二个页面”和“这条内容必须出现在所有相关页面上”。
这不是字段不够,是约束冲突。 加多少列都没用——你加的每一列都要么服从上面那条规则,要么服从下面那条。
所以答案只能是:第二张表。它记录问题、记录主答块、记录允许复述的位置、记录标准答案的那一句话。它和注册表用 page_slug 连接,但各自服从各自的约束。
由此改变的不只是数据结构
约束方向不同,打法也跟着不同。
SEO 是争位次。 搜索结果第一页十个位子,你的页面占一个,别人就少一个。所以策略是“做那个最好的页面”——内容更全、结构更清晰、外链更多。竞争是零和的,目标物是页面。
GEO 是争引用位。 一个 AI 答案通常引用 3–5 个来源,你可以是其中之一,不需要打败另外几个。竞争不是零和的,但位子少得多——搜索结果第一页有十个,AI 答案只有三到五个。
关键的差别在目标物:
SEO 要做“最好的页面”,GEO 要做“最好引用的那一句”。
LLM 在组织答案时,挑的是能直接嵌进它句子里的片段:一句话讲清结论、带具体数字、带工况、带出处、不需要读者再点进去看上下文。你的页面整体写得多好,它不关心;它只关心手上这一块能不能用。
这个转变直接决定了新表该记什么。不是记“这个页面要覆盖什么主题”,而是记你希望被原样引用的那句话。这就是下一篇要设计的 canonical_answer 字段——全站关于这个问题的标准首句,只存一句,不存全文。
一个自查动作:量出你的 GEO 盲区
讲到这里都还是理论。有一个五分钟的动作,能让你立刻看到自己站的缺口有多大。
打开你的注册表,把 keyword 列逐条念出来,对每一条问一句:
这是一个真人会对着 ChatGPT 说出口的完整句子吗?
centrifugal pump manufacturer → 不是。没人这样跟 AI 说话
CP-100 centrifugal pump specifications → 不是。是词,不是问句
what is a centrifugal pump → 勉强算。虽然会被问,但太浅
centrifugal pump for chemical transfer → 不是。是关键词形态的场景词
数一下“是”的比例。
大多数做得不错的 B2B 站,这个比例低于三成。低不是因为注册表做得差——恰恰相反,注册表越规范、词形越整齐,这个比例反而越低,因为规范的注册表本来就是照着搜索词的形态建的。
这个比例就是你的 GEO 盲区。 剩下那七成的问题空间,你的注册表里一行都没有,你的审计工具也查不出来——因为审计工具拿注册表当期望值,注册表里没有的东西,它不知道自己该找。
做完这个自查,把答不上来的那些问题随手记成一个原始清单:客户在询盘里问过的、你在论坛上见过的、销售常被追问的。不用整理,不用分类,就是一个 raw list。那份清单是下一篇的输入。
说清楚这篇不是在否定注册表
写到这里容易产生一个误解,得挡掉。
关键词注册表没有做错任何事。 Google 依然是 B2B 外贸站最大的流量来源,唯一归属依然是防 Cannibalization 唯一有效的手段,三仓意图隔离依然该照做。这个系列前面关于注册表的四篇,一个字都不用改。
注册表只是不管这件事。它管的是“这个页面该排什么词”,它从来没有承诺过管“这个页面该回答什么问题”。
这两件事都得管,才叫一个页面的意图清楚了。
一页的完整意图 = 排什么词(关键词注册表)
+ 答什么问(GEO 意图注册表)
+ 用哪些数(产品事实层)
三张表各管一件事:注册表管词,意图注册表管问,事实层管数。产品事实层会在后面的事实与表达分离中完整展开;接下来六篇先把第二张表和它的治理闭环建立起来。
本篇边界
这篇只回答“为什么必须是第二张表”,不回答“表长什么样”。
- 字段怎么设计、主答块怎么定义、一致复述怎么落地 → 下一篇
- 问题怎么分类、六类问题各自该怎么答 → 第 75 篇
- 两张表怎么叠在一起、每页的意图卡长什么样 → 第 76 篇
- 从发现一个问题到它被 AI 引用,中间的流程 → 第 77 篇
如果你读完这篇的感受是“那我给注册表加个 question 字段试试”,请回到第三层错位再读一遍。前两层加字段能解决,第三层不能——冲突不在字段上,在约束上。
→ GEO 意图注册表设计:问题、答案块与一致复述约束
RELATED / 相关推荐
接着读这些
按同一分类、系列与标签为你挑选。
GEO 意图分类:为什么不能照抄 SEO 三仓
SEO 三仓按词形分类——含 manufacturer 归商业、含 what is 归知识。这套规则切不动 AI 里的提问,因为人对着 AI 说的话带条件、带情境、带纠结,词形特征全被稀释了。这篇给出按约束条件完整度重新划分的六类意图,以及每一类对应的答案写法。
从问题到答案块:一条 GEO 意图的生命周期
从发现一个真实提问到它被 AI 引用,中间五个环节,顺序不能换:收集、登记、指定主答块、落到页面、实测回写。跳过登记,同一个问题会在三个页面各写一遍——这是 GEO 版的 Cannibalization,它不表现为排名分散,表现为 LLM 拿到矛盾证据后谁都不引。
双骨架:把词的地图和问的地图叠在同一张 slug 上
两张表用 page_slug 一叠,每个页面就得到一张意图卡——它排哪些词、主答哪些问、复述哪些问、明确不答哪些问。叠加还会立刻暴露两类问题页:有排名但不回答任何具体问题的页,和零搜索量却被 AI 反复引用的页。这篇给出四象限诊断、意图卡模板和存量站的迁移路径。