跳到主要内容
IM智引科技

研究 / 外贸与 B2B 增长

为什么关键词注册表管不了 AI 搜索:词与问的三层错位

注册表覆盖率 100%、GEO 审计全绿,去 Perplexity 问一句带条件的问题,引用的还是别人。因为关键词注册表索引的是"词—页面",AI 搜索匹配的是"问题—答案块"。这篇讲清楚两者之间的三层错位,以及为什么第三层决定了必须建第二张表,而不是给注册表加几个字段。

BLKTECH 编辑部2026年8月9日13 分钟难度 进阶免费

关键词注册表索引的是"词—页面"绑定,AI 搜索检索的是"问题—答案块"匹配,两者有三层错位:粒度(词 vs 带约束条件的整句)、归属(页面 vs 页面上的一个块)、唯一性约束方向(一词一页禁止重复 vs 同一条答案必须一致地出现在多处)。第三层决定了这不是加字段能解决的问题,必须建第二张表。

为什么关键词注册表管不了 AI 搜索:词与问的三层错位

一个让人想不通的场景

假设你已经完成关键词注册表、Pillar-Cluster、页面级 GEO 规范,并跑过第 49 篇的结构审计。

注册表建得很规范:sulfuric acid pump 这个词归属明确,写在 /applications/chemical-transfer-pump/ 名下,NKW 里挡掉了 manufacturerwhat is,priority 打了 4 分。GEO 覆盖审计跑下来六项全绿——robots.txt 放行了所有 AI 爬虫、页面是服务端渲染、FAQ 全用 H3 标签、参数表带 caption、hreflang 双向自引用、JSON-LD 完整。

然后你去 Perplexity 问一句:

We're transferring 60% sulfuric acid at 80°C. Is a mag drive pump
overkill here, or should I just spec a double mechanical seal?

回答引用了三个来源:一家德国泵厂的选型指南、一个化工论坛的帖子、一份 NACE 的材料手册。没有你

你的注册表里找不到任何一行对应这句话。不是因为你漏了这个词——而是因为这句话根本不是一个词

这就是本篇要讲的事:关键词注册表和 AI 搜索之间隔着三层错位。前两层是粒度和归属的问题,能靠细化解决;第三层是约束方向的问题,解决不了——只能再建一张表。


错位一:粒度——词是意图的残骸

搜索框教会了所有人一件事:把话说短

一个工程师脑子里的真实问题是“60% 浓度的硫酸、80 度、要连续运转、预算有限,磁力泵和双端面机封哪个划算”。他往 Google 搜索框里敲的是:

sulfuric acid pump

三个约束条件(浓度、温度、成本考量)在敲进搜索框的那一刻全被扔掉了。你的关键词工具看到的是扔掉之后的残骸,你的注册表索引的也是残骸。

对着 AI 说话,不需要压缩。

❌ 搜索框里:sulfuric acid pump
✅ AI 对话框里:We're transferring 60% sulfuric acid at 80°C, continuous
   duty, and cost is a real constraint. Is a mag drive pump overkill,
   or is a double mechanical seal with barrier fluid good enough?

三个约束条件原样保留了下来。这带来两个后果:

后果一:这类提问在关键词工具里显示零搜索量。 因为它不是一个“搜索词”,没人这样敲搜索框。你用 Ahrefs 或 Semrush 扒竞品,永远扒不出这句话。

后果二:这类提问离成交最近。 一个能把浓度、温度、工况、预算一次说清楚的人,是已经在做选型的人,不是在做科普调研的人。他缺的不是知识,是一个敢下结论的建议。

所以这里有一个反直觉的推论:

在 B2B 工业品里,零搜索量的提问往往比高搜索量的词更值钱。 一个采购工程师的一次提问,可能值几万美金;sulfuric acid pump 每月 800 的搜索量里, 大部分是学生、竞品和随便看看的人。

后面的真实需求挖掘会专门讲这类问题该去哪里找;这篇先解决另一半:问题挖到之后,现有关键词注册表装不下它


错位二:归属——Google 排页面,AI 引块

关键词注册表最核心的字段是 page_slug:这个词归哪个页面。

这个设计是对的,因为 Google 就是这么工作的——它给页面打分,排名靠前的页面获得点击。归属对象是页面,天经地义。

AI 搜索不是这样。模块化 FAQ 设计那篇讲过 RAG 的机制:

  1. 把页面切成 chunk(通常 300–800 token)
  2. 用户问题和每个 chunk 做语义匹配
  3. 取最相关的几个 chunk 进上下文
  4. LLM 基于这些 chunk 生成答案并标注来源

被引用的是 chunk,不是页面。

这个差别在实践中比听起来大得多。举个具体的:

你的 /products/cp-100/ 页面上有八个问答块、一张参数表、三段正文。Google 眼里这是一个页面,它整体排名。AI 眼里这是十二个独立的候选片段,它们各自去竞争不同的问题。

于是就出现了一种在 SEO 世界里不存在的状态:

同一个页面,可以在一个问题上被引用,同时在另一个问题上完全隐形。

排名不存在这种事——一个页面要么排在第 3 位,要么排在第 30 位,它是一个整体。

所以当你说“这个页面负责这个问题”的时候,你其实什么都没说清楚。这个页面上的哪一块负责?如果审计脚本要检查“这条答案落地了没有”,它该去页面的什么位置找?如果这条答案同时出现在三个页面上,哪一份是准的

要回答这些问题,归属对象必须精确到块:

❌ 归属:/products/cp-100/
✅ 归属:/products/cp-100/#max-operating-temperature

带上锚点之后,“这条答案在哪、落地没有、和别处一不一致”才从一句空话变成三个可以用脚本回答的问题。


错位三:唯一性约束的方向是相反的

前两层错位,理论上还能靠“把注册表做细”来应付——加一个 question 字段存原话,加一个 anchor 字段存锚点,看起来问题就解决了。

第三层错位堵死了这条路。

注册表的约束:禁止重复

中央关键词注册表设计那篇写得很清楚,注册表的存在理由就一句话:

这个词,永远只属于这个页面。

一个词出现在两个页面上,就是 Cannibalization,就是两个页面互相削弱、最后一起排不进前三页。所以注册表的核心约束是唯一归属:一词一页,禁止重复。NKW 字段的全部意义,就是主动把别的页面挡在门外。

GEO 的约束:必须重复,但只能有一个版本

AI 搜索这边,规则反过来了。

因为检索是块级的,用户可能从任何一个入口进来。一个正在看 CP-100 型号页的人,会问“这个泵能不能上 120 度”;一个正在看化工输送应用页的人,也会问同一件事;一个在看材质对比文章的人,还是会问同一件事。

这三个页面都应该有这条答案。 谁都不知道 RAG 会命中哪一块——如果只有型号页写了,另外两页的读者提问时,被引用的就是别人。

在 SEO 世界里,同一条内容出现在三个页面叫内耗;在 GEO 世界里,这叫覆盖。

但重复立刻带来新的风险。三个页面各写各的,半年之后会变成这样:

/products/cp-100/           标准配置最高 120°C
/applications/chemical/     最高工作温度 120°C (248°F)
/blog/high-temp-pumps/      可以做到 125°C 左右

第三条是八个月前写的,当时问的是另一家供应商。现在 LLM 一次检索拿到三个 chunk,三个数字不完全一致,它会做三件事之一:随便挑一个、含糊地说“报道不一”、或者挑了那个错的。

第三种是最坏的——GEO 覆盖审计那篇已经点过这个判断:被引用但信息错误,比完全不被引用更该优先处理,因为它在替你对客户散播错误参数。

所以 GEO 侧的约束不是“禁止重复”,而是:

该重复的地方必须重复,但全站只能有一个版本。

两条约束没法写进同一张表

把两条约束并排放,问题就一目了然了:

关键词注册表 GEO 侧需要的约束
记录单位 完整问句(含约束条件)
归属对象 页面 页面上的某一个块
唯一性约束 一词一页,禁止重复 一问一主答块,但必须在多处一致复述
失败模式 Cannibalization(自相残杀) Contradiction(自相矛盾)+ 被引错
可观测性 GSC 有排名、曝光、点击 无官方数据,只能定期实测
竞争形态 零和:一个位次只能给一个页面 非零和,但位子极少:一个答案通常引 3–5 个来源

看第三行。同一张表,同一列数据,不可能同时服从“这条内容不许出现在第二个页面”和“这条内容必须出现在所有相关页面上”。

这不是字段不够,是约束冲突。 加多少列都没用——你加的每一列都要么服从上面那条规则,要么服从下面那条。

所以答案只能是:第二张表。它记录问题、记录主答块、记录允许复述的位置、记录标准答案的那一句话。它和注册表用 page_slug 连接,但各自服从各自的约束。


由此改变的不只是数据结构

约束方向不同,打法也跟着不同。

SEO 是争位次。 搜索结果第一页十个位子,你的页面占一个,别人就少一个。所以策略是“做那个最好的页面”——内容更全、结构更清晰、外链更多。竞争是零和的,目标物是页面。

GEO 是争引用位。 一个 AI 答案通常引用 3–5 个来源,你可以是其中之一,不需要打败另外几个。竞争不是零和的,但位子少得多——搜索结果第一页有十个,AI 答案只有三到五个。

关键的差别在目标物:

SEO 要做“最好的页面”,GEO 要做“最好引用的那一句”。

LLM 在组织答案时,挑的是能直接嵌进它句子里的片段:一句话讲清结论、带具体数字、带工况、带出处、不需要读者再点进去看上下文。你的页面整体写得多好,它不关心;它只关心手上这一块能不能用。

这个转变直接决定了新表该记什么。不是记“这个页面要覆盖什么主题”,而是记你希望被原样引用的那句话。这就是下一篇要设计的 canonical_answer 字段——全站关于这个问题的标准首句,只存一句,不存全文。


一个自查动作:量出你的 GEO 盲区

讲到这里都还是理论。有一个五分钟的动作,能让你立刻看到自己站的缺口有多大。

打开你的注册表,把 keyword 列逐条念出来,对每一条问一句:

这是一个真人会对着 ChatGPT 说出口的完整句子吗?

centrifugal pump manufacturer          → 不是。没人这样跟 AI 说话
CP-100 centrifugal pump specifications → 不是。是词,不是问句
what is a centrifugal pump             → 勉强算。虽然会被问,但太浅
centrifugal pump for chemical transfer → 不是。是关键词形态的场景词

数一下“是”的比例。

大多数做得不错的 B2B 站,这个比例低于三成。低不是因为注册表做得差——恰恰相反,注册表越规范、词形越整齐,这个比例反而越低,因为规范的注册表本来就是照着搜索词的形态建的。

这个比例就是你的 GEO 盲区。 剩下那七成的问题空间,你的注册表里一行都没有,你的审计工具也查不出来——因为审计工具拿注册表当期望值,注册表里没有的东西,它不知道自己该找。

做完这个自查,把答不上来的那些问题随手记成一个原始清单:客户在询盘里问过的、你在论坛上见过的、销售常被追问的。不用整理,不用分类,就是一个 raw list。那份清单是下一篇的输入。


说清楚这篇不是在否定注册表

写到这里容易产生一个误解,得挡掉。

关键词注册表没有做错任何事。 Google 依然是 B2B 外贸站最大的流量来源,唯一归属依然是防 Cannibalization 唯一有效的手段,三仓意图隔离依然该照做。这个系列前面关于注册表的四篇,一个字都不用改。

注册表只是不管这件事。它管的是“这个页面该排什么词”,它从来没有承诺过管“这个页面该回答什么问题”。

这两件事都得管,才叫一个页面的意图清楚了。

一页的完整意图 = 排什么词(关键词注册表)
              + 答什么问(GEO 意图注册表)
              + 用哪些数(产品事实层)

三张表各管一件事:注册表管词,意图注册表管问,事实层管数。产品事实层会在后面的事实与表达分离中完整展开;接下来六篇先把第二张表和它的治理闭环建立起来。


本篇边界

这篇只回答“为什么必须是第二张表”,不回答“表长什么样”。

  • 字段怎么设计、主答块怎么定义、一致复述怎么落地 → 下一篇
  • 问题怎么分类、六类问题各自该怎么答 → 第 75 篇
  • 两张表怎么叠在一起、每页的意图卡长什么样 → 第 76 篇
  • 从发现一个问题到它被 AI 引用,中间的流程 → 第 77 篇

如果你读完这篇的感受是“那我给注册表加个 question 字段试试”,请回到第三层错位再读一遍。前两层加字段能解决,第三层不能——冲突不在字段上,在约束上


→ GEO 意图注册表设计:问题、答案块与一致复述约束

NEXT ACTION / 下一步

继续系列:AI 外贸站建设全系列

把读到的方法变成一个小行动,完成后再回来迭代。

继续

RELATED / 相关推荐

接着读这些

按同一分类、系列与标签为你挑选。