RAG系统按语义边界切片(通常300-800 token),所以每个问答必须自包含:问题标题用H2/H3,答案第一句给完整结论且包含主体名称(不用"它"、"该产品"等指代),答案控制在150字内避免被切断。测试方法:直接问Perplexity相关问题,看是否引用你的站点。
模块化 FAQ 设计:针对 AI 搜索引擎(Perplexity / ChatGPT)优化
AI 搜索的检索机制和 Google 不同
Google 的逻辑:给页面整体打分,排名靠前的页面获得点击。
AI 搜索(RAG)的逻辑:
- 把页面内容切成小块(chunk),通常 300–800 token
- 把用户问题和每个 chunk 做语义相似度匹配
- 取最相关的几个 chunk 作为上下文
- LLM 基于这些 chunk 生成答案,并标注来源
关键差异:AI 搜索引用的是片段,不是整个页面。你的内容能否被引用,取决于单个片段是否自包含且信息完整。
自包含原则:最重要的规则
一个 chunk 被提取出来后,会脱离页面上下文单独进入 LLM 的处理。如果这个 chunk 依赖前文才能理解,LLM 就无法用它回答问题。
错误示范(依赖上下文)
## 最高工作温度是多少?
它的标准版本可以在 -20°C 到 120°C 之间运行。如果超过这个范围,
需要选择高温版本。
问题:
- “它”是谁?chunk 被单独提取后,LLM 不知道这在说 CP-100 还是 CP-200
- 无法用来回答“CP-100 的最高工作温度是多少”
正确示范(自包含)
## What is the maximum operating temperature of the CP-100 centrifugal pump?
The CP-100 centrifugal pump operates at temperatures from -20°C to 120°C
(-4°F to 248°F) in its standard configuration. For applications exceeding
120°C, the CP-100 HT high-temperature version with upgraded mechanical
seals is rated to 180°C (356°F).
为什么正确:
- 问题标题包含完整主体名(CP-100 centrifugal pump)
- 答案第一句重复主体名,不用指代词
- 给出双单位(°C 和 °F),覆盖不同市场的搜索
- 即使这个 chunk 被单独提取,信息也完整可用
Chunk 长度控制
RAG 系统的切片大小通常是 300–800 token(约 200–600 英文词)。如果你的一个问答超过这个长度,可能被切成两半——答案的关键数字可能落在第二片,而第一片被检索到时不包含答案。
规范:
- 每个 FAQ 的答案控制在 80–150 词
- 如果内容需要更长,拆成多个独立的问答
- 最关键的信息(数字、结论)放在第一句
示例:拆分过长的问答
❌ 一个过长的问答:
## How do I select materials for chemical transfer pumps?
[400 词的详细说明,覆盖 SS316、Hastelloy、PVDF 三种材料]
✅ 拆成三个自包含的问答:
## What material should I use for sulfuric acid transfer pumps?
[100 词,专门讲硫酸]
## When should I specify Hastelloy instead of SS316 for chemical pumps?
[100 词,专门讲两种材料的对比]
## Is PVDF suitable for high-temperature chemical transfer?
[100 词,专门讲 PVDF]
拆分后,每个问答都有更高的被精准检索概率。
标题层级和格式
用 <h2> 或 <h3> 标签作为问题,不要用加粗文字。
✅ 正确:
## What certifications does the CP-200S carry?
❌ 错误:
**What certifications does the CP-200S carry?**
原因:RAG 系统在切片时,会优先在标题边界处切分。用标题标记的问答会被切成独立的 chunk;用加粗文字的问答可能和前后内容混在一个 chunk 里,稀释相关性。
答案的开头格式
不同问题类型有最优的答案开头格式:
| 问题类型 | 答案开头格式 | 示例 |
|---|---|---|
| 是/否问题 | Yes. / No. 开头 |
“No. The CP-100 is not suitable for abrasive slurry…” |
| 数值问题 | 直接给数字 | “The CP-100 operates from -20°C to 120°C…” |
| 选择问题 | 直接给推荐 | “For sulfuric acid above 70%, PVDF or high-silicon cast iron is recommended…” |
| 定义问题 | [主体] is [定义] |
“NPSH (Net Positive Suction Head) is the difference between…” |
| 对比问题 | 先给结论再对比 | “Centrifugal pumps are better for high-flow, low-viscosity applications; gear pumps for high-viscosity precision metering…” |
数值和单位的写法
工业品的技术参数是 AI 搜索最常被问的内容。写法要考虑不同市场的单位习惯:
✅ 双单位并列:
Flow rate: 5–120 m³/h (22–528 GPM)
Temperature: -20°C to 120°C (-4°F to 248°F)
Pressure: 16 bar (232 PSI)
❌ 只给一种单位:
Flow rate: 5–120 m³/h
给双单位的好处:北美工程师搜 “GPM” 时也能匹配到你的内容。
行业标准引用(增强权威性)
在答案里引用行业标准,能显著提升被 AI 引用的概率——因为 LLM 倾向于选择有权威依据的内容:
## What surface finish is required for food-grade pumps?
Food-grade pumps require a surface roughness of Ra ≤ 0.8 μm on all
product-contact surfaces. This requirement is specified in 3-A Sanitary
Standards 02-11 and EHEDG Document 8 for hygienic equipment design.
Electropolishing to Ra ≤ 0.4 μm is recommended for aseptic applications.
引用了 3-A 和 EHEDG,LLM 在生成答案时会认为这是有据可依的信息。
测试你的内容是否被 AI 引用
方法一:直接问 Perplexity
访问 perplexity.ai,输入你的目标问题:
测试问题示例:
"What is the maximum operating temperature of AquaFlow CP-100 pump?"
"What material is best for sulfuric acid transfer pumps?"
"centrifugal pump selection criteria for chemical transfer"
看回答里是否引用了你的网站(Perplexity 会在答案下方列出来源链接)。
方法二:ChatGPT 搜索模式
在 ChatGPT 里开启搜索功能,问同样的问题,观察引用来源。
方法三:追踪 Referral 流量
在 GA4 里查看 Referrals,如果有来自 perplexity.ai、chat.openai.com、claude.ai 的流量,说明你的内容正在被 AI 搜索引用。
GEO 优化 Checklist
每个 FAQ 检查项:
□ 问题用 <h2> 或 <h3> 标签,不用加粗文字
□ 问题标题包含完整主体名(型号名/产品名)
□ 答案第一句包含主体名,不用"它"、"该产品"等指代
□ 答案第一句给出核心结论或数值
□ 答案长度 80–150 词(超长则拆分)
□ 技术参数给双单位(公制 + 英制)
□ 如适用,引用相关行业标准
页面层面:
□ FAQPage Schema 已注入
□ 参数表用原生 HTML <table> + <caption>
□ 在 Perplexity 测试过至少3个目标问题
自包含之后,还差一层:谁是基准版本
上面的自包含原则是块级的规范——保证单个 chunk 被单独提取后信息完整。
页面多起来之后会出现块级规范管不了的问题:同一个“CP-100 最高多少度”,型号页、应用页、旧博客各写了一遍,三处数字还不完全一样。三个 chunk 都自包含、都合规,但 LLM 一次检索全拿到,结果是要么随便挑一个、要么含糊其辞、要么引了那个错的。
被引用但信息错误,比完全不被引用更该优先处理——因为它在替你散播错误参数。
解法是给每个问题指定一个主答块(精确到 slug + anchor),其余页面上的同一条答案作为复述块从它派生,不手写。这套索引和它的审计方法见:
→ 行业标准引用策略:锚定 IEC / UL / ISO 权威上下文
RELATED / 相关推荐
接着读这些
按同一分类、系列与标签为你挑选。
GEO 意图注册表设计:问题、答案块与一致复述约束
这张表的一行不是关键词,是「一个问题 → 一个主答块」的绑定。主答块精确到 slug + anchor,标准答案只存一句话,句子里每个数字指回产品事实层。这篇讲全部字段的设计逻辑、一致复述的三条规矩、以及为什么必须有一个「这个问题我们赢不了」的标记位。
GEO 审计升级:从「结构合规」到「有没有被引用」
之前那个 GEO 覆盖审计 Skill 只能查结构,查不了覆盖——因为它没有期望值可比。补上意图注册表之后,审计从一层变三层:结构、覆盖与一致性、引用实测。其中复述块与主答块的一致性检查是纯确定性的,脚本能百分之百判定,这是升级带来的最大收益。
GEO 意图分类:为什么不能照抄 SEO 三仓
SEO 三仓按词形分类——含 manufacturer 归商业、含 what is 归知识。这套规则切不动 AI 里的提问,因为人对着 AI 说的话带条件、带情境、带纠结,词形特征全被稀释了。这篇给出按约束条件完整度重新划分的六类意图,以及每一类对应的答案写法。