跳到主要内容
IM智引科技

研究 / SEO

Google 特殊爬虫配置指南

Google 特殊爬虫服务广告、API 通知、AdSense 和安全检测等产品场景。本文解释它们为什么可能忽略通配规则,以及 robots.txt 应如何单独配置。

智引科技增长实验室2026年5月10日6 分钟难度 进阶

💡 核心摘要:Google 特殊爬虫不是普通 Googlebot 的另一个名字。它们通常服务广告质量、API 推送通知、AdSense 内容理解和安全检测等特定产品场景,并且可能忽略 robots.txt 中的全局 User-agent: * 规则。要控制这类访问,必须按官方用户代理令牌单独写规则。


一、什么是特殊爬虫

特殊爬虫用于某些 Google 产品与网站之间有特定抓取约定的场景。它们仍属于 Google 抓取基础设施的一部分,也会继承 Google 抓取工具的一般技术属性,但触发原因和规则边界不同于常见抓取工具。

典型例子是 AdsBot。它用于广告相关检查,在广告发布商许可的情况下,可能不按全局通配 User-agent: * 规则处理。也就是说,你以为“禁止所有爬虫”的规则,不一定覆盖这些产品型抓取器。

💡 判断特殊爬虫时,先问它服务哪个产品:广告、AdSense、API 通知、安全检测,还是普通搜索索引。

二、特殊爬虫为什么要单独验证

Google 官方提醒,用户代理字符串可能被仿冒。日志里出现 AdsBot-GoogleAPIs-GoogleMediapartners-Google,只能说明请求声称自己是这些客户端,不能证明请求真的来自 Google。

特殊爬虫的 IP 范围不同于常见抓取工具,Google 将它们发布在 special-crawlers.json 中。它们的反向 DNS 掩码通常匹配 rate-limited-proxy-***-***-***-***.google.com

验证思路

1. 从日志取出 IP 和 user-agent
2. 对 IP 做反向 DNS 查询
3. 检查主机名是否匹配 Google 特殊爬虫模式
4. 再做正向 DNS 查询,确认主机名解析回原始 IP
5. 大规模场景用 special-crawlers.json 做 CIDR 比对

⚠️ 不要把特殊爬虫和普通 Googlebot 混在一个白名单里。它们的用途、IP 范围和 robots.txt 处理方式都可能不同。

三、APIs-Google 影响 API 推送通知

APIs-Google 的 HTTP user-agent 是 APIs-Google (+https://developers.google.com/webmasters/APIs-Google.html),robots.txt 中的用户代理令牌也是 APIs-Google

针对这个令牌的抓取偏好设置,会影响 Google API 传递推送通知消息的方式。它会忽略全局 User-agent: * 规则,因此如果你确实要控制它,必须写独立规则组。

配置示例

user-agent: APIs-Google
allow: /archive/1Q84
disallow: /archive/

💡 如果站点依赖 Google API 回调、通知或相关集成,不要在不了解影响的情况下直接禁止 APIs-Google

四、AdsBot 影响广告质量检查

AdsBot-GoogleAdsBot-Google-Mobile 用于 Google Ads 检查网页广告质量。桌面广告检查通常使用 AdsBot-Google,移动网页广告检查使用 AdsBot-Google-Mobile

这类请求和普通搜索抓取不是一回事。禁止它们不等于禁止 Google 搜索收录,但可能影响 Google Ads 对广告落地页质量、可访问性或移动体验的检查能力。

AdsBot 令牌

AdsBot-Google
AdsBot-Google-Mobile

⚠️ 如果你投放 Google Ads,误封 AdsBot 可能导致广告质量检查不完整,进而影响广告审核、诊断或投放体验。

五、Mediapartners-Google 服务 AdSense

Mediapartners-Google 是 AdSense 抓取工具的用户代理令牌。它会访问参与 AdSense 计划的网站,以便理解页面内容并提供更相关的广告。

它同样会忽略全局 User-agent: *。如果网站依赖 AdSense 变现,robots.txt 中误封 Mediapartners-Google 可能影响广告内容匹配质量。

AdSense 配置示例

user-agent: Mediapartners-Google
allow: /

💡 内容站做 robots.txt 收紧时,要把搜索抓取、广告质量检查和 AdSense 内容理解分开评估。

六、Google-Safety 不受抓取偏好影响

Google-Safety 用于处理滥用行为相关抓取,例如对 Google 产品和服务上公开发布的链接进行恶意软件发现。它负责安全检测,不是常规 SEO 抓取,也不是广告质量检查。

Google 官方说明,Google-Safety 会忽略 robots.txt 规则,并且不受抓取偏好设置影响。站点不应把它当成普通爬虫来规划 robots.txt 控制策略。

⚠️ 安全检测类访问的目标是识别滥用和恶意内容。用 robots.txt 试图控制它通常不是有效路径。

七、弃用爬虫只作历史参考

Google 文档还列出了一些弃用的特殊爬虫,例如旧版移动 AdsBot、网页上的 Duplex、Google Favicon、移动应用 AdsBot 和 Web Light。这些条目主要用于解释历史日志,不代表当前一定仍会出现。

看到历史 user-agent 时,先确认日志时间、产品场景和是否仍在使用。不要为了极少数历史流量,给当前 robots.txt 增加过多复杂规则。

历史排查原则

近期仍出现:验证来源,再判断是否需要规则
只在旧日志出现:作为历史归档,不必新增规则
无法验证来源:按未知爬虫处理,不直接信任 user-agent

💡 robots.txt 越复杂,误伤风险越高。特殊爬虫规则应该服务明确产品目标,而不是为了覆盖所有历史字符串。


📌 核心收获

  • 特殊爬虫服务特定产品:它们常用于 Ads、AdSense、API 通知和安全检测。
  • 通配规则不一定覆盖:多种特殊爬虫会忽略 User-agent: *
  • 必须单独写令牌规则:控制 AdsBot、APIs-Google 或 Mediapartners-Google 时要使用官方令牌。
  • 验证来源仍然必要:特殊爬虫 IP 范围应按 special-crawlers.json 或 DNS 验证。
  • Google-Safety 不受 robots 控制:它用于滥用和安全检测,不适合用普通抓取偏好管理。

🚀 立刻行动

  1. 打开服务器日志,过滤 AdsBot-GoogleAdsBot-Google-MobileMediapartners-GoogleAPIs-GoogleGoogle-Safety
  2. 对这些请求的 IP 做 DNS 反查和正查,或用 special-crawlers.json 验证是否来自 Google 特殊爬虫范围。
  3. 检查 robots.txt 是否只有 User-agent: *。如果你需要控制 AdsBot 或 AdSense,新增对应令牌的独立规则组。
  4. 如果网站依赖 Google Ads 或 AdSense,先确认广告审核、广告匹配和收入影响,再收紧相关爬虫访问。
  5. 对无法验证来源的特殊爬虫 user-agent,不要加入白名单,按普通未知爬虫进行限速或拦截评估。

来源:Google 特殊爬虫列表 | 本文为知识提炼与重新表达

NEXT ACTION / 下一步

继续系列:Google 抓取工具介绍与原理

把读到的方法变成一个小行动,完成后再回来迭代。

继续

RELATED / 相关推荐

接着读这些

按同一分类、系列与标签为你挑选。