💡 核心摘要:Google 特殊爬虫不是普通 Googlebot 的另一个名字。它们通常服务广告质量、API 推送通知、AdSense 内容理解和安全检测等特定产品场景,并且可能忽略 robots.txt 中的全局
User-agent: *规则。要控制这类访问,必须按官方用户代理令牌单独写规则。
一、什么是特殊爬虫
特殊爬虫用于某些 Google 产品与网站之间有特定抓取约定的场景。它们仍属于 Google 抓取基础设施的一部分,也会继承 Google 抓取工具的一般技术属性,但触发原因和规则边界不同于常见抓取工具。
典型例子是 AdsBot。它用于广告相关检查,在广告发布商许可的情况下,可能不按全局通配 User-agent: * 规则处理。也就是说,你以为“禁止所有爬虫”的规则,不一定覆盖这些产品型抓取器。
💡 判断特殊爬虫时,先问它服务哪个产品:广告、AdSense、API 通知、安全检测,还是普通搜索索引。
二、特殊爬虫为什么要单独验证
Google 官方提醒,用户代理字符串可能被仿冒。日志里出现 AdsBot-Google、APIs-Google 或 Mediapartners-Google,只能说明请求声称自己是这些客户端,不能证明请求真的来自 Google。
特殊爬虫的 IP 范围不同于常见抓取工具,Google 将它们发布在 special-crawlers.json 中。它们的反向 DNS 掩码通常匹配 rate-limited-proxy-***-***-***-***.google.com。
验证思路
1. 从日志取出 IP 和 user-agent
2. 对 IP 做反向 DNS 查询
3. 检查主机名是否匹配 Google 特殊爬虫模式
4. 再做正向 DNS 查询,确认主机名解析回原始 IP
5. 大规模场景用 special-crawlers.json 做 CIDR 比对
⚠️ 不要把特殊爬虫和普通 Googlebot 混在一个白名单里。它们的用途、IP 范围和 robots.txt 处理方式都可能不同。
三、APIs-Google 影响 API 推送通知
APIs-Google 的 HTTP user-agent 是 APIs-Google (+https://developers.google.com/webmasters/APIs-Google.html),robots.txt 中的用户代理令牌也是 APIs-Google。
针对这个令牌的抓取偏好设置,会影响 Google API 传递推送通知消息的方式。它会忽略全局 User-agent: * 规则,因此如果你确实要控制它,必须写独立规则组。
配置示例
user-agent: APIs-Google
allow: /archive/1Q84
disallow: /archive/
💡 如果站点依赖 Google API 回调、通知或相关集成,不要在不了解影响的情况下直接禁止
APIs-Google。
四、AdsBot 影响广告质量检查
AdsBot-Google 和 AdsBot-Google-Mobile 用于 Google Ads 检查网页广告质量。桌面广告检查通常使用 AdsBot-Google,移动网页广告检查使用 AdsBot-Google-Mobile。
这类请求和普通搜索抓取不是一回事。禁止它们不等于禁止 Google 搜索收录,但可能影响 Google Ads 对广告落地页质量、可访问性或移动体验的检查能力。
AdsBot 令牌
AdsBot-Google
AdsBot-Google-Mobile
⚠️ 如果你投放 Google Ads,误封 AdsBot 可能导致广告质量检查不完整,进而影响广告审核、诊断或投放体验。
五、Mediapartners-Google 服务 AdSense
Mediapartners-Google 是 AdSense 抓取工具的用户代理令牌。它会访问参与 AdSense 计划的网站,以便理解页面内容并提供更相关的广告。
它同样会忽略全局 User-agent: *。如果网站依赖 AdSense 变现,robots.txt 中误封 Mediapartners-Google 可能影响广告内容匹配质量。
AdSense 配置示例
user-agent: Mediapartners-Google
allow: /
💡 内容站做 robots.txt 收紧时,要把搜索抓取、广告质量检查和 AdSense 内容理解分开评估。
六、Google-Safety 不受抓取偏好影响
Google-Safety 用于处理滥用行为相关抓取,例如对 Google 产品和服务上公开发布的链接进行恶意软件发现。它负责安全检测,不是常规 SEO 抓取,也不是广告质量检查。
Google 官方说明,Google-Safety 会忽略 robots.txt 规则,并且不受抓取偏好设置影响。站点不应把它当成普通爬虫来规划 robots.txt 控制策略。
⚠️ 安全检测类访问的目标是识别滥用和恶意内容。用 robots.txt 试图控制它通常不是有效路径。
七、弃用爬虫只作历史参考
Google 文档还列出了一些弃用的特殊爬虫,例如旧版移动 AdsBot、网页上的 Duplex、Google Favicon、移动应用 AdsBot 和 Web Light。这些条目主要用于解释历史日志,不代表当前一定仍会出现。
看到历史 user-agent 时,先确认日志时间、产品场景和是否仍在使用。不要为了极少数历史流量,给当前 robots.txt 增加过多复杂规则。
历史排查原则
近期仍出现:验证来源,再判断是否需要规则
只在旧日志出现:作为历史归档,不必新增规则
无法验证来源:按未知爬虫处理,不直接信任 user-agent
💡 robots.txt 越复杂,误伤风险越高。特殊爬虫规则应该服务明确产品目标,而不是为了覆盖所有历史字符串。
📌 核心收获
- ✓ 特殊爬虫服务特定产品:它们常用于 Ads、AdSense、API 通知和安全检测。
- ✓ 通配规则不一定覆盖:多种特殊爬虫会忽略
User-agent: *。 - ✓ 必须单独写令牌规则:控制 AdsBot、APIs-Google 或 Mediapartners-Google 时要使用官方令牌。
- ✓ 验证来源仍然必要:特殊爬虫 IP 范围应按
special-crawlers.json或 DNS 验证。 - ✓ Google-Safety 不受 robots 控制:它用于滥用和安全检测,不适合用普通抓取偏好管理。
🚀 立刻行动
- 打开服务器日志,过滤
AdsBot-Google、AdsBot-Google-Mobile、Mediapartners-Google、APIs-Google、Google-Safety。 - 对这些请求的 IP 做 DNS 反查和正查,或用
special-crawlers.json验证是否来自 Google 特殊爬虫范围。 - 检查 robots.txt 是否只有
User-agent: *。如果你需要控制 AdsBot 或 AdSense,新增对应令牌的独立规则组。 - 如果网站依赖 Google Ads 或 AdSense,先确认广告审核、广告匹配和收入影响,再收紧相关爬虫访问。
- 对无法验证来源的特殊爬虫 user-agent,不要加入白名单,按普通未知爬虫进行限速或拦截评估。
来源:Google 特殊爬虫列表 | 本文为知识提炼与重新表达
RELATED / 相关推荐
接着读这些
按同一分类、系列与标签为你挑选。
Google 抓取工具原理入门
Google 抓取工具不只有 Googlebot,还包括常见抓取工具、特殊抓取工具和用户触发的抓取器。本篇建立抓取基础设施的整体认知,解释协议、压缩、文件大小、主机负载、缓存和身份验证。
Google 网页抓取认知与优化指南
Google 抓取不是单次访问网页,而是发现、复抓、渲染、缓存和遵守访问控制的系统过程。本篇把官方抓取事实改写成站长可执行的优化清单。
降低 Google 抓取频率的应急与治理指南
Google 抓取量突然升高时,不要先封 Googlebot。本篇教你判断原因、用 500/503/429 临时降速,并通过 URL 结构和抓取效率做长期治理。