💡 核心摘要:Google 的常用抓取工具服务于搜索索引、图片、视频、新闻、购物、Search Console 测试工具、通用内容抓取和 AI 相关使用许可。配置 robots.txt 时,关键不是背完整 user-agent 字符串,而是选对
User-agent令牌,并理解它会影响哪些 Google 产品。
一、常用抓取工具解决什么问题
Google 常用抓取工具主要用于自动发现和读取公开网页内容。这些请求会服务 Google 搜索索引、图片和视频理解、新闻内容、购物体验、Search Console 测试工具,以及部分产品团队的公开内容抓取。
它们在自动抓取时会遵循 robots.txt 规则,也会继承 Google 抓取工具的一般技术属性。对站长来说,真正需要管理的是三件事:日志里是谁在访问、robots.txt 应该匹配哪个令牌、这个令牌会影响哪些产品。
💡 实务上不要只按“是否包含 Google”来分类流量。先把 Googlebot、GoogleOther、Storebot-Google、Google-InspectionTool 和 Google-Extended 分开,再决定是否允许、限制或单独统计。
二、先确认请求真的来自 Google
HTTP User-Agent 字符串可以被任何客户端伪造。日志里出现 Googlebot,并不自动等于请求来自 Google。把 user-agent 当作白名单条件前,应先用 DNS 反查、正查或 Google 官方 IP 段文件验证来源。
常用抓取工具通常来自 Google 发布的常见抓取工具 IP 范围。它们的反向 DNS 主机名通常会匹配 googlebot.com 或 geo.googlebot.com 相关模式。只有来源验证通过后,日志分析和安全策略才有意义。
⚠️ 不要把 user-agent 字符串直接作为 WAF 放行依据。伪装请求可能借此绕过限速、反爬、后台路径保护或资源消耗控制。
三、robots.txt 看令牌,不看完整字符串
完整 HTTP user-agent 往往很长,尤其是智能手机版 Googlebot,会包含设备、系统、WebKit、Chrome 版本和 Googlebot 标识。robots.txt 里不需要复制整段字符串,只需要使用官方列出的用户代理令牌。
例如,想给 Googlebot 单独设置抓取规则,可以使用 Googlebot 令牌:
user-agent: Googlebot
allow: /archive/1Q84
disallow: /archive
同一个抓取工具可能有多个 HTTP user-agent 字符串,但通常只需要在 robots.txt 中使用一个匹配的令牌。这样规则更短,也更不容易因为 Chrome 版本变化而失效。
💡 把 robots.txt 当作“令牌规则表”,不要当作“完整请求头匹配表”。
四、搜索相关抓取工具怎么区分
Googlebot 是最核心的搜索抓取工具。对 Googlebot 设置的抓取偏好会影响 Google 搜索,以及 Google 图片、视频、新闻、探索等依赖搜索抓取能力的产品。
图片、视频和新闻还有更细的令牌。Googlebot-Image 主要影响图片相关展示,Googlebot-Video 影响视频相关搜索功能,Googlebot-News 影响 Google 新闻产品。新闻抓取不一定有独立 HTTP user-agent 字符串,但 robots.txt 可以使用 Googlebot-News 令牌做规则控制。
常见搜索令牌
Googlebot
Googlebot-Image
Googlebot-Video
Googlebot-News
⚠️ 如果你禁止
Googlebot抓取核心页面,影响通常不止网页搜索,也可能连带影响图片、视频、新闻或探索等展示场景。
五、购物、测试和通用抓取要分开管
Storebot-Google 服务 Google 购物相关界面,例如搜索中的购物标签页和 Google 购物。电商站如果希望商品被购物相关体验理解,需要避免误伤这个令牌。
Google-InspectionTool 对应 Search Console 中的测试工具,例如网址检查和富媒体搜索结果测试。它不会影响 Google 搜索或其他产品,但会影响站长在 Search Console 里看到的测试结果。
GoogleOther 是通用抓取工具,可供不同 Google 产品团队抓取公开内容。它还有面向图片和视频的优化版本:GoogleOther-Image 和 GoogleOther-Video。这些令牌通常不直接代表某个具体搜索展示产品。
| 令牌 | 典型用途 | 配置提醒 |
|---|---|---|
Storebot-Google |
Google 购物 | 电商站不要误封商品页 |
Google-InspectionTool |
Search Console 测试 | 影响测试工具,不影响搜索排名 |
GoogleOther |
通用公开内容抓取 | 适合单独统计和限速观察 |
六、AI 相关令牌不要和搜索抓取混淆
Google-CloudVertexBot 与网站所有者请求构建 Vertex AI 代理有关。它不会影响 Google 搜索或其他产品,因此不应把它当成普通 Googlebot 搜索抓取来分析。
Google-Extended 更容易被误解。它不是一个独立 HTTP user-agent 字符串,而是 robots.txt 中的产品令牌。发布商可以用它管理网站内容是否允许用于训练未来版本的 Gemini 模型,或在相关产品中建立依据。
Google 官方明确说明,Google-Extended 不影响网站是否出现在 Google 搜索结果中,也不是 Google 搜索排名信号。因此,禁止 Google-Extended 不等于禁止 Google 搜索抓取。
⚠️ 如果你的目标是控制 AI 训练或 Gemini 相关使用,处理
Google-Extended。如果目标是控制搜索收录,处理Googlebot、索引指令和页面可抓取性。
七、Chrome 版本号要用通配思维
很多 Google 抓取工具的 user-agent 中会出现类似 Chrome/W.X.Y.Z 的占位格式。这里的 W.X.Y.Z 代表实际 Chrome 浏览器版本,会随着 Googlebot 使用的 Chromium 版本更新而变化。
因此,日志检索、服务器过滤和安全规则不要绑定某个具体 Chrome 版本号。否则版本升级后,规则可能漏匹配真实 Google 请求,或者把正常抓取误判为异常流量。
日志过滤思路
错误思路:匹配固定 Chrome 版本
正确思路:匹配抓取工具标识和官方令牌,再验证来源 IP
💡 在日志系统里建议拆出三个字段:
crawler_token、verified_google、affected_product。这样比直接存一整段 user-agent 更适合分析。
📌 核心收获
- ✓ user-agent 可伪造:放行或限速前必须验证请求是否真的来自 Google。
- ✓ robots.txt 用令牌:配置规则时使用
Googlebot、GoogleOther等官方令牌,而不是完整请求头。 - ✓ 不同令牌影响不同产品:搜索、图片、视频、新闻、购物和测试工具要分别理解。
- ✓ Google-Extended 不影响搜索:它用于管理特定 AI 相关用途,不是搜索排名信号。
- ✓ Chrome 版本会变化:日志检索和过滤规则应使用通配思维。
🚀 立刻行动
- 打开最近 7 天服务器日志,按 user-agent 聚合包含
Google、Googlebot、Storebot、GoogleOther的请求。 - 为每类请求增加
crawler_token字段,优先归类为Googlebot、Googlebot-Image、Googlebot-Video、Googlebot-News、Storebot-Google、Google-InspectionTool、GoogleOther或Google-Extended。 - 对高频 IP 做 DNS 反查和正查,确认
verified_google=true后再纳入 Google 抓取统计或白名单。 - 检查 robots.txt 是否误用完整 user-agent 字符串;如果有,改成官方令牌,并用 Search Console 或日志观察规则是否生效。
来源:Google 常用抓取工具列表 | 本文为知识提炼与重新表达
RELATED / 相关推荐
接着读这些
按同一分类、系列与标签为你挑选。
Google 用户触发抓取器指南
Google 用户触发抓取器由用户操作或产品功能发起,可能忽略 robots.txt。本文梳理常见工具、验证方式和日志处理策略。
Google 抓取工具原理入门
Google 抓取工具不只有 Googlebot,还包括常见抓取工具、特殊抓取工具和用户触发的抓取器。本篇建立抓取基础设施的整体认知,解释协议、压缩、文件大小、主机负载、缓存和身份验证。
Google 网页抓取认知与优化指南
Google 抓取不是单次访问网页,而是发现、复抓、渲染、缓存和遵守访问控制的系统过程。本篇把官方抓取事实改写成站长可执行的优化清单。