跳到主要内容
IM智引科技

研究 / SEO

Google 常用抓取工具速查指南

Google 常用抓取工具不只有 Googlebot。本文梳理常见 user-agent、robots.txt 令牌、受影响产品和日志过滤要点,帮助你正确配置抓取规则。

智引科技增长实验室2026年5月10日6 分钟难度 进阶

💡 核心摘要:Google 的常用抓取工具服务于搜索索引、图片、视频、新闻、购物、Search Console 测试工具、通用内容抓取和 AI 相关使用许可。配置 robots.txt 时,关键不是背完整 user-agent 字符串,而是选对 User-agent 令牌,并理解它会影响哪些 Google 产品。


一、常用抓取工具解决什么问题

Google 常用抓取工具主要用于自动发现和读取公开网页内容。这些请求会服务 Google 搜索索引、图片和视频理解、新闻内容、购物体验、Search Console 测试工具,以及部分产品团队的公开内容抓取。

它们在自动抓取时会遵循 robots.txt 规则,也会继承 Google 抓取工具的一般技术属性。对站长来说,真正需要管理的是三件事:日志里是谁在访问、robots.txt 应该匹配哪个令牌、这个令牌会影响哪些产品。

💡 实务上不要只按“是否包含 Google”来分类流量。先把 Googlebot、GoogleOther、Storebot-Google、Google-InspectionTool 和 Google-Extended 分开,再决定是否允许、限制或单独统计。

二、先确认请求真的来自 Google

HTTP User-Agent 字符串可以被任何客户端伪造。日志里出现 Googlebot,并不自动等于请求来自 Google。把 user-agent 当作白名单条件前,应先用 DNS 反查、正查或 Google 官方 IP 段文件验证来源。

常用抓取工具通常来自 Google 发布的常见抓取工具 IP 范围。它们的反向 DNS 主机名通常会匹配 googlebot.comgeo.googlebot.com 相关模式。只有来源验证通过后,日志分析和安全策略才有意义。

⚠️ 不要把 user-agent 字符串直接作为 WAF 放行依据。伪装请求可能借此绕过限速、反爬、后台路径保护或资源消耗控制。

三、robots.txt 看令牌,不看完整字符串

完整 HTTP user-agent 往往很长,尤其是智能手机版 Googlebot,会包含设备、系统、WebKit、Chrome 版本和 Googlebot 标识。robots.txt 里不需要复制整段字符串,只需要使用官方列出的用户代理令牌。

例如,想给 Googlebot 单独设置抓取规则,可以使用 Googlebot 令牌:

user-agent: Googlebot
allow: /archive/1Q84
disallow: /archive

同一个抓取工具可能有多个 HTTP user-agent 字符串,但通常只需要在 robots.txt 中使用一个匹配的令牌。这样规则更短,也更不容易因为 Chrome 版本变化而失效。

💡 把 robots.txt 当作“令牌规则表”,不要当作“完整请求头匹配表”。

四、搜索相关抓取工具怎么区分

Googlebot 是最核心的搜索抓取工具。对 Googlebot 设置的抓取偏好会影响 Google 搜索,以及 Google 图片、视频、新闻、探索等依赖搜索抓取能力的产品。

图片、视频和新闻还有更细的令牌。Googlebot-Image 主要影响图片相关展示,Googlebot-Video 影响视频相关搜索功能,Googlebot-News 影响 Google 新闻产品。新闻抓取不一定有独立 HTTP user-agent 字符串,但 robots.txt 可以使用 Googlebot-News 令牌做规则控制。

常见搜索令牌

Googlebot
Googlebot-Image
Googlebot-Video
Googlebot-News

⚠️ 如果你禁止 Googlebot 抓取核心页面,影响通常不止网页搜索,也可能连带影响图片、视频、新闻或探索等展示场景。

五、购物、测试和通用抓取要分开管

Storebot-Google 服务 Google 购物相关界面,例如搜索中的购物标签页和 Google 购物。电商站如果希望商品被购物相关体验理解,需要避免误伤这个令牌。

Google-InspectionTool 对应 Search Console 中的测试工具,例如网址检查和富媒体搜索结果测试。它不会影响 Google 搜索或其他产品,但会影响站长在 Search Console 里看到的测试结果。

GoogleOther 是通用抓取工具,可供不同 Google 产品团队抓取公开内容。它还有面向图片和视频的优化版本:GoogleOther-ImageGoogleOther-Video。这些令牌通常不直接代表某个具体搜索展示产品。

令牌 典型用途 配置提醒
Storebot-Google Google 购物 电商站不要误封商品页
Google-InspectionTool Search Console 测试 影响测试工具,不影响搜索排名
GoogleOther 通用公开内容抓取 适合单独统计和限速观察

六、AI 相关令牌不要和搜索抓取混淆

Google-CloudVertexBot 与网站所有者请求构建 Vertex AI 代理有关。它不会影响 Google 搜索或其他产品,因此不应把它当成普通 Googlebot 搜索抓取来分析。

Google-Extended 更容易被误解。它不是一个独立 HTTP user-agent 字符串,而是 robots.txt 中的产品令牌。发布商可以用它管理网站内容是否允许用于训练未来版本的 Gemini 模型,或在相关产品中建立依据。

Google 官方明确说明,Google-Extended 不影响网站是否出现在 Google 搜索结果中,也不是 Google 搜索排名信号。因此,禁止 Google-Extended 不等于禁止 Google 搜索抓取。

⚠️ 如果你的目标是控制 AI 训练或 Gemini 相关使用,处理 Google-Extended。如果目标是控制搜索收录,处理 Googlebot、索引指令和页面可抓取性。

七、Chrome 版本号要用通配思维

很多 Google 抓取工具的 user-agent 中会出现类似 Chrome/W.X.Y.Z 的占位格式。这里的 W.X.Y.Z 代表实际 Chrome 浏览器版本,会随着 Googlebot 使用的 Chromium 版本更新而变化。

因此,日志检索、服务器过滤和安全规则不要绑定某个具体 Chrome 版本号。否则版本升级后,规则可能漏匹配真实 Google 请求,或者把正常抓取误判为异常流量。

日志过滤思路

错误思路:匹配固定 Chrome 版本
正确思路:匹配抓取工具标识和官方令牌,再验证来源 IP

💡 在日志系统里建议拆出三个字段:crawler_tokenverified_googleaffected_product。这样比直接存一整段 user-agent 更适合分析。


📌 核心收获

  • user-agent 可伪造:放行或限速前必须验证请求是否真的来自 Google。
  • robots.txt 用令牌:配置规则时使用 GooglebotGoogleOther 等官方令牌,而不是完整请求头。
  • 不同令牌影响不同产品:搜索、图片、视频、新闻、购物和测试工具要分别理解。
  • Google-Extended 不影响搜索:它用于管理特定 AI 相关用途,不是搜索排名信号。
  • Chrome 版本会变化:日志检索和过滤规则应使用通配思维。

🚀 立刻行动

  1. 打开最近 7 天服务器日志,按 user-agent 聚合包含 GoogleGooglebotStorebotGoogleOther 的请求。
  2. 为每类请求增加 crawler_token 字段,优先归类为 GooglebotGooglebot-ImageGooglebot-VideoGooglebot-NewsStorebot-GoogleGoogle-InspectionToolGoogleOtherGoogle-Extended
  3. 对高频 IP 做 DNS 反查和正查,确认 verified_google=true 后再纳入 Google 抓取统计或白名单。
  4. 检查 robots.txt 是否误用完整 user-agent 字符串;如果有,改成官方令牌,并用 Search Console 或日志观察规则是否生效。

来源:Google 常用抓取工具列表 | 本文为知识提炼与重新表达

NEXT ACTION / 下一步

继续系列:Google 抓取工具介绍与原理

把读到的方法变成一个小行动,完成后再回来迭代。

继续

RELATED / 相关推荐

接着读这些

按同一分类、系列与标签为你挑选。