跳到主要内容
IM智引科技

研究 / SEO

robots.txt 更新与缓存刷新指南

robots.txt 改完不会立刻全网生效。本篇教你下载现有文件、用 UTF-8 修改、上传到根目录,并通过 Search Console 请求 Google 刷新缓存。

智引科技增长实验室2026年5月10日5 分钟难度 入门

💡 核心摘要:更新 robots.txt 的标准流程是:先下载网站当前文件,按正确语法和 UTF-8 编码修改,再把新文件以 robots.txt 名称上传到对应网站根目录。Google 通常会在自动抓取中发现变更,并大约每 24 小时刷新缓存;如果需要更快生效,可以在 Search Console 的 robots.txt 报告中请求重新抓取。


一、robots.txt 更新不是改一行就结束

robots.txt 是抓取控制入口,任何改动都可能影响 Googlebot 是否能访问网站的重要路径。一次错误的 Disallow: / 可能让核心页面停止被抓取;一次误删规则,也可能让大量低价值参数页、测试路径或后台资源暴露给抓取工具。

因此,更新 robots.txt 应该像发布代码一样处理:先拿到线上当前版本,明确修改目标,在本地编辑并验证语法,再上传到正确根目录,最后请求 Google 刷新缓存并持续观察结果。

💡 不要直接凭记忆重写 robots.txt。先下载线上版本,保留已有规则和注释,再做最小必要改动。

二、先下载当前 robots.txt 文件

更新前的第一步是获取网站当前正在公开提供的 robots.txt。最简单的方式是在浏览器打开 https://example.com/robots.txt,复制内容到本地纯文本文件。

更稳妥的方式是用 curl 下载实际副本,这能减少浏览器格式化、复制遗漏或编码变化带来的问题。也可以在 Search Console 的 robots.txt 报告中复制 Google 当前读取到的内容,用来对比服务器线上版本和 Google 缓存版本是否一致。

下载命令

curl https://example.com/robots.txt -o robots.txt

下载后检查

文件名是否为 robots.txt
内容是否为纯文本
是否包含现有 User-agent 规则组
是否包含 Sitemap 声明
是否存在环境相关注释或历史规则

⚠️ 如果浏览器访问和 Search Console 报告内容不一致,说明 Google 可能还在使用缓存版本,或不同主机/协议的 robots.txt 被混淆了。

三、用正确语法和 UTF-8 修改

把下载文件放到文本编辑器或代码编辑器中修改。不要使用 Word 这类文字处理软件,因为它们可能加入格式标记、弯引号或不可见字符,导致 Google 无法按预期解析。

修改时应尽量做小范围变更。比如,只新增一个目录禁止规则、只调整某个抓取器规则组、只补充 Sitemap 地址。改动越大,越需要配套测试关键 URL 是否仍可抓取。

修改示例

User-agent: Googlebot
Disallow: /internal-search/
Disallow: /tmp/
Allow: /tmp/public-preview/

Sitemap: https://example.com/sitemap.xml

💡 保存时使用 UTF-8 编码。Google 会忽略非 UTF-8 字符,严重时可能让部分规则失效。

四、上传到对应网站根目录

修改完成后,把新文件以 robots.txt 名称上传到网站根目录。根目录不是“首页所在页面的目录”,而是抓取工具能通过 https://example.com/robots.txt 访问到的位置。

如果网站首页位于某个子路径,例如 subdomain.example.com/site/example/,你未必有权限修改 subdomain.example.com/robots.txt。这时应联系域名管理员、平台管理员或托管服务商,而不是把文件上传到错误路径。

上传后必须验证

https://example.com/robots.txt 可以打开
返回状态码为 200
内容是新版本
文件名仍是 robots.txt
位置是对应主机根目录
核心规则没有被 CDN 或缓存替换

⚠️ 上传到 /site/example/robots.txt 通常不会控制整个 subdomain.example.com,除非这个路径本身就是主机根目录。

五、托管平台可能不允许直接编辑

如果你使用 Wix、Blogger 或类似托管建站服务,可能无法直接上传或修改根目录下的 robots.txt。平台通常会提供搜索可见性、页面隐藏、站点地图或 SEO 设置页面,让用户间接控制搜索引擎访问。

这种情况下,不要试图绕过平台限制。更实际的做法是查找平台文档,例如搜索“Wix 向搜索引擎隐藏网页”或“Blogger robots.txt 设置”,然后用平台支持的方式调整页面是否可被抓取或展示。

💡 托管平台的 SEO 设置不一定等价于手写 robots.txt。改动后仍要用公开 URL 和 Search Console 验证最终效果。

六、Google 通常每 24 小时刷新缓存

Google 抓取工具会在自动抓取过程中发现 robots.txt 文件变化,并通常大约每 24 小时更新一次缓存版本。这意味着你上传新文件后,Google 不一定立刻按新规则抓取。

如果只是常规优化,可以等待 Google 自动刷新。如果是紧急修复,例如误封全站、放开核心栏目或阻止大量低价值 URL,可以使用 Search Console robots.txt 报告中的“请求重新抓取”功能,让 Google 更快刷新缓存。

刷新缓存步骤

打开 Search Console
选择对应资源
进入 robots.txt 报告
确认当前读取内容
点击请求重新抓取
观察后续读取和抓取状态

⚠️ 请求刷新缓存不是排名恢复按钮。它只帮助 Google 更快重新获取 robots.txt,后续抓取和索引变化仍需要时间。

七、更新后要监控抓取影响

robots.txt 更新后,至少观察 24-48 小时。重点看 Google 是否能读取新文件、关键页面是否仍可抓取、低价值路径抓取是否下降,以及 Search Console 中是否出现新的抓取或索引异常。

对大型网站来说,建议把 robots.txt 纳入发布监控:文件内容变更要有 diff,线上返回状态要有探测,关键路径要有自动测试。这样可以减少人工更新导致的误封、误放和缓存混乱。

监控清单

/robots.txt 返回 200
Search Console 读取新版本
核心栏目未被 Disallow
CSS/JavaScript/图片资源未被误封
低价值目录抓取量下降
Search Console 索引状态无异常扩大

💡 每次 robots.txt 更新都应该留下变更原因。几个月后回看规则时,注释和提交记录会节省大量排查时间。


📌 核心收获

  • 先下载线上版本:不要凭记忆重写 robots.txt,避免丢失已有规则。
  • 用 UTF-8 纯文本修改:避免文字处理软件加入不可见格式或错误编码。
  • 上传到根目录:文件必须能通过对应主机的 /robots.txt 访问。
  • 托管平台走平台设置:没有根目录权限时,联系管理员或使用平台 SEO 控制项。
  • Google 有缓存:通常约 24 小时自动刷新,紧急变更可用 Search Console 请求重新抓取。

🚀 立刻行动

  1. curl https://你的域名/robots.txt -o robots.txt 下载当前线上文件,并保存一份备份。
  2. 在代码编辑器中修改规则,确认文件仍为 UTF-8 纯文本,并保留必要注释。
  3. 上传到对应主机根目录后,立即访问 https://你的域名/robots.txt,确认返回新版本。
  4. 打开 Search Console robots.txt 报告,检查 Google 当前读取内容,并在紧急情况下请求重新抓取。
  5. 更新后观察 24-48 小时,确认核心页面可抓取、低价值路径抓取下降且索引报告无异常扩大。

来源:更新 robots.txt 文件 | 本文为知识提炼与重新表达

NEXT ACTION / 下一步

继续系列:Google robots.txt 管理抓取指南

把读到的方法变成一个小行动,完成后再回来迭代。

继续

RELATED / 相关推荐

接着读这些

按同一分类、系列与标签为你挑选。