跳到主要内容
IM智引科技

研究 / SEO

robots.txt 创建与提交实战指南

robots.txt 用来控制抓取工具可以访问哪些路径。本篇教你创建文件、编写 User-agent/Allow/Disallow/Sitemap 规则、上传到根目录并测试是否生效。

智引科技增长实验室2026年5月10日6 分钟难度 入门

💡 核心摘要:robots.txt 是放在网站根目录的纯文本文件,用来告诉抓取工具哪些路径可以抓取、哪些路径不应抓取。它必须命名为 robots.txt,使用 UTF-8 编码,并且只对所在协议、主机和端口生效。创建后无需主动提交给 Google,Google 抓取工具会自动发现;但上传后必须测试公开访问和规则解析是否正确。


一、先明确 robots.txt 能做什么

robots.txt 的作用是管理抓取,不是管理索引。它可以告诉 Googlebot 等抓取工具不要请求某些目录或文件,但它并不能保证某个 URL 一定不会出现在搜索结果中。如果一个被 robots.txt 阻止的 URL 已经被外部链接发现,Google 仍可能在没有内容摘要的情况下展示该 URL。

因此,robots.txt 适合用来减少低价值路径、重复路径、后台资源或无限参数页的抓取消耗;如果目标是让页面不进入索引,应优先使用 noindex、删除页面、访问权限控制或其他索引控制方式。

💡 实务原则:robots.txt 控制“能不能抓”,noindex 控制“要不要索引”。

二、创建文件时先守住格式底线

robots.txt 是普通文本文件,可以用 Notepad、TextEdit、vi、emacs 或代码编辑器创建。不要用 Word 这类文字处理软件保存,因为它们可能加入专有格式、弯引号或不可见字符,导致抓取工具无法正确解析。

文件名必须严格为 robots.txt,网站同一个主机上只能有一个 robots.txt。文件应使用 UTF-8 编码,ASCII 也属于 UTF-8 范围。Google 可能会忽略非 UTF-8 字符,这会让部分规则失效。

文件格式要求

文件名:robots.txt
文件类型:纯文本
编码:UTF-8
位置:网站根目录
数量:每个主机一个

⚠️ Robots.txtrobots.TXTrobot.txt 都不是标准写法。生产环境要保持小写且完整命名。

三、必须上传到对应主机根目录

robots.txt 必须位于它要控制的网站主机根目录。例如,要控制 https://www.example.com/ 下的路径,文件必须能通过 https://www.example.com/robots.txt 访问,不能放在 https://www.example.com/pages/robots.txt

它的作用范围只覆盖同一协议、主机和端口。https://example.com/robots.txt 不会控制 https://m.example.com/,也不会控制 http://example.com/。如果网站有多个子域、协议或非标准端口,就需要分别确认 robots.txt 文件和规则。

作用范围示例

https://example.com/robots.txt
只适用于:https://example.com/*
不适用于:https://www.example.com/*
不适用于:http://example.com/*
不适用于:https://example.com:8181/*

💡 如果无法访问网站根目录,例如使用托管建站平台,应在平台后台查找搜索可见性或 SEO 设置,而不是强行创建无效路径。

四、从最小可用规则开始

robots.txt 由一个或多个规则组组成。每个组以 User-agent 开头,后面跟着 AllowDisallow 指令。默认情况下,未被 Disallow 阻止的路径都允许抓取。

下面是一个最小示例:禁止 Googlebot 抓取 /nogooglebot/ 目录,允许其他抓取工具访问全站,并声明 Sitemap 地址。

User-agent: Googlebot
Disallow: /nogooglebot/

User-agent: *
Allow: /

Sitemap: https://www.example.com/sitemap.xml

⚠️ 不写 Allow: / 时,默认也是允许抓取全站。保留它可以提升可读性,但不是必需规则。

五、理解 User-agent、Disallow、Allow 和 Sitemap

User-agent 指定规则组适用于哪个抓取工具。* 可以匹配大多数抓取工具,但 Google AdsBot 抓取工具需要明确指定,不能完全依赖通配符。Disallow 指定不希望被抓取的路径,Allow 则用于放开被禁止目录中的某些子路径或文件。

Sitemap 是可选项,用来告诉 Google 站点地图在哪里。它必须写完整 URL,例如 https://example.com/sitemap.xml。Sitemap 不是抓取允许或禁止规则,它只是提供重要 URL 和更新时间线索。

常见规则示例

# 禁止 Googlebot 抓取整个网站
User-agent: Googlebot
Disallow: /

# 禁止 Googlebot 和 AdsBot-Google 抓取整个网站
User-agent: Googlebot
User-agent: AdsBot-Google
Disallow: /

# 禁止大多数抓取工具抓取整个网站
User-agent: *
Disallow: /

💡 每个规则组至少应包含一个 User-agent,并且至少包含一个 AllowDisallow

六、规则大小写和注释容易踩坑

robots.txt 规则区分大小写。Disallow: /file.asp 会匹配 /file.asp,但不会匹配 /FILE.asp。如果你的服务器路径大小写敏感,这一点尤其重要。

# 表示注释开始,抓取工具在处理时会忽略注释内容。注释适合解释规则意图,但不要把关键规则写在注释后面,也不要依赖注释表达控制逻辑。

易错示例

User-agent: Googlebot
Disallow: /Private/

# 这条不会阻止 /private/,因为路径大小写不同

⚠️ 上线 robots.txt 前,不要只凭肉眼检查。大小写、斜杠、编码和放置位置都可能造成规则失效。

七、上传后必须测试公开访问

上传 robots.txt 后,先用无痕浏览窗口访问文件地址,例如 https://example.com/robots.txt。如果浏览器能直接看到纯文本内容,说明文件至少可以公开访问。

接着用 Search Console 的 robots.txt 报告检查 Google 能否读取和解析规则。开发团队也可以使用 Google 开源 robots.txt 库在本地测试规则解析,尤其适合大型站点、自动生成规则或多环境发布流程。

测试清单

浏览器能打开 /robots.txt
返回状态码为 200
内容类型可被当作纯文本读取
编码为 UTF-8
Search Console 可读取
核心路径规则符合预期
Sitemap URL 是完整地址

💡 robots.txt 属于基础设施文件,应该进入发布流程和监控,而不是临时手工维护。

八、Google 会自动发现 robots.txt

robots.txt 上传并测试通过后,不需要单独向 Google 提交。Google 抓取工具会自动发现并开始使用它。如果后续更新了 robots.txt,并且希望 Google 尽快刷新缓存副本,可以使用官方的 robots.txt 更新提交方式。

更新时要谨慎。一次错误的 Disallow: / 可能让整个网站的重要页面停止被抓取;一次错误的放开,也可能让大量低价值参数页进入抓取队列。建议任何 robots.txt 改动都经过代码审查、测试和上线后监控。

⚠️ robots.txt 改动影响的是抓取入口。大型站点上线前应先在测试环境验证,再逐步发布。


📌 核心收获

  • robots.txt 控制抓取:它不是索引删除工具,也不能替代 noindex
  • 位置必须正确:文件必须放在对应协议、主机和端口的根目录。
  • 格式必须简单可靠:使用纯文本、UTF-8 编码,并命名为 robots.txt
  • 规则按组生效:每组从 User-agent 开始,配合 AllowDisallow 控制路径。
  • 上传后要测试:确认公开可访问,并用 Search Console 或本地库验证解析结果。

🚀 立刻行动

  1. 打开 https://你的域名/robots.txt,确认文件是否存在、是否公开可访问、是否返回 200
  2. 检查文件位置是否覆盖正确主机,尤其是 www、非 www、子域名、HTTP/HTTPS 和非标准端口。
  3. 审查每个 User-agent 规则组,确认 Disallow 没有误封核心栏目、CSS、JavaScript 或图片资源。
  4. 确认 Sitemap 使用完整 URL,并指向真实存在、可访问的站点地图文件。
  5. 在 Search Console robots.txt 报告中测试关键页面路径,确认 Google 对规则的解析符合预期。

来源:如何编写和提交 robots.txt 文件 | 本文为知识提炼与重新表达

NEXT ACTION / 下一步

继续系列:Google robots.txt 管理抓取指南

把读到的方法变成一个小行动,完成后再回来迭代。

继续

RELATED / 相关推荐

接着读这些

按同一分类、系列与标签为你挑选。