Robots.txt 生成器

抓取规则
点一下会替换下面所有规则,可再手工调整。
Sitemap 地址(每行一条)
robots.txt 是约定而非强制:正规搜索引擎会遵守, 恶意采集程序会直接忽略。敏感目录还应配合登录鉴权或 IP 限制。
robots.txt
在左侧配置规则,这里会实时生成 robots.txt
上传到网站根目录即生效
在线 robots.txt 生成器,按组配置 User-agent 与 Allow/Disallow 规则,支持 Crawl-delay 与 Sitemap 声明,内置 WordPress、屏蔽 AI 爬虫等常用预设。

工具简介

在线 Robots.txt 生成器。按组配置 User-agent 与 Allow / Disallow 规则,可加 Crawl-delay 与 Sitemap 声明,实时生成符合规范的 robots.txt。内置 WordPress、Typecho、电商站、屏蔽 AI 爬虫等常用预设。

使用步骤

  1. 点「快速预设」选一个接近的模板,或点「添加 User-agent 组」从零配置。
  2. 在每个组里选择 User-agent,添加 Allow / Disallow 规则(路径留空的规则会被忽略)。
  3. 需要限速时填 Crawl-delay(单位:秒)。
  4. 在下方填 Sitemap 地址,每行一条。
  5. 复制结果或下载 robots.txt,上传到网站根目录即可生效。

robots.txt 是什么

robots.txt 是放在网站根目录的一个纯文本文件,用来告诉搜索引擎蜘蛛哪些目录可以抓、哪些不要抓。它由若干「组」组成,每组以 User-agent 开头,后面跟着该组适用的规则。

User-agent: *
Disallow: /admin/
Allow: /

User-agent: GPTBot
Disallow: /

Crawl-delay: 1
Sitemap: https://www.example.com/sitemap.xml

常用 User-agent

写法说明
*所有爬虫(通配)
GooglebotGoogle 网页抓取
Googlebot-ImageGoogle 图片抓取
Bingbot必应
Baiduspider百度
Sogou web spider搜狗
360Spider360 搜索
Bytespider字节跳动
GPTBotOpenAI 训练抓取
CCBotCommon Crawl(多个大模型语料来源)
ClaudeBotAnthropic

Allow 与 Disallow 的匹配规则

  • 路径匹配是前缀匹配:Disallow: /admin/ 会拦住 /admin/a、/admin/b。
  • 是通配符,$ 表示结尾。例如 Disallow: /?orderby= 拦掉所有带该参数的地址。
  • Allow 优先级高于 Disallow(在路径长度相同的情况下),所以可以用 Allow 给某个子路径开例外。
  • 多个组同时匹配时,最具体的 User-agent 优先。例如同时写了 Googlebot 组和 * 组,Google 只用 Googlebot 组。
  • 空规则 Disallow:(冒号后什么都不写)等价于「允许全部」。

常见的写法建议

目的写法
禁止全站抓取User-agent: * + Disallow: /
允许全站抓取User-agent: * + Disallow:(留空)或直接不写规则
屏蔽后台Disallow: /admin/、Disallow: /wp-admin/
屏蔽搜索结果页Disallow: /?s=、Disallow: /?keyword=
屏蔽购物车与结算Disallow: /cart/、Disallow: /checkout/
屏蔽 AI 抓取对 GPTBot、CCBot、ClaudeBot、Bytespider 分别 Disallow: /

重要提醒

robots.txt 是约定,不是强制。正规搜索引擎会遵守,但恶意采集程序会直接忽略它。

因此:

  • 敏感目录(后台、备份、配置文件)必须配合登录鉴权*或 *IP 白名单,不能只靠 robots.txt。
  • 不要在 robots.txt 里写出不想让人知道的路径,因为它本身是公开可读的。
  • 屏蔽 AI 爬虫只能拦住声明身份的正规爬虫,不能拦住伪装 User-agent 的采集。

注意事项

  • 文件必须放在域名根目录(如 https://www.example.com/robots.txt),放在子目录无效。
  • 一个域名只能有一个 robots.txt。
  • 语法不区分大小写,但路径区分。
  • 修改后搜索引擎需要一段时间重新抓取才会生效。

常见问题 FAQ

生成的注释行有影响吗?

没有。以 # 开头的是注释,爬虫会忽略。如果不想要,取消勾选「在文件开头加一行注释」即可。

语法区分大小写吗?

指令名(User-agent、Disallow 等)不区分大小写,但路径部分区分大小写。

能否用 robots.txt 屏蔽搜索结果页?

可以,常见写法是 Disallow: /*?s= 或 Disallow: /*?keyword=。但更规范的做法是给这类页面加 noindex 元标签。

改了 robots.txt 多久生效?

取决于搜索引擎的重新抓取周期,通常几小时到几天。可以在搜索资源平台里手动提交 robots.txt 加快更新。

Sitemap 地址必须写吗?

不必须,但强烈建议写。写上后搜索引擎能更快发现你的站点地图,尤其是新站。地址必须是完整的绝对地址。

Crawl-delay 有用吗?

Google 和 Bing 已明确不支持 Crawl-delay。它对部分爬虫仍有效,但降低抓取频率更可靠的做法是在搜索资源平台里设置抓取速率。

怎么屏蔽 AI 训练爬虫?

对 GPTBot、CCBot、ClaudeBot、Bytespider 等分别写一组 Disallow: /。工具里有「屏蔽 AI 抓取」预设可直接套用。

Disallow: / 和 Disallow: 有什么区别?

Disallow: / 是禁止抓取全站;Disallow:(冒号后留空)表示不限制,等价于允许全部。差一个斜杠,效果完全相反。

写了多个 User-agent 组,爬虫用哪个?

最具体的那一个。例如同时存在 Googlebot 组和 * 组,Google 只读 Googlebot 组,不会把两组规则合并。

Allow 和 Disallow 同时匹配时听谁的?

路径更长的规则优先;路径长度相同时 Allow 优先。所以可以用 Disallow: /admin/ 加 Allow: /admin/public/ 的方式给子路径开例外。

robots.txt 能阻止别人抓取吗?

不能。它是约定而非强制,正规搜索引擎会遵守,恶意采集程序会直接忽略。敏感目录必须配合登录鉴权或 IP 限制。

robots.txt 放在哪里才有效?

必须放在域名根目录,例如 https://www.example.com/robots.txt。放在子目录(如 /blog/robots.txt)不会被搜索引擎识别。一个域名只能有一个 robots.txt。