在线 Robots.txt 生成器。按组配置 User-agent 与 Allow / Disallow 规则,可加 Crawl-delay 与 Sitemap 声明,实时生成符合规范的 robots.txt。内置 WordPress、Typecho、电商站、屏蔽 AI 爬虫等常用预设。
robots.txt,上传到网站根目录即可生效。robots.txt 是放在网站根目录的一个纯文本文件,用来告诉搜索引擎蜘蛛哪些目录可以抓、哪些不要抓。它由若干「组」组成,每组以 User-agent 开头,后面跟着该组适用的规则。
User-agent: *
Disallow: /admin/
Allow: /
User-agent: GPTBot
Disallow: /
Crawl-delay: 1
Sitemap: https://www.example.com/sitemap.xml
| 写法 | 说明 |
|---|---|
* | 所有爬虫(通配) |
Googlebot | Google 网页抓取 |
Googlebot-Image | Google 图片抓取 |
Bingbot | 必应 |
Baiduspider | 百度 |
Sogou web spider | 搜狗 |
360Spider | 360 搜索 |
Bytespider | 字节跳动 |
GPTBot | OpenAI 训练抓取 |
CCBot | Common Crawl(多个大模型语料来源) |
ClaudeBot | Anthropic |
Disallow: /admin/ 会拦住 /admin/a、/admin/b。 是通配符,$ 表示结尾。例如 Disallow: /?orderby= 拦掉所有带该参数的地址。Allow 给某个子路径开例外。Googlebot 组和 * 组,Google 只用 Googlebot 组。Disallow:(冒号后什么都不写)等价于「允许全部」。| 目的 | 写法 |
|---|---|
| 禁止全站抓取 | User-agent: * + Disallow: / |
| 允许全站抓取 | User-agent: * + Disallow:(留空)或直接不写规则 |
| 屏蔽后台 | Disallow: /admin/、Disallow: /wp-admin/ |
| 屏蔽搜索结果页 | Disallow: /?s=、Disallow: /?keyword= |
| 屏蔽购物车与结算 | Disallow: /cart/、Disallow: /checkout/ |
| 屏蔽 AI 抓取 | 对 GPTBot、CCBot、ClaudeBot、Bytespider 分别 Disallow: / |
robots.txt 是约定,不是强制。正规搜索引擎会遵守,但恶意采集程序会直接忽略它。
因此:
https://www.example.com/robots.txt),放在子目录无效。生成的注释行有影响吗?
语法区分大小写吗?
能否用 robots.txt 屏蔽搜索结果页?
改了 robots.txt 多久生效?
Sitemap 地址必须写吗?
Crawl-delay 有用吗?
怎么屏蔽 AI 训练爬虫?
Disallow: / 和 Disallow: 有什么区别?
写了多个 User-agent 组,爬虫用哪个?
Allow 和 Disallow 同时匹配时听谁的?
robots.txt 能阻止别人抓取吗?
robots.txt 放在哪里才有效?