ToolboxAgent

robots.txt 生成器(含 AI 爬虫)

可视化生成 robots.txt,内置 GPTBot、ClaudeBot、Google-Extended、CCBot、Bytespider、PerplexityBot 等 AI 爬虫预设,按路径逐行配置,配套 sitemap.xml 字段。

Global disallowed paths

Paths blocked for every crawler you enable. One per line. Example: /admin/, /private/, /cart.

Search engines

All crawlers (default) *

Wildcard rule applied to any bot without its own group

Googlebot Googlebot

Google search index

Bingbot Bingbot

Microsoft Bing search index

DuckDuckBot DuckDuckBot

DuckDuckGo search index

Baiduspider Baiduspider

Baidu search index

YandexBot YandexBot

Yandex search index

AI training crawlers

2023+

These crawlers feed training data for ChatGPT, Claude, Gemini, and other LLMs. Blocking them opts your content out of model training.

GPTBot GPTBot

OpenAI training & retrieval (ChatGPT)

ClaudeBot ClaudeBot

Anthropic training & retrieval (Claude)

Google-Extended Google-Extended

Gemini training (separate from Googlebot)

CCBot CCBot

Common Crawl — open dataset used by many models

Bytespider Bytespider

ByteDance training crawler

PerplexityBot PerplexityBot

Perplexity answer engine retrieval

Applebot-Extended Applebot-Extended

Apple Intelligence training

ImagesiftBot ImagesiftBot

Image training (Glooma / Hive)

Sitemap

Generated robots.txt

User-agent: *
Disallow:

使用说明

  1. 1 为每个爬虫选择允许、禁止或自定义路径
  2. 2 填写 sitemap.xml 地址和全局禁止路径(如 /admin/、/private/)
  3. 3 复制或下载生成的 robots.txt,并上传到网站根目录

相关工具

关于此工具

robots.txt 是网站根目录下控制爬虫访问的小文本文件,搜索引擎、AI 训练爬虫、监控机器人都遵循其中的规则。本工具帮助你可视化生成 robots.txt,无需手写语法。

工具预置了主流搜索引擎爬虫(Googlebot、Bingbot、DuckDuckBot、Baiduspider、YandexBot)和 2023 年后出现的一批 AI 训练爬虫(GPTBot、ClaudeBot、Google-Extended、CCBot、Bytespider、PerplexityBot、Applebot-Extended、ImagesiftBot)。你可以按爬虫单独允许或屏蔽,也可以全局禁止所有爬虫访问特定路径。

生成的文件可以直接复制到剪贴板,或下载为 robots.txt 上传到 https://你的域名.com/robots.txt。建议同时提交 sitemap.xml,让搜索引擎更快发现你的全部页面。

常见问题

屏蔽 GPTBot、ClaudeBot 等 AI 爬虫有什么影响? +

屏蔽 AI 爬虫意味着你的内容不会被这些公司用于训练下一代模型。OpenAI(GPTBot)、Anthropic(ClaudeBot)、Google(Google-Extended 用于 Gemini 训练)、Common Crawl(CCBot,许多模型的数据源)等都提供 robots.txt 识别标识。代价是你的内容不会出现在 ChatGPT、Perplexity 等 AI 搜索的回答中。这是内容创作者的商业决策,本工具不替你做选择。

robots.txt 的规则会被爬虫严格遵守吗? +

主流搜索引擎(Google、Bing、百度)和大型 AI 公司都会遵守 robots.txt。但恶意爬虫、邮件地址采集器、小型 scraping 服务可能无视规则——robots.txt 不是安全机制,不能保护敏感内容。如果某条 URL 真的不能公开,应该用认证、授权或 noindex 标签,而不是只依赖 robots.txt。

User-agent: * 和单独配置某个爬虫冲突时怎么处理? +

爬虫会先找匹配自己名字的组(如 Googlebot 找 User-agent: Googlebot),找不到才回退到 User-agent: *。如果为某个爬虫单独配置了规则,它会忽略 * 组的规则。本工具生成的 robots.txt 会自动按爬虫分组,避免冲突。

Disallow: / 和 Disallow: 有什么区别? +

Disallow: / 表示禁止访问整站根目录(即全部页面)。Disallow: (空值)表示不禁止任何路径,等价于允许全部。这两条经常被搞混,导致整站被搜索引擎除名。本工具用「允许」「禁止」「自定义」三个选项明确表达意图,避免误写。

sitemap 字段必须填吗? +

不是必须,但强烈推荐。在 robots.txt 中声明 Sitemap: https://...sitemap.xml 可以让搜索引擎更高效地发现你的全部页面,特别是新站、页面层级深、内部链接少的网站。多个 sitemap 可以分行写多条 Sitemap: 指令。