Robots.txt生成器 - 在线搜索引擎爬虫规则文件生成工具
Robots.txt生成器
FREE TOOL

Robots.txt 生成器

可视化配置搜索引擎爬虫抓取规则,一键生成标准 robots.txt 文件

🔒 100% 本地运行 · 数据不上传服务器 · 安全隐私
快速模板:
⚙️ 基础配置
📋 抓取规则
📄 robots.txt 输出

相关工具推荐

📖 Robots.txt 生成器使用指南

什么是 Robots.txt?

Robots.txt 是一个放在网站根目录的文本文件,用于告诉搜索引擎爬虫哪些页面可以抓取,哪些页面不能抓取。它是网站与搜索引擎沟通的基础文件,也是 SEO 优化的重要组成部分。正确配置 robots.txt 可以帮助搜索引擎更高效地抓取你的网站。

主要功能

常见使用场景

新站上线:快速生成标准 robots.txt 文件。SEO优化:控制搜索引擎抓取范围,集中权重。后台保护:禁止爬虫抓取管理后台和敏感页面。节省带宽:禁止抓取图片、CSS、JS等静态资源。多站点管理:为不同网站快速生成配置文件。

使用方法

选择要配置的爬虫(User-agent),默认是所有爬虫。添加 Disallow(禁止抓取)或 Allow(允许抓取)规则,填写路径。可选配置抓取延迟和 Sitemap 地址。右侧会实时生成 robots.txt 内容。点击「复制」或「下载文件」按钮获取生成的文件,上传到网站根目录即可。

专业技巧

常见问题 FAQ

robots.txt 放在哪里?

robots.txt 必须放在网站的根目录下,文件名必须是小写的 robots.txt。例如:https://www.example.com/robots.txt。搜索引擎爬虫会自动访问这个地址来获取抓取规则。

Disallow 和 Allow 有什么区别?

Disallow 表示禁止爬虫抓取指定路径,Allow 表示允许爬虫抓取指定路径。Allow 的优先级高于 Disallow,常用于"禁止整个目录但允许其中某个文件"的场景。例如 Disallow: /admin/ 但 Allow: /admin/login.php。

robots.txt 能完全阻止页面被收录吗?

不能。robots.txt 只是告诉爬虫不要抓取,但如果其他页面有链接指向这些页面,搜索引擎仍然可能收录它们的 URL。要完全阻止页面被收录,应该使用 noindex 标签或 X-Robots-Tag 响应头。

Crawl-delay 有什么用?

Crawl-delay 指令用于告诉爬虫每次抓取之间的延迟时间(秒),可以减少爬虫对服务器的压力。但 Googlebot 不支持这个指令,Google 需要在 Search Console 中设置抓取速度。其他如 Bing、Yandex 等支持此指令。

路径支持通配符吗?

支持。* 匹配任意字符序列,$ 匹配 URL 结尾。例如 Disallow: /*.pdf$ 表示禁止抓取所有 PDF 文件,Disallow: /?* 表示禁止抓取带查询参数的 URL。注意不是所有爬虫都完全支持通配符。