可视化配置搜索引擎爬虫抓取规则,一键生成标准 robots.txt 文件
Robots.txt 是一个放在网站根目录的文本文件,用于告诉搜索引擎爬虫哪些页面可以抓取,哪些页面不能抓取。它是网站与搜索引擎沟通的基础文件,也是 SEO 优化的重要组成部分。正确配置 robots.txt 可以帮助搜索引擎更高效地抓取你的网站。
新站上线:快速生成标准 robots.txt 文件。SEO优化:控制搜索引擎抓取范围,集中权重。后台保护:禁止爬虫抓取管理后台和敏感页面。节省带宽:禁止抓取图片、CSS、JS等静态资源。多站点管理:为不同网站快速生成配置文件。
选择要配置的爬虫(User-agent),默认是所有爬虫。添加 Disallow(禁止抓取)或 Allow(允许抓取)规则,填写路径。可选配置抓取延迟和 Sitemap 地址。右侧会实时生成 robots.txt 内容。点击「复制」或「下载文件」按钮获取生成的文件,上传到网站根目录即可。
robots.txt 必须放在网站的根目录下,文件名必须是小写的 robots.txt。例如:https://www.example.com/robots.txt。搜索引擎爬虫会自动访问这个地址来获取抓取规则。
Disallow 表示禁止爬虫抓取指定路径,Allow 表示允许爬虫抓取指定路径。Allow 的优先级高于 Disallow,常用于"禁止整个目录但允许其中某个文件"的场景。例如 Disallow: /admin/ 但 Allow: /admin/login.php。
不能。robots.txt 只是告诉爬虫不要抓取,但如果其他页面有链接指向这些页面,搜索引擎仍然可能收录它们的 URL。要完全阻止页面被收录,应该使用 noindex 标签或 X-Robots-Tag 响应头。
Crawl-delay 指令用于告诉爬虫每次抓取之间的延迟时间(秒),可以减少爬虫对服务器的压力。但 Googlebot 不支持这个指令,Google 需要在 Search Console 中设置抓取速度。其他如 Bing、Yandex 等支持此指令。
支持。* 匹配任意字符序列,$ 匹配 URL 结尾。例如 Disallow: /*.pdf$ 表示禁止抓取所有 PDF 文件,Disallow: /?* 表示禁止抓取带查询参数的 URL。注意不是所有爬虫都完全支持通配符。