Robots.txt 生成器
本地优先
生成包含 user-agent、allow、disallow 和 sitemap 指令的 robots.txt 文件。
什么是 Robots.txt 生成?
生成包含 user-agent、allow、disallow 和 sitemap 指令的 robots.txt 文件。
- 生成 robots.txt 指令
- 添加 sitemap 地址
- 创建 allow 和 disallow 规则
如何使用?
- 粘贴需要处理的 robots.txt 内容。
- 根据需要调整质量、尺寸或输出选项。
- 点击按钮完成生成 robots.txt,在页面中预览结果。
- 确认无误后复制结果或下载生成文件。
适合哪些场景?
- 整理开发调试、接口联调、文档编写中的文本数据。
- 在提交配置、分享代码片段或导入表格前快速清理格式。
- 需要隐私优先、不希望文件或内容离开浏览器的场景。
官方标准与适用范围
RFC 9309 标准化机器人排除协议,Google 文档说明 robots.txt 的部署规则。本页逐个物理行读取 key=value,重复键以后出现者覆盖较早值,然后只输出一个 User-agent 组、后续 Allow 与 Disallow 记录,以及一条 Sitemap。多个路径只能在同一键值行用逗号分隔;不含等号的续行会被忽略。生成器不会校验产品令牌、路径模式、百分号编码、记录长度、文件大小、UTF-8、Sitemap URL、主机范围、重复规则、组优先级或爬虫专用扩展,也不能构建多个代理组;默认值面向 DataHub。robots.txt 只是抓取提示,不是身份认证或可靠的 noindex 机制,部署前必须检查公开根目录地址、目标爬虫行为及敏感路径。
- RFC 9309:机器人排除协议 - RFC Editor
- Google:如何编写并提交 robots.txt 文件 - Google Crawling Infrastructure
来源核验日期:2026 年 7 月 27 日。标准、依赖和平台规则可能更新,正式集成或合规判断前请再次查看原始来源。
需要注意什么?
- robots.txt 的浏览器支持情况会影响预览和导出结果。
- 如果输入格式不合法,工具会尽量给出错误提示,但不会自动猜测缺失字段。
- 结果生成后请先预览,再用于正式发布或提交。
FAQ
它能强制阻止所有爬虫吗?
不能。robots.txt 是爬虫指令,不是访问控制。敏感页面需要服务端保护。
Robots.txt 生成 是免费的吗?
是的,目前可以直接在浏览器中免费使用,不需要注册账号。
Robots.txt 生成 支持批量处理吗?
文本类工具通常一次处理一段输入,建议分批粘贴处理。
文件或内容会上传吗?
Robots.txt 生成 在浏览器本地运行,输入内容或文件不会上传到 DataHub 服务器。
Robots.txt 生成 适合移动端使用吗?
可以在手机浏览器打开使用,但大文件处理更建议在桌面浏览器完成。
转换失败通常是什么原因?
常见原因包括输入格式不合法、缺少必要字段或复制时混入了不可见字符。
结果可以直接商用吗?
工具只处理你提供的内容或文件,版权和使用权限仍取决于原始素材或数据来源。