robots.txt 是部署在网站根目录下的一份纯文本说明,它的职责是向搜索引擎爬虫清晰传达站点的抓取边界。一份配置得当的 robots.txt,既能够避免无效资源被重复抓取,又能保障后台数据或敏感文件不被搜索引擎索引,从而让网站的收录质量得到整体提升。
这份文件的原理并不复杂,通常由若干条指令组合而成。理解每条指令的确切含义,是正确编写的前提。
书写时需格外留意:每条规则另起一行,路径必须区分大小写,并且不支持使用空格。一个规范的示例如下:
User-agent: *
Disallow: /checkout/
Allow: /checkout/order-status/
Sitemap: https://www.example.com/sitemap.xml
在日常维护中,不少站长在修改 robots.txt 时会掉入以下陷阱,导致抓取行为不符合预期。
建议在正式上线前,通过搜索引擎官方的抓取测试工具(如 Google Search Console)验证规则是否被正确解析,同时检查是否有重要页面被意外屏蔽。
不同的网站类型,对抓取边界的诉求并不相同。结合实际需求,可以参照以下模板进行调整。
场景一:屏蔽后台与临时目录,保留必要接口
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /cache/
通过 Allow 单独放行 AJAX 接口,既保护了后台,又避免站点功能因爬虫抓取而出现异常。
场景二:拦截指定恶意爬虫
User-agent: SemrushBot
User-agent: AhrefsBot
Disallow: /
将不友好的爬虫名称逐行列出,并配上 Disallow: / 即可将其完全拒之门外。
场景三:临时全站关闭抓取
User-agent: *
Disallow: /
适合站点正在改版或维护时使用,能够防止搜索引擎收录残缺页面。恢复时删除该规则即可。
除了上述基础规则,合理利用扩展指令能进一步提升配置的精细度。
注意,robots.txt 并非安全屏障,它无法阻止他人直接访问文件。真正需要保密的内容,应配合登录验证或服务器权限设置来保护。配置完成后,定期通过日志观察爬虫行为,及时修正不符合预期的部分,是维持站点健康度的重要环节。
搜索引擎以最长的匹配路径为准。举例来说,如果 Disallow: /shop/ 与 Allow: /shop/free/ 同时存在,那么爬虫会放弃抓取 shop 下的其余内容,但会允许抓取 free 子目录。建议配置时保持逻辑简明,避免出现模棱两可的重叠路径。
搜索引擎通常会在下一次抓取时获取新的 robots.txt 文件,这个周期从数小时到数天不等。你可以手动提交更新,也可以在搜索引擎站长平台中请求重新抓取,这样可以显著加快生效速度。
文件必须命名为 robots.txt 并放置在域名根目录下,例如 https://example.com/robots.txt。如果网站有多个子域名,每个子域名都需要独立放置一份,因为爬虫会针对不同子域名分别读取对应文件。
配置 robots.txt 的核心在于明确站点资源的开放与保护边界,而不是一味地屏蔽路径。建议你从最小化规则入手,以"能少写就少写"为原则,每新增一条规则都确保有明确的业务场景支撑。完成修改后,务必借助官方工具测试,并在近期观察日志中的抓取频率变化。如此,才能让搜索引擎真正理解你的站点结构,实现更高效的收录。