搜索引擎爬虫来到你的网站时,第一件事往往就是读取根目录下的 robots.txt 文件。这个不起眼的纯文本文件,相当于网站的“门禁系统”,告诉爬虫哪些路径能够进入,哪些区域需要绕开。如果设置得当,它能保护重要数据不被收录,同时让搜索引擎把抓取精力集中在你最在意的核心内容上,进而优化整站索引效果。
robots.txt 必须放置在站点根目录,比如 https://yourdomain.com/robots.txt,任何人都可以直接访问查看。它遵循“从前往后依次匹配”的规则,某条规则一旦命中生效,后面的规则就不会再被考虑。理解这一点,才能避免规则相互冲突的尴尬局面。
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Sitemap: https://yourdomain.com/sitemap.xml
别踩坑:robots.txt 不是安全工具,别指望靠它守住机密信息。任何人都能打开这个文件看到里面的路径规则,真要保护数据得靠登录验证或服务器层面的权限控制。另外,除非你打算彻底告别搜索引擎,否则千万别写 Disallow: /,这会让爬虫对整个站点一概不理,收录量会瞬间归零。
配合 Disallow 与 Allow,你可以灵活地对站内目录做筛选。核心思路很简单:把有搜索价值的好页面留给爬虫,把低质或重复的内容挡在外面。
检查标准:时不时翻翻服务器日志,或者查看搜索引擎站长后台的抓取报告。如果发现某些页面被频繁抓取却始终没有带来任何流量或排名,它们就该进入你的 Disallow 黑名单了。
搜索引擎给每个站点的每日抓取次数是有限的,尤其对新站或权重不高的网站更是如此。robots.txt 在分配这笔预算时非常关键,它决定了爬虫是去盯紧你的新品详情页,还是在无意义的归档页里打转。
避坑建议:别把动态参数一律封死。有些参数(如商品ID、翻页页码)反而是爬虫需要的,错误的规则可能让整类页面都无法被抓取。改动规则后务必用搜索引擎提供的 robots 测试工具校验一遍。
某些细节虽然不起眼,影响却很大。比如文件编码必须用 UTF-8,注释行以 # 开头,路径大小写敏感等问题,稍不留神就会让规则失效。
不能。robots.txt 只是“礼貌请求”爬虫不要访问,并不具有强制约束力。有些恶意爬虫根本无视规则,更重要的是,如果页面被其他网站外链指向,搜索引擎仍可能在没有访问正文的情况下仅凭链接信息收录 URL。真正不想被收录的页面,应结合 noindex 标签或登录限制。
大部分搜索引擎会定期重新抓取这个文件,短则几小时,长则几天。你也可以在站长工具后台手动提交更新的 robots.txt,或请求重新抓取,能显著加快生效速度。更改后建议持续观察一两周,确认爬取行为确实按预期变化。
最简单的方法是使用搜索引擎官方的 robots.txt 测试工具,输入文件内容即可看到每个路径的允许或禁止结果。另外,定期查看抓取异常报告,如果出现大量“已抓取但未索引用”的提示,往往说明规则阻挡了不该挡的页面。
robots.txt 的核心价值不在于“堵”,而在于“疏”。与其把所有路径都封死,不如静下心来分析站内哪些内容值得被搜到,哪些只是噪音。建议你先从查看服务器日志入手,明确真实抓取情况,再逐条添加规则,并用测试工具验证效果。最后提醒一句:优化不是一劳永逸的事,随着站点改版或业务调整,定期复查并更新规则,才能始终保持良好的抓取效率。