最常见的误操作来自把 robots.txt 当成“删除网页”“屏蔽收录”“阻止快照”的万能开关。实际上,robots.txt 主要表达的是抓取许可与限制,不是索引移除工具;它约束的是爬虫是否来抓,而不是保证页面一定不出现在结果里。一旦基于错误理解去写规则,就可能出现该抓的页面被挡住、想删的页面仍然存在、整站被误封等后果。
很多人为了“删掉”一个页面,直接写 Disallow: /page。这只会阻止爬虫抓取该路径,不会可靠地移除已经被索引的页面。更糟的是,如果该页面已被收录,爬虫无法抓取就无法看到 noindex,反而可能让旧标题、旧摘要长期残留。
Disallow。noindex,或对已删除内容返回 404/410。站点地图只是提交 URL 线索,不保证抓取,更不保证收录。把 Sitemap 写进 robots.txt 也只是告诉爬虫去哪里找地图,不等于页面会被索引。若页面本身质量低、重复、被 noindex 标记,或返回错误状态码,提交地图也不会改变结果。
可执行的核查步骤:
Sitemap 行指向的地图可访问,返回 200。noindex、是否被其他规则误挡。HTTPS 只表示传输加密,不能证明网站没有漏洞、没有被挂马、没有恶意跳转。一个启用 HTTPS 的站点仍可能被注入垃圾页面或隐藏链接。排查时不要因为“有证书”就跳过安全检查。
robots.txt 是通用约定,但各搜索引擎对具体指令的支持、对已索引页面的处理节奏并不完全一致。把“某个引擎的行为”直接套到所有引擎上,容易做出错误判断。正确做法是分别核查:在目标搜索引擎中查看该 URL 的实际状态,而不是只凭一份规则文件推断。
把 Disallow: / 当成“先关掉再说”的操作,风险很高。它会让爬虫无法抓取任何页面,包括你希望保留的页面;如果长期存在,可能影响后续恢复抓取。若只是临时维护,应明确恢复时间,并在恢复后及时移除该规则。
从交付结果倒推,写 robots.txt 前至少要准备:要限制的路径清单、要保留抓取的路径清单、目标搜索引擎、页面当前索引状态。验收时逐条检查:被挡的路径是否确实不该抓、该抓的路径是否仍可抓、想移除的页面是否用了正确的移除方式。下一步,先列出你真正想阻止抓取的目录,再与“想从索引移除的页面”分开处理,避免用一条规则同时解决两个不同问题。