上线前核对抓取与索引配置,核心是确认两件事:搜索引擎能顺利抓到该抓的页面,并且只把该收录的页面放进索引。最稳妥的做法是先在测试环境检查 robots.txt、meta robots、canonical、sitemap 和状态码,再模拟真实抓取路径逐项验证,而不是上线后等收录结果。
抓取指搜索引擎爬虫能否请求到页面并读取内容;索引指页面被抓取后是否被判断为值得收录。两者会分别被不同配置影响:
一个页面可能抓取正常但被 noindex 挡在索引外,也可能允许索引却因服务器频繁超时抓不到。核对时要分开判断,不要只看一项。
按下面顺序检查,每项都给出可执行的判断方法:
/robots.txt,确认没有误写 Disallow: / 封住整站。若只想屏蔽后台,应写具体路径,如 Disallow: /admin/。注意 robots.txt 只约束抓取,不阻止页面被索引。<meta name="robots" content="...">。若测试环境模板带了 noindex,上线前必须确认正式环境已移除。判断结果:出现 noindex 的页面不会进入索引。<link rel="canonical"> 是否指向本页正式地址。如果全站 canonical 都指向首页,等于告诉搜索引擎其他页面都是副本,可能导致大量页面不被收录。/sitemap.xml,确认只列出希望收录的正式 URL,且不含测试域名、404 页面或已删除页面。很多抓取与索引问题来自环境差异。上线前把测试域名和正式域名并排检查,重点看三类差异:
noindex 或整站登录保护,正式环境应去掉。如果无法直接对比,可以抓取几个代表性页面的源码,搜索 noindex、canonical 和测试域名关键词。适用条件:页面数量不多时人工抽查即可;页面规模大时,应导出全站 URL 后批量检查这些字段,而不是只凭首页判断。
配置写对不等于抓取路径通畅。上线前至少做一次模拟:
curl -I 检查目标 URL 返回的状态码和响应头,确认没有意外跳转或 5xx。判断结果:状态码 200、无 noindex、canonical 自指、sitemap 包含该 URL,四项同时满足,才算是抓取与索引配置基本就绪。缺任何一项,都应先修复再上线。
上线不是终点。发布后先检查服务器日志中是否有爬虫请求,再观察目标页面是否逐渐出现在搜索结果中。若长时间未收录,按以下顺序排查:先看 robots.txt 是否误封,再看页面是否返回 200,再看 meta robots 和 canonical,最后看内容是否与已有页面重复。不要在没有定位原因前反复改动配置,否则会掩盖真正的问题。
下一步:挑三个最重要的页面,按上面的清单逐项核对,把不通过的项记录成待修复列表,修复后再统一提交 sitemap。