上线前核对抓取与索引配置,核心是做三件事:确认搜索引擎能抓到页面、确认你希望收录的页面没有被误挡、确认不希望收录的页面确实被挡住。判断标准不是“配置看起来对”,而是用抓取工具和索引状态实际验证一遍。适合第一次接触这个问题的读者:按下面的顺序从起点走到验收。
抓取指搜索引擎的爬虫能否请求到你的页面并拿到内容;索引指抓到的内容是否被判断为值得存入索引、可以出现在搜索结果中。两道关卡的拦截方式不同:
一个页面可能抓取成功但被 noindex 排除在索引之外,也可能 robots.txt 放行但服务器持续返回 503 导致抓取失败。所以核对时必须分开检查,不能只看一项就下结论。
按下面清单逐条过一遍,每一项都对应一个可观察的结果:
/robots.txt,确认没有误写 Disallow: /,确认测试环境遗留的屏蔽规则已经删除。检查 Sitemap 地址是否指向正式域名。<meta name="robots">,确认正式页面没有 noindex 或 nofollow。注意区分“页面级 noindex”和“整站模板里带 noindex”这两种情况。其中 robots.txt 和 meta robots 是最容易在测试阶段被写死、上线时忘记清理的两处。建议把“删除测试屏蔽规则”作为上线流程里的固定步骤。
配置检查完不等于实际可抓。用搜索引擎官方提供的抓取测试工具(不同搜索引擎各有对应工具)对首页和几个代表性内页发起实时抓取,观察三点:
如果工具显示“已阻止”,先回到 robots.txt 和 meta robots 排查;如果显示抓取成功但内容为空,问题多半在渲染或服务端返回上。这一步的价值在于把“配置推测”变成“实际请求结果”。
可以接受的验收信号包括:代表性页面能被抓取工具成功请求并返回完整内容;robots.txt 和 meta robots 没有误挡;canonical 指向正确;Sitemap 中的 URL 全部可访问。提交 Sitemap 后,索引状态需要时间才会反映,不要用“提交当天没收录”判断配置失败。
常见误判有两种:一是把“已提交 Sitemap”当成“一定会被索引”,提交只是通知,是否收录由搜索引擎判断;二是看到某个页面没出现在搜索结果里,就直接改 robots.txt,实际原因可能是 noindex 或 canonical 指向了别处。排查时先定位是哪一道关卡的问题,再改对应配置。
下一步:选首页加两个内页,用抓取测试工具跑一遍,把返回状态码、抓取内容和 robots 判定结果记录下来,作为上线前的核对凭据。