上线前核对抓取与索引配置,核心不是“让搜索引擎立刻收录”,而是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引到的地址是唯一且正确的版本。时间人手有限时,先查 robots.txt、页面 meta 指令和 canonical 三项,再核对 sitemap 与内链,最后用可复现的抓取测试验证。
很多人把 robots.txt 当成收录开关,认为写了 Allow 就会进索引。实际上 robots.txt 只控制抓取,不控制索引。一个页面可以被正常抓取,但如果返回了 noindex,或者被 canonical 指向了别的地址,它仍然不会作为独立结果出现。
反过来也成立:被 robots.txt 屏蔽的页面,通常无法被抓取,也就难以被索引;但如果其他页面大量链接到它,搜索引擎仍可能仅凭外链信息把它列入索引,只是没有正文摘要。所以核对时要分开判断“能不能抓”和“愿不愿意收”。
时间和人手有限时,按影响面排序,先做下面三项,基本能覆盖大多数上线事故。
Disallow: /,也没有把整站或关键目录整体屏蔽。测试环境遗留的屏蔽规则是最常见的上线问题。noindex 或 nofollow。这类指令常写在公共头部模板中,一改就是全站生效。执行方式很直接:在浏览器打开目标页面,查看源代码,搜索 robots 和 canonical;再访问站点根目录下的 /robots.txt,逐行读一遍规则。判断结果是——只要发现整站级屏蔽或全站 noindex,先停下来修,不要继续做其他优化。
抓取配置不只写在 robots 和 meta 里,还取决于页面是否被链接到。一个页面如果没有任何内链指向,只放在 sitemap 中,被发现的速度和概率都会低一些。核对时看两点:
适用条件是:站点规模不大、栏目结构清晰时,靠内链加 sitemap 基本够用;如果页面数量很多,才需要考虑分片 sitemap 和更细的抓取预算管理。判断结果看 sitemap 里是否存在大量 404 或跳转地址,如果有,先清理再提交。
配置改完后,需要一次实际验证。可以用搜索引擎官方提供的抓取测试工具,输入具体网址,查看返回的状态码、抓取到的 HTML 和是否被 robots 规则拦截。假设某页面返回 200 且未被拦截,但 HTML 中带有 noindex,那么结论是“可抓取、不会作为独立结果收录”,需要去掉该指令。
另一个容易忽略的点是重复版本:带 www 与不带 www、http 与 https、带结尾斜杠与不带斜杠,都可能被视为不同地址。上线前应确定一个正式版本,其余版本通过 301 跳转或 canonical 指向它,避免同一内容分散成多个地址。
完成上述核对后,把正式 sitemap 地址提交到所用搜索引擎的站长平台,并在几天后回查“已发现”与“已收录”的数量变化。如果发现某类页面长期停留在已发现但未收录,优先检查该类页面的内容是否过薄、是否被 canonical 指向了别处,而不是反复修改 robots.txt。