上线前核对抓取与索引配置,核心不是确认首页能不能打开,而是确认搜索引擎能抓到、愿意抓、抓到的版本正确,并且明确哪些页面该被索引、哪些不该。多人协作时最常见的误解是:本地预览正常、服务器返回200,就认为搜索引擎一定能收录。实际上,抓取和索引是两套独立判断,能打开只说明访问正常,不代表抓取顺畅,更不代表会进入索引。
搜索引擎先抓取,再判断是否索引,中间会经过多个环节。任一环节出问题,页面都可能停留在“已发现但未索引”或“已抓取但未收录”。常见原因包括:
robots.txt屏蔽,或带有noindex指令。这些问题在浏览器里往往看不出来,因为浏览器不读robots.txt,也不执行noindex。所以核对必须用抓取视角,而不是用人工浏览视角。
抓取配置决定搜索引擎能不能顺利拿到页面。建议按下面顺序检查,每项都记录负责人和核对结果:
robots.txt,确认没有Disallow: /之类的全站屏蔽,也没有把正式栏目路径写进禁止列表。测试环境的屏蔽规则不要带到正式环境。这些检查项适用于大多数企业站和内容站。如果站点规模很小、页面数量有限,可以适当简化站点地图检查,但robots.txt、状态码和noindex三项不能省。
索引配置决定页面进入索引后以哪个网址为准。这里最容易出错的是把“希望被收录”当成“已经配置正确”。实际需要核对的是页面里的指令:
<meta name="robots" content="noindex">。这个标签常从测试模板或旧版页面残留下来,是上线后不收录的高频原因。<link rel="canonical">指向的是正式网址,而不是测试域名、带参数的网址或另一个相似页面。判断结果时要注意:noindex和robots.txt屏蔽是两回事。被robots.txt屏蔽的页面,搜索引擎无法读取页面里的noindex,所以想彻底不收录,应优先用noindex,而不是只靠屏蔽抓取。
抓取与索引配置出问题,多数不是技术难,而是交接不清。建议在交付前做三件事:
robots.txt、状态码、noindex、规范链接、站点地图、内部链接列为固定检查项,每项标注核对人和核对时间。假设一个场景:某页面在浏览器打开正常,但上线两周后仍未出现在搜索结果中。这时先查服务器日志,如果搜索引擎抓取记录显示403,问题在访问控制;如果显示200但页面带noindex,问题在索引指令;如果两者都正常,再检查是否有内部链接和站点地图入口。按这个顺序排查,比反复修改内容更有效。
下一步可以直接做一件事:打开正式环境的robots.txt,逐行确认没有屏蔽正式栏目,然后抽查三个代表性页面的状态码和noindex标签,把结果填进上线核对表。