上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否正常访问页面、页面是否允许被索引、最终收录的地址是否唯一且正确。建议在正式切换域名或开放访问前,用“抓取可达性—索引许可—地址规范”的顺序逐项检查,每项都留下可复核的记录,避免多人协作时口头交接造成返工。
抓取是索引的前提。上线前应检查服务器是否对搜索引擎返回正常状态码,而不是登录页、验证码或错误页。多人协作时,常见问题是测试环境加了访问限制,上线后忘记移除,导致抓取被拦截。
200。robots.txt 是否误写了 Disallow: /,以及是否屏蔽了 CSS、JS 等渲染所需资源。403、503 或跳转到登录页。判断结果:状态码正常、robots 未全站屏蔽、关键资源可访问,才算抓取通道基本畅通。任何一项不通过,都应先修复再继续下一步。
页面能被抓取,不代表允许被索引。上线前要逐类模板检查 meta robots 和 HTTP 响应头中的 X-Robots-Tag,避免测试阶段留下的 noindex 被带到生产环境。
noindex、nofollow,确认是否是有意保留。X-Robots-Tag: noindex,这类设置不会出现在 HTML 里,容易被忽略。适用条件:如果某类页面本就用于内部跳转或参数组合,屏蔽索引是合理选择;但首页、栏目页、核心内容页不应被误屏蔽。判断结果以“是否与既定索引策略一致”为准,而不是一律要求全部可索引。
同一内容若存在多个可访问地址,例如带与不带 www、http 与 https、带与不带结尾斜杠,可能被分别抓取。上线前应确定唯一规范地址,并让其他形式跳转到它。
301 永久跳转到主形式。<link rel="canonical"> 中指向规范地址,且该地址应与实际可访问地址一致。判断结果:任意入口访问同一内容时,最终都应落到同一个规范地址,且 canonical 指向与之一致。若跳转链过长或 canonical 指向错误地址,应在上线前修正。
站点地图能帮助发现应被抓取的地址,但它不保证收录。上线前应生成包含核心页面的站点地图,检查其中地址是否全部为规范地址、是否返回正常状态码,并确认没有混入测试地址或已删除页面。
noindex 屏蔽。适用条件:站点地图适合提交稳定、需要收录的页面;对于已屏蔽或参数过多的页面,不应放入。判断结果是站点地图可正常访问、内容与规范地址一致,且提交动作有记录可查。
为减少返工,建议把核对拆成可签字的检查项,而不是依赖某个人记忆。可以按以下顺序执行:
下一步:把上述检查项做成一张上线前核对表,在正式开放访问前由两人分别复核并签字,发现不一致时先暂停上线,修复后再重新走一遍抓取与索引检查。