抓取、索引和排名是三个先后不同、判定方式也不同的环节。抓取是搜索引擎发现并读取URL;索引是把读取到的内容分析、去重后存入可供检索的库;排名是用户查询时,从已索引内容中选出并排序展示。判断问题时,先看页面有没有被抓取,再看有没有进入索引,最后才看特定查询下的排名。把三者混在一起,容易在页面尚未收录时反复改标题,或在排名波动时误判为抓取故障。
可以用站点日志、搜索平台提供的抓取与索引报告、以及实际搜索查询来分开观察。下面是一组常见的判断线索,例子为假设,用于说明方法。
观察时要注意区分网页搜索、平台推荐和付费广告。付费广告展示不代表自然排名,平台推荐流量的变化也不能直接用来判断搜索排名。
最直接的检查方法,是从页面中找一句独一无二的短语,例如完整标题或首段中不常见的一串词,把它放进搜索框做精确查询。判断结果如下:
这个测试只适用于能公开访问、无需登录的页面。如果页面本身要求登录或对爬虫屏蔽,独特短语查不到并不等于索引失败,应先确认访问规则是否符合预期。
确认环节后,处理方向完全不同,不要用同一套动作覆盖三个问题。
robots.txt是否误屏蔽,检查页面是否返回200状态码,检查重要页面是否有可跟随的内链入口。适用条件是日志显示爬虫未访问或访问异常;复查方式是观察后续日志中是否出现正常抓取记录。<meta name="robots" content="noindex">,检查内容是否与站内其他页面高度重复,检查是否有足够的独立价值。适用条件是已抓取但未索引;复查方式是再次做独特短语测试,看页面是否进入结果。如果页面同时存在多个问题,按抓取、索引、排名的顺序处理。前一环节未通过时,后一环节的优化动作往往看不到效果。
复查要固定观察对象和判断口径,避免今天看日志、明天只看搜索结果。可以按下面清单逐项确认:
复查周期取决于站点更新频率和抓取预算,不宜用固定天数承诺结果。若抓取和索引均已通过,但排名长期没有变化,应把重点转向内容与查询意图的匹配,而不是继续修改抓取设置。
下一步:选一个已发布页面,先做独特短语测试,再对照服务器日志确认爬虫是否正常访问。把结果分别记入“抓取”“索引”“排名”三栏,只对未通过的那一栏采取动作。