Baiduspider访问了你的页面,不等于这个页面已经被百度收录。抓取是蜘蛛把页面内容取回并存入待处理队列,索引是百度经过质量判断后决定把该页面纳入搜索结果。判断依据是看百度搜索资源平台里的抓取频次、抓取异常数据和索引量,而不是只看服务器日志里有没有Baiduspider的访问记录。
服务器日志中出现Baiduspider的User-Agent,只能证明蜘蛛来过。要确认抓取是否成功,需要看这次请求返回的状态码:
200:抓取成功,内容已取回,是否索引是下一步的事。301/302:蜘蛛被跳转,最终内容取决于跳转目标是否可抓取。403/404/503:抓取失败或内容不可用,谈不上索引。同时要区分蜘蛛类型。百度有负责抓取的Baiduspider,也有负责校验的Baiduspider-render等变体,日志里出现的具体标识要逐条核对,不要用一条记录推断全部。
抓取成功但未被索引,常见原因有几类,需要逐项排查而不是直接下结论:
判断方法:在百度搜索资源平台的索引量工具中查看该目录或该页面的收录数据变化,结合抓取频次曲线判断是抓取不足还是抓取后未入库。
按影响面排序,优先处理以下三类:
站点地图提交只能帮助蜘蛛发现URL,不保证收录。HTTPS部署也不保证排名或安全无漏洞,它只是传输层加密,与索引结果没有直接因果关系。
每次调整后,观察周期建议以周为单位,复查以下项目:
如果复查后索引仍无变化,需要区分是抓取环节还是索引环节的问题,再决定下一步动作。不同搜索引擎的抓取和索引机制独立,百度端的结论不能直接套用到其他搜索引擎,需要分别核查。
下一步:打开百度搜索资源平台,导出最近一周的抓取异常数据和索引量数据,对照本文的排查顺序逐项核对,先处理返回5xx的URL。