在网页维护中,区分抓取、索引和排名,关键是看问题发生在哪一层:抓取是搜索引擎发现并读取页面,索引是把可用的页面存入可供检索的库,排名是用户搜索时从索引中挑选并排序结果。三者是先后关系,不是同一件事;排查时要先确认页面有没有被抓取,再确认有没有被索引,最后才判断排名表现。
网页维护出现流量下降或页面不出现时,不要直接归因于“排名掉了”。先做分层观察:
如果日志里完全没有爬虫记录,问题在抓取;如果有抓取但索引里查不到,问题在索引;如果已索引但目标查询没有它,才进入排名判断。
抓取环节看的是“有没有被读取”。可核对的证据包括服务器访问日志中的爬虫 User-Agent、请求时间、请求 URL 和 HTTP 状态码。若返回 404、500 或 403,爬虫即使来了也拿不到有效内容。
索引环节看的是“有没有被收录”。常见检查项是站内检索该 URL、查看索引状态、确认页面是否被 robots 规则阻止、是否设置了 noindex、是否有规范标签指向了别的地址。索引不等于抓取成功,抓取成功也不等于一定被索引。
排名环节看的是“在某个查询下排在哪里”。排名受查询词、地域、设备、时间等因素影响,同一页面在不同条件下结果可能不同。排名波动不能反推抓取或索引一定出了问题。
假设一个页面在维护后从搜索结果中消失。可以按以下顺序处理:
如果日志显示爬虫返回 200,但索引中查不到,优先处理索引层;如果索引中存在但查询无结果,再考虑排名层的内容相关性和竞争情况。
假设某页面维护后流量下降。日志显示爬虫三天前访问过,状态码 200;站内检索该 URL 仍能查到;但目标查询下页面从第一页消失。此时可以判断抓取和索引大概率正常,问题更可能在排名层,应检查内容是否被改动、标题是否偏离查询意图、是否有新的竞争页面出现。
反过来,如果日志里没有爬虫记录,站内检索也查不到,那么先不要分析排名,应优先检查 robots.txt 是否阻止抓取、页面是否返回错误状态、内链是否被移除。复查时以同一 URL、同一查询、相近时间为准,避免把不同条件的结果混在一起比较。
下一步:选一个具体页面,分别记录它的抓取日志、索引状态和目标查询排名,三项证据分开保存,再决定先修哪一层。