批量提交收录后,如果发现收录效果不理想,不能逐条翻查成千上万个 URL,而要按“分层抽样—逐层缩小—单页复现”的顺序定位。假设你提交了 5000 条商品页,几天后索引量只涨了很少一部分,这时应当先抽出一小批有代表性的 URL,判断问题集中在哪一类页面,再决定是全量修复还是单独处理。抽样不是为了证明“提交没用”,而是为了用最少成本找到可复现的失败模式。
纯随机抽样容易抽到大量正常页面,掩盖真正的问题。更有效的做法是先分层,再在每层内抽取少量样本。常见分层维度包括:
每层抽 5 到 20 条即可,重点不是样本量,而是每层都有覆盖。抽完后逐条记录:是否被抓取、抓取返回什么状态、是否被索引、索引的是不是目标 URL。只要某一层集中出现同类现象,问题范围就基本锁定了。
对抽出的每条 URL,按下面顺序检查,前一项通过再进入下一项:
robots.txt 拦截。注意,robots.txt 只能限制抓取,不能可靠地移除已经被索引的页面,所以它既不是收录保证,也不是索引移除手段。noindex、规范化标签是否指向了别的 URL、是否有重复内容导致搜索引擎选择了另一条 URL。抽样时要记录“被索引的是哪一条”,而不是只看“有没有被索引”。检查结果要写成表格或清单,同一现象出现三次以上,才值得当作批量问题处理。
假设某站点批量提交了 5000 条商品页,一段时间后索引增长很少。按分层抽样,每类抽 10 条,得到如下观察:
这个结果指向的不是“提交无效”,而是变体页和分页的规范化处理有问题。下一步应集中检查这两类的规范化标签、参数处理和站内链接,而不是继续加大提交量。如果抽样显示所有层都完全未被抓取,才应优先排查服务器可访问性、robots.txt 和抓取预算。
第一,只抽“看起来重要”的页面,忽略长尾和参数页,导致结论偏乐观。第二,把“已提交”当成“已抓取”,把“已抓取”当成“已索引”,三个状态混在一起判断。第三,只看单条 URL 的当前状态,不看日志和抓取历史,无法区分“从未发现”和“抓取后被过滤”。
判断结果时,要区分“可能原因”和“已经定位的原因”。同一个未收录现象可能有多种解释,只有通过抽样复现并排除其他层之后,才能把某一项当作已定位原因。
抽样结束后,选一个最小可验证的修复项,例如只调整一类页面的规范化标签或站内链接,然后重新提交同一批样本中的少量 URL,观察抓取和索引状态是否变化。不要一次改动多个变量,否则无法判断哪一项起了作用。不同搜索引擎对提交和索引的处理方式不同,需要分别核查各自的抓取与索引状态。