A5SEO诊断中判断采集是否遗漏,核心不是看某一个数字高低,而是把“站内实际存在”“搜索引擎已发现”“已抓取并进入索引”三条证据链对齐。只要其中一环对不上,就可能是采集遗漏,也可能只是口径差异。下面用一个假设例子说明判断步骤与常见错误。
假设某项目上线了 200 个商品详情页,站内统计显示这些页面都能正常打开。运营在搜索引擎里用 site: 查询,只看到约 120 条结果,于是判断“采集遗漏了 80 个页面”。这个结论并不成立,因为 site: 查询结果受查询词、地域、索引更新延迟和展示省略影响,它更像抽样,而不是精确清单。
更可靠的做法是分层核对:
noindex,是否被 robots.txt 屏蔽。如果页面可访问、有内链、也出现在站点地图中,但日志里长期没有抓取记录,这属于“未被发现或未被调度”的可能原因;如果日志里有抓取,但索引中没有,则要检查页面质量、重复内容和索引状态,而不是继续归因于采集遗漏。
三种数据口径不同,直接相减会制造假遗漏。站内统计能证明页面存在和访问情况;搜索引擎报告能反映平台自己承认的抓取与索引状态;第三方估算流量是模型推算,不能用来反推具体哪些 URL 被采集。诊断时应以站内清单为底表,用搜索引擎报告做交叉验证,把第三方数据只当趋势参考。
可以建立一张三列对照表:URL、是否可访问、是否有抓取记录。任何一行只要第二列为“否”,先修可访问性;第二列为“是”但第三列为“否”,再排查发现路径和抓取预算。这样得到的遗漏名单才是可执行的,而不是一份靠查询结果猜出来的清单。
索引数量本身会波动,新页面可能延迟进入,旧页面也可能因改版暂时退出。看到数量下降就断定采集遗漏,容易把正常更新误判为故障。判断时要区分“从未被抓取”和“抓取后未被索引”:前者查日志和入口链接,后者查页面内容与索引状态。两种情况的处理方向不同。
另一个常见错误是只看首页或栏目页,忽略深层页面。深层页面如果缺少内链,即使站点地图里写了 URL,也可能长期不被调度。此时补充可从栏目页到达的链接路径,比反复提交站点地图更直接。
noindex 标记。nofollow。判断结果是:如果 URL 可访问、有内链、日志有抓取但索引没有,问题在索引环节;如果 URL 可访问、有内链、日志始终没有抓取,问题在发现或调度环节;如果 URL 本身不可访问或被屏蔽,问题在采集之前,不应算作采集遗漏。
下一步,先选 10 个疑似遗漏的 URL 做这张三列对照表,确认它们分别卡在哪一环,再决定是修可访问性、补内链,还是处理索引问题。