先给有条件的结论:如果导出工具在抓取时记录了每个查询词的分页游标或“下一页”状态,那么遗漏分页可以通过比对游标序列来定位;如果工具只输出最终结果、不保留分页过程,那么你只能做抽样反查,无法证明完整性。两种做法的取舍取决于工具是否暴露中间状态,而不是取决于结果看起来是否够多。
把“能自动导出”理解成两种不同能力,检查方式完全不同。
判断动作:取一次小规模导出,翻到最后一列和日志末尾,找是否存在页码或游标字段。如果存在,继续用下面的序列比对;如果不存在,直接跳到抽样反查,不要浪费时间在结果行数上。
行数会骗人。同一页重复写入、某页被跳过、末页只有一条,都会让总数看起来正常或异常。可靠的依据是分页标识是否连续。
假设某工具对每个词输出 page 字段,你看到 1、2、4、5,缺 3。这不能直接断定第 3 页为空,因为还有两种合理解释:该页在抓取时请求失败被跳过,或者工具把两页合并成了一页。要区分它们,去看同一批导出里有没有失败记录或重试记录。有失败记录,说明是抓取中断;没有失败记录且行数明显偏多,才更可能是合并。这个判断会决定下一步是重跑缺失页,还是调整工具的分页识别逻辑。
没有分页痕迹时,抽样反查是唯一可用的动作,但它只能发现遗漏,不能证明完整。
抽样反查的代价是:查得越多越接近可信,但永远给不出完整性结论。如果这批数据要用于对完整性有要求的用途,就不要停留在黑盒方案,应换用能输出分页状态的导出方式,或让工具在导出时额外记录请求序列。
假设工具确实输出了连续的 page 字段,序列也完整,但结果仍然遗漏。这可能发生在工具按“相关搜索”模块整体抓取、而该模块在不同分页位置动态替换内容的情况下:页码连续不代表每次请求返回的是同一批候选。此时游标比对通过,完整性依然不成立。识别信号是同一查询词在不同页出现重复条目、且总条目数明显少于逐页累加值。遇到这种情况,检查方式要从序列比对改为按条目去重后比对,并确认工具是否在每次翻页时重置了结果集。
先确认工具是否暴露分页标识,再决定用序列比对还是抽样反查。做完一次检查后,把发现的缺失位置和对应的失败记录或重复模式记下来,作为下次导出的对照基准。如果连续两次导出在同一位置出现同样的缺失模式,问题更可能出在工具的分页逻辑而非单次网络波动,此时应优先调整导出配置或更换导出方式,而不是反复重跑同一套流程。