扫描被中断后,最稳妥的判断不是看进度条停在哪个百分比,而是把“已完成的页面清单”和“本次扫描的入口队列”分开核对:只有同时出现在已抓取记录和队列完成标记里的地址,才算真正覆盖。如果工具只留下一个断点或模糊进度,你应当把这次结果降级为样本,而不是直接当成全站结论。
旺格子软件这类工具通常把一次扫描拆成发现链接、抓取页面、解析内容、写入结果几个阶段。中断位置不同,已覆盖范围的判断方式也不同。
实际动作:打开扫描日志,找到最后一条成功写入的记录,再对照队列里处于“待处理”和“处理中”的地址数量。如果待处理数量远大于零,这次结果就只能覆盖已写入的那部分;下一步应决定是补扫剩余队列,还是重新发起一次完整扫描。
判断覆盖范围时,最实用的依据是两个清单的交集,而不是单一计数。入口清单来自你提交的起始地址、站点地图或站内链接发现;已抓清单来自工具实际完成处理的地址。
假设一次扫描计划覆盖 1200 个地址,中断时已抓清单有 480 条,入口队列里仍有 700 多条未处理,其中一部分可能是重复参数或已失效地址。此时不能简单说“覆盖了 40%”,因为未处理队列里未必都是有效页面。更合理的做法是先对未处理地址做去重和有效性抽样,再估算剩余工作量。
适用条件:只有当入口清单本身接近完整时,交叉核对才有意义。如果入口清单来自不完整的站内链接发现,那么已覆盖范围再高,也只能说明覆盖了“被发现的部分”,不能代表全站。
中断之后,你通常要在三种处理方式里选一种,而不是默认重跑。
这三种选择没有绝对优劣。关键看你能不能回答一个问题:未覆盖部分里,是否可能包含会改变结论的页面?如果会,就不能保留;如果不会,保留并标注边界通常够用。
在决定保留之前,可以做一个低成本验证:从待处理队列里随机抽 20 到 30 个地址,手动或单独抓取,检查它们的内容类型、状态码和链接深度是否与已覆盖部分明显不同。
假设抽样发现待处理地址里有大量分页列表和筛选参数页,而已覆盖部分主要是文章详情页。这说明中断造成的缺口集中在列表层,可能影响链接发现完整性。此时更稳妥的动作是退出当前结果,重新规划入口,而不是直接补扫。反过来,如果抽样地址只是重复参数或已失效页面,那么保留现有结果并标注覆盖范围,通常是更实际的选择。
注意:抽样只能说明边界是否存在明显偏差,不能证明全站已经覆盖完整。请求量或抓取量归零,也不能单独证明扫描已经处理完毕,还可能是队列阻塞、权限限制或写入失败造成的。
无论最终选择保留、改写还是退出,都应当留下一条可复查的记录,至少包括:本次扫描的起始地址、中断时间点、已抓地址数量、待处理地址数量、抽样验证结果,以及你选择该处理方式的理由。
这样做的实际作用是:下一次扫描或补扫时,你能判断新旧结果能不能合并,而不是凭印象认为“上次已经扫过了”。如果工具本身不提供完整日志,就手动导出已抓清单和队列快照;如果连快照都无法导出,那么这次中断结果更适合作为临时参考,而不是长期依据。最终判断标准始终是:已覆盖范围能否被清楚界定,以及未覆盖部分是否足以推翻你准备给出的结论。