旺格子软件一次全站扫描被中断后怎样判断已覆盖范围

📍 WDQWDWQD987AAAAA:216.73.216.153
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /61ff92421c42.html
📄

旺格子软件一次全站扫描被中断后怎样判断已覆盖范围

扫描被中断后,最稳妥的判断不是看进度条停在哪个百分比,而是把“已完成的页面清单”和“本次扫描的入口队列”分开核对:只有同时出现在已抓取记录和队列完成标记里的地址,才算真正覆盖。如果工具只留下一个断点或模糊进度,你应当把这次结果降级为样本,而不是直接当成全站结论。

先区分中断发生在抓取阶段还是写入阶段

旺格子软件这类工具通常把一次扫描拆成发现链接、抓取页面、解析内容、写入结果几个阶段。中断位置不同,已覆盖范围的判断方式也不同。

实际动作:打开扫描日志,找到最后一条成功写入的记录,再对照队列里处于“待处理”和“处理中”的地址数量。如果待处理数量远大于零,这次结果就只能覆盖已写入的那部分;下一步应决定是补扫剩余队列,还是重新发起一次完整扫描。

用入口清单和已抓清单做交叉核对

判断覆盖范围时,最实用的依据是两个清单的交集,而不是单一计数。入口清单来自你提交的起始地址、站点地图或站内链接发现;已抓清单来自工具实际完成处理的地址。

假设一次扫描计划覆盖 1200 个地址,中断时已抓清单有 480 条,入口队列里仍有 700 多条未处理,其中一部分可能是重复参数或已失效地址。此时不能简单说“覆盖了 40%”,因为未处理队列里未必都是有效页面。更合理的做法是先对未处理地址做去重和有效性抽样,再估算剩余工作量。

适用条件:只有当入口清单本身接近完整时,交叉核对才有意义。如果入口清单来自不完整的站内链接发现,那么已覆盖范围再高,也只能说明覆盖了“被发现的部分”,不能代表全站。

保留、改写还是退出:三种取舍的适用前提

中断之后,你通常要在三种处理方式里选一种,而不是默认重跑。

  1. 保留本次结果:适用于已抓页面集中在核心目录、未处理队列主要是低优先级页面,并且你能明确标注覆盖边界。保留后应把结论限定在已覆盖范围内,不对外说成全站结论。
  2. 改写为增量任务:适用于中断前的入口清单和已抓清单都完整,且工具支持按剩余队列继续。此时把未处理地址单独导出,作为下一轮输入,比整站重扫更省时间。
  3. 退出并重扫:适用于入口清单本身不可信、队列状态混乱,或者中断发生在链接发现阶段。此时继续补扫可能建立在错误基础上,重扫反而更可控。

这三种选择没有绝对优劣。关键看你能不能回答一个问题:未覆盖部分里,是否可能包含会改变结论的页面?如果会,就不能保留;如果不会,保留并标注边界通常够用。

用一个小样本验证边界是否成立

在决定保留之前,可以做一个低成本验证:从待处理队列里随机抽 20 到 30 个地址,手动或单独抓取,检查它们的内容类型、状态码和链接深度是否与已覆盖部分明显不同。

假设抽样发现待处理地址里有大量分页列表和筛选参数页,而已覆盖部分主要是文章详情页。这说明中断造成的缺口集中在列表层,可能影响链接发现完整性。此时更稳妥的动作是退出当前结果,重新规划入口,而不是直接补扫。反过来,如果抽样地址只是重复参数或已失效页面,那么保留现有结果并标注覆盖范围,通常是更实际的选择。

注意:抽样只能说明边界是否存在明显偏差,不能证明全站已经覆盖完整。请求量或抓取量归零,也不能单独证明扫描已经处理完毕,还可能是队列阻塞、权限限制或写入失败造成的。

把覆盖范围写成可复查的记录

无论最终选择保留、改写还是退出,都应当留下一条可复查的记录,至少包括:本次扫描的起始地址、中断时间点、已抓地址数量、待处理地址数量、抽样验证结果,以及你选择该处理方式的理由。

这样做的实际作用是:下一次扫描或补扫时,你能判断新旧结果能不能合并,而不是凭印象认为“上次已经扫过了”。如果工具本身不提供完整日志,就手动导出已抓清单和队列快照;如果连快照都无法导出,那么这次中断结果更适合作为临时参考,而不是长期依据。最终判断标准始终是:已覆盖范围能否被清楚界定,以及未覆盖部分是否足以推翻你准备给出的结论。

图1 图2

nginx