判断已覆盖范围,不能只看扫描进度条停在哪里,而要先确认中断发生在“发现链接”还是“抓取页面”阶段,再用已落库的页面记录与站点自身的可达链接集合做交叉核对。对多数网站推广助手类工具而言,中断后真正可靠的不是界面上的百分比,而是导出记录里那些带状态和时间戳的条目。
全站扫描通常分两步:先顺着站内链接发现URL,再逐个抓取并解析页面。这两步的进度是分开的,进度条停住时可能只是发现阶段结束、抓取阶段尚未开始,也可能是抓取到一半被强行终止。
你可以打开工具的数据导出或结果列表,观察每条记录的字段。如果大量记录只有URL、没有标题和状态码,说明发现层已覆盖、抓取层未完成;如果记录里状态码、标题、抓取时间齐全,说明这些页面已经真正处理过。这一步决定后续是补抓还是重新发现,方向错了会浪费一整轮扫描。
单一信号都不可靠,建议同时看三组证据,任何一组明显偏少都说明覆盖不完整:
如果导出记录数明显小于站点地图里的URL数,且最后一批记录时间戳中断得很整齐,基本可以判定抓取层只覆盖了一部分。反过来,如果两者数量接近,只是时间戳有跳跃,可能只是抓取速度波动,覆盖范围未必缺失。
记录数与预期不一致时,先别急着重新扫描,先分清是覆盖缺失还是正常现象:
假设某站点地图列出约两千个URL,导出记录只有约八百条且时间戳集中在中断前十分钟,同时这些记录的状态码和标题完整。这种组合更支持“抓取阶段被截断”,而不是“去重导致数量偏少”,因为去重通常不会让时间戳如此集中地停止。这个判断只是基于假设数据的推理方法,实际结论仍需用你自己的导出记录验证。
归因清楚后,处理方式只有两种,选择依据是发现层是否完整:
执行补抓后,重新导出记录并与站点地图再做一次数量比对。如果差距明显缩小,说明判断成立;如果差距依旧,就要回到范围设置和排除规则上检查,而不是继续重复补抓。这个动作的价值在于:它把“扫描没跑完”这个模糊感受,转换成“哪些URL缺、为什么缺”的具体清单,后续每一步都基于这份清单推进。
不同网站推广助手在中断恢复、增量抓取和导出字段上的支持程度不同,具体是否有断点续扫、能否按状态筛选导出,需要以你正在使用的工具当前说明为准。判断覆盖范围时,优先依赖可导出的原始记录,而不是界面上的汇总数字,因为汇总数字往往经过去重和过滤,无法反映中断瞬间的真实进度。
如果导出记录本身字段有限,无法区分“未发现”和“已发现未抓取”,可以先用站点地图与导出URL做集合差,再人工抽查若干差异URL是否真实存在。这一步能把工具能力的不足,转化为可人工验证的清单,避免在无法确认覆盖范围的情况下反复重扫。