判断采集是否遗漏,不能只看链接分析工具里显示的总数,而要用“独立来源”做交叉验证:从站点地图、站内导航、日志或页面正文中分别提取一组已知链接,再与工具结果比对。若某个已知链接在工具中找不到,或同一目标页的入链来源明显少于实际,就说明采集存在遗漏。遗漏通常发生在动态渲染、分页、登录墙、robots限制或跳转链路上,需要逐项定位,而不是直接判定工具失效。
没有基准,就无法判断工具漏了什么。建议从三个彼此独立的来源各取一批链接:
把这三份清单合并去重,得到一份“应当被采集到”的基准集。基准集不需要覆盖全站,抽取有代表性的栏目页、详情页和深层页即可。判断结果的标准是:工具结果应当是基准集的超集,而不是子集。如果基准集里有链接在工具中完全缺失,遗漏就已经成立。
链接分析工具通常给出两个容易混淆的数字:发现的链接总数,以及指向某个目标页的独立来源数。总数受重复链接、nofollow、同一页面多次出现的影响,参考价值有限。更有诊断意义的是独立来源数。
具体做法:挑一个你确知被多个页面链接的目标页,比如首页或某个重点栏目页。人工数出站内至少有哪几个页面链接到它,再在工具中查看该目标页的来源列表。如果工具显示的来源明显少于你人工确认的数量,说明采集在部分来源页面上中断了。这里要注意口径差异:工具可能把nofollow链接单独归类,也可能不统计JavaScript生成的链接,比对时要先确认筛选条件是否一致。
确认遗漏后,按以下顺序定位,每一项都区分“可能原因”与“已定位原因”:
定位到原因后,针对性处理:渲染问题可改为服务端输出链接或提供预渲染版本;分页问题可检查分页URL是否可独立访问;访问限制问题需确认是否真的需要屏蔽。处理完成后,不要重新随机抽样,而要用最初那份基准集再次比对。复查的判断标准是:原先缺失的链接是否已经出现在工具结果中,且来源数量是否与实际相符。
复查时还要留意时间差。采集和索引需要一定周期,刚修复就立即比对可能仍显示缺失,这不代表修复失败。可以隔一段时间用同一基准集重复核对一次,观察缺失项是否在减少。
当基准集中的链接全部能在工具中找到,且重点目标页的独立来源数与人工核对结果基本一致时,可以认为本轮采集没有明显遗漏。若仍有少量差异,先确认是否属于nofollow归类、跳转归并或统计口径不同造成的正常差异,再决定是否需要继续处理。下一步建议固定这份基准集,在每次站点结构或模板调整后重复比对,把它作为长期可复用的检查项。