判断采集是否遗漏,不能只看总抓取量或索引量,而要从搜索意图出发,检查“用户会搜的表达”是否在采集结果中有对应记录。如果某个意图簇里的典型查询在站内采集库中完全找不到,或者只采到同义表达中的一种,就应标记为疑似遗漏,再用抽样搜索和来源页回溯确认。
采集遗漏通常不是均匀分布的,而是集中在某些意图类型上。判断时先把目标查询按意图分组,例如信息型、导航型、交易型、比较型。然后看每一组里是否有代表查询被采到。若某一组整体缺失,或者只采到宽泛词、没采到具体长尾表达,就更可能是采集规则或入口覆盖不足,而不是偶发失败。
单看一个指标容易误判。第三方估算流量、搜索引擎报告和站内统计口径不同,不能直接相减得出遗漏量。更可靠的做法是建立证据链:先看站内采集日志里有没有该查询,再看搜索结果页是否出现目标页面,最后看该页面是否真的回答了对应意图。三项中缺一项,只能说明“可能遗漏”,三项都缺才更接近“已经定位的遗漏”。
实际诊断中常见三种情况。第一种是入口遗漏,采集规则没有覆盖某个栏目或分页。第二种是解析遗漏,页面已抓取但正文提取失败,查询只留在原始HTML里。第三种是索引遗漏,数据已入库但未被检索或展示。判断方法是先查原始抓取记录,再查解析后的结构化字段,最后查检索层。若原始记录有、结构化字段没有,问题在解析;若结构化字段有、检索层没有,问题在索引或过滤条件。
假设你负责一个内容站,怀疑“搜索意图分析”相关长尾查询采集不全。可以按以下步骤执行:
判断结果时注意:命中率低且集中在某一意图类型,优先修采集入口;命中率不低但内容答非所问,优先修内容映射;原始记录有而检索不到,优先查索引和过滤条件。
补入口通常成本较低,但可能带来大量无关页面;补解析规则成本中等,适合页面结构稳定、字段明确的站点;补索引或检索配置成本较高,但能解决已入库数据无法被利用的问题。若遗漏集中在少数高价值意图,先做人工抽样补录和规则微调,比全面重采更划算。若遗漏分散且来源页本身缺失,则需要先扩展采集入口,再谈解析优化。
下一步,选一个你怀疑遗漏最严重的意图簇,按上面的抽样搜索和来源页回溯做一次小范围核对,把未命中项分成入口问题、解析问题和索引问题三类,再决定先修哪一层。