判断采集是否遗漏,不能只看总访问量高低,而要用一条可核对的证据链:把页面、事件、来源、时间等维度分别与独立来源交叉比对,找出“有用户行为但无记录”或“记录明显偏少”的缺口。只要某个维度在两种口径下差异持续存在,并且排除了过滤规则、时区、脚本加载失败等原因,就可以初步判定采集存在遗漏。
采集核对的目标不是证明“数据好看”,而是确认每条应被记录的行为是否真的进入统计系统。为此需要准备四类资料:
缺少其中任何一项,遗漏判断都会变成猜测。例如只有总访问量,就无法区分“少记了页面浏览”还是“少记了某个来源”。
第一步,按小时对比站内统计与服务器日志的请求量。如果服务器日志显示某小时有持续请求,而统计系统该小时记录为零或断崖式下降,优先检查统计脚本是否在该时段加载失败、是否被浏览器拦截、是否被过滤规则误杀。
第二步,按页面路径对比。选取几个有明确入口的页面,比如首页、栏目页和一篇内容页,分别查看两种口径下的访问次数。若首页接近而内容页明显偏低,可能原因包括:内容页模板未正确嵌入统计代码、页面被缓存后脚本未执行、或统计工具的页面分组规则把部分地址归并到了其他路径。
第三步,按事件核对。对表单提交、下载、外链点击等关键动作,先手动触发一次,确认统计系统是否实时出现对应事件。如果没有出现,检查事件绑定是否依赖某个未加载的脚本,或触发条件是否被写成只有特定来源才记录。
发现差异后,不要直接断定是采集遗漏。差异可能来自口径不同,也可能来自真实遗漏。判断时按以下顺序排除:
只有以上因素都被排除,且差异仍集中在特定页面、特定事件或特定时段,才能把“采集遗漏”作为已定位的原因记录在案。
要让判断可执行,需要明确谁在什么时候交付什么。可以按下面的任务清单推进:
验收标准可以设为:关键页面的两种口径差异在可解释范围内,且每个差异都能对应到一条已确认的原因或一条待验证的假设。若差异无法解释,则不能通过验收。
下一步,先选一个访问量稳定、埋点清晰的页面做一次完整比对,把差异按小时和来源拆开。如果差异集中在某个来源或某个时段,再针对该来源检查脚本加载和过滤规则,而不是直接修改统计代码。