先给结论:当访客被分到不同版本、而各版本的人群来源或进入时机本身不同,任何基于整体流量的排名对比都可能被样本污染。识别方法不是看总量差异,而是把“版本分配”当作一个可核对的分组变量,检查分组前后的来源、时间、路径是否可比。若不可比,保留整体结论就是错误决定;此时应改写为分层对比,或退出这次对比。
样本污染有两种常见来源,处理方式完全不同。第一种是分配污染:进入A版本的访客多数来自某个渠道或某个时段,进入B版本的访客来自另一批人。第二种是口径污染:同一批访客,但搜索引擎报告、第三方估算流量和站内统计对“一次访问”的切分不同,导致看起来像两批人。
区分证据可以这样找:把每个版本的访客按来源、落地时间、首次进入页面分组,看分布是否接近。如果来源分布明显偏向一侧,是分配问题;如果来源分布接近、但各工具给出的访问数差异稳定存在,是口径问题。前者的动作是修正分流规则或放弃对比,后者的动作是统一统计口径后再看。
保留整体对比,只在一种条件下成立:分流机制对访客是随机的,且两个版本在同一时间窗内运行,来源结构没有系统性差异。满足这个条件时,整体流量排名差异才有解释价值。
改写为分层对比,适用于分配不完全随机、但你能拿到来源和时间字段的情况。做法是按来源渠道或时段分别计算各版本的表现,再判断差异是否在每一层里方向一致。若只在某一层出现差异,说明结论依赖该层人群,不能推广到整体。
退出这次对比,适用于无法还原分配过程、也无法拆分来源的情况。此时继续解读整体排名,只会把人群差异误读成版本效果。退出的具体动作是停止用这次数据下结论,改为重新设计分流并记录分组标识,再决定是否重跑。
假设某站把新访客默认送入B版本,回访访客默认留在A版本,然后比较两版本的访问量排名。这个例子里,两版本的人群构成从分配那一刻就不同:新访客和回访访客的进入意图、停留习惯本来就不一样。若直接比较总量,差异更可能反映“新老访客比例”,而不是版本本身。
可核对的证据链是:先导出每个访客的分组标识、来源、首次进入时间;再按新老访客分层,看各层内两版本的差异是否仍然存在。如果分层后差异消失,说明整体差异由人群构成解释;如果分层后差异仍在,才需要进一步排查版本内容或加载表现。这个判断不依赖任何单一指标,也不需要推算收益。
当多个角色对同一事实有不同理解时,不要争论“哪个版本更好”,而是把分歧拆成可以核对的项目:分组依据是什么、来源分布是否接近、时间窗是否重叠、统计口径是否一致。每一项都对应一个可执行动作。
这些动作的共同点是:先确认分组是否可比,再决定保留、改写还是退出。顺序反了,就会把样本污染当成版本效果。
识别出污染并不等于这次数据完全没用。它可以用来修正分流设计:给每个访客记录稳定的分组标识,确保分配发生在进入之前,并让来源与时间在两组间尽量接近。完成这些修正后,再重新收集数据,整体对比才具备可比前提。若修正成本高于这次要回答的问题,退出对比、改用分层观察是更稳妥的选择。