先给结论:如果你手上的数据里只有“咨询次数”,没有可跨会话关联的稳定标识,那么你只能统计次数,不能可靠还原人数。要区分人数与次数,前提是你能把同一用户的多次咨询归并到一个主体上;做不到这一点时,把次数当人数用会系统性高估触达规模,而按人数去解释次数又会低估咨询强度。
区分人数与次数的第一步不是选算法,而是确认数据源。常见的可归并依据有三类:登录账号、稳定的设备或浏览器标识、以及咨询记录中用户主动留下的联系方式。三者的可靠性依次下降。
如果这三类标识一个都没有,那么“区分人数与次数”这个目标在当前数据下不成立。此时更实际的动作是先在咨询入口增加一个可持久化的标识,再谈统计口径。这一步的结果决定后续所有分析是否可信:标识缺失时,任何人数结论都只是猜测。
条件一:能拿到稳定标识。此时应做去重统计,把同一主体在一段时间内的多次咨询计为一人、多次。人数用于衡量触达广度,次数用于衡量咨询强度,两者分开呈现。判断依据是同一标识在时间窗口内是否重复出现。
条件二:只有不可靠标识或完全没有标识。此时不要输出“咨询人数”这个指标,改为报告“咨询次数”并明确标注口径。如果业务上必须估算人数,可以用联系方式去重后得到一个下限值,并说明这是下限而非准确人数,因为未留联系方式的咨询者无法被归并。
选择依据可以归纳为一句话:标识越稳定、覆盖越全,人数与次数的区分越接近真实;标识越弱,越应该只报次数。把弱标识下的去重结果直接称为人数,是这类分析里最常见的错误。
假设某入口一周内记录到 40 次咨询,其中 25 次来自已登录账号,这 25 次分属 9 个账号;另外 15 次没有登录标识,其中 6 次留下了同一个手机号,其余 9 次无任何可归并信息。
在“能拿到稳定标识”的口径下,可确认的人数是 9 个账号加 1 个手机号主体,共 10 人,对应 31 次咨询;剩余 9 次无标识记录只能计入次数,不能计入人数。此时应报告“可归并人数 10 人、咨询次数 40 次”,并说明其中 9 次无法归并。这个结果会直接影响下一步:如果无标识记录占比很高,说明当前口径下的人数结论不稳定,优先动作应是补齐标识采集,而不是继续深挖人数趋势。
当次数明显高于人数时,不要立刻归因为“用户变活跃了”。还有几种合理解释需要逐一排除:
区分这三种情况需要可核对的证据:查看同一标识在短时间内的记录间隔,间隔极短且内容重复的更像重复提交;间隔分散、内容递进的更像真实高频咨询;标识频繁变化且集中在特定设备或浏览器上,更像标识失效。某项计数归零或骤降本身不能单独证明处理正确,它也可能来自采集中断、入口调整或统计口径变更,需要结合入口变更记录一起判断。
一个可执行的动作是:先按标识去重生成人数,再按原始记录生成次数,两个指标并列输出,并附上无法归并的记录占比。这个占比是判断结论可信度的关键——占比低时人数结论较稳,占比高时应退回只报次数。动作的结果会决定下一步:占比可接受就继续做人数趋势,占比过高就先补标识采集。
例外情况也要说明:当咨询本身是匿名且业务不要求识别个体时,强行归并可能带来隐私与合规风险,此时应保留次数口径,不做人数推算。另外,跨较长周期做人数统计时,同一用户在不同周期的重复出现是否算作同一人,取决于你要回答的问题——衡量触达广度时按周期分别计数,衡量用户留存时才跨周期归并。口径不同,人数结果不同,报告时必须写清所用口径。