第 8 章 · 数据证据

11560 字
58 分钟
第 8 章 · 数据证据

第 8 章 · 数据证据——让产品判断可以被验证#

引言#

前面讲完问题定义和体验设计之后,身为产品经理的我们会自然走到一个更现实的环节:怎么让判断经得起验证。在很多组织里,数据是一种很有力量的语言。评审会上,只要有人说“这个方向有数据支持”,讨论就会安静不少;复盘会上,只要某个核心指标涨了,团队就很容易把它理解成方案有效;向上汇报时,一页漂亮的数据图,比十页逻辑推导更容易让人放心。这当然不是啥坏事,产品经理如果完全不看数据,只靠经验和直觉做判断,很快就会变成自说自话,数据至少能把团队从“我觉得”里拉出来,让讨论回到事实。但这里有一件需要特别警惕的事情:**数据能减少拍脑袋,却不能替产品经理做出判断。**数据本身只记录了某些被采集过的事实,它不自动告诉你这些事实应该如何解释,也不会主动提醒你还有哪些事实没有被采集。一个指标涨了,只能说明这个指标涨了,不等于问题被解决了;一个漏斗没有明显波动,只能说明你埋下去的那些事件没有明显波动,不等于用户真的没有卡住;一个实验组表现更好,也只能说明在当前样本、周期和口径下它更好,不等于这个方案长期一定正确。所以我现在不太愿意把“数据驱动”理解成“让数据做判断”,我更愿意把它理解为“为产品判断寻找数据依据”。你提出一个方向时,不能只问有没有一个数据支持它,还要问这个判断到底需要被什么证明;你推进一个方案时,不能只盯主指标,还要知道哪些数据会解释它、哪些数据会保护它、哪些数据会推翻它;你上线一个功能时,不能只等结果出来再挑数字,而要提前约定我们看什么、怎么采集、看到什么说明要继续、看到什么说明要停下来。

数据不是为了让产品经理显得更确定,而是为了让判断更诚实。一个判断如果只能被支持,不能被反驳,它就不是真正的数据判断,更像是给既定结论找证据。真正有价值的数据证据,应该允许产品经理在复盘时说出三种话:这个判断成立;这个判断只成立了一部分;这个判断错了,我们要换方向。能说出这三句话,产品经理才不是在用数据保护自己的面子,而是在用数据保护团队的资源。这一章不讲 SQL,不讲数据指标体系,也不讲完整的数据分析方法,虽然这些东西很重要,但是我们需要先明白一个更靠前的动作:在产品判断形成的时候,如何让它具备被验证的条件。

8.1 定义证据——别让漂亮数据替你下结论#

我以前经历过一次印象深刻的佣金裂变活动,当时所在的社交电商平台和一个食养新品牌合作做首发,希望借助百万体量的活跃经销商,搭建社群推广链路,打响品牌影响力。活动机制不复杂:用户购买指定商品后,生成专属推广海报,只要通过海报带来一笔成交,就能拿到订单金额 15%的佣金且可以提现。项目一开始目标很明确:验证“分销裂变能不能成为新品冷启动的标准化模型”,对平台来说,如果新品首发能靠用户分享快速起量,就不用每次都依赖站内资源位和补贴;对品牌方来说,新品上市最怕没声量、没销量,佣金裂变看起来既能卖货,又能沉淀一批愿意传播的用户;对运营团队来说,这套活动如果跑通,以后就能沉淀成新品首发的标准动作。活动前 3 天的数据非常漂亮。新品 GMV 破了平台单日单品销售纪录,分销海报成交订单占比 72%,裂变系数 2.3,这相当于一个购买用户又带来了两个多成交用户,更让人兴奋的是,获客成本不到平台均值的 20%。站在增长视角看,这几乎是一组让人很难不兴奋的数据:卖得多、传播强、获客便宜。品牌方满意,运营团队也有理由认为模型跑通了。

阶段性复盘会上,运营同学用一页 PPT 总结了结论:分销裂变模型跑通,建议将佣金裂变升级为所有新品首发的标准化流程。品牌方也很满意,提出追加预算做第二波。团队内部甚至开始讨论,要不要成立专门的分销运营小组,把这套活动产品化、流程化,以后每个新品都可以套进去。那种现场其实很难泼冷水,数据在涨,品牌方认可,运营团队士气正高,大家讨论的是“怎么放大”,而不是“要不要重新确认”。这时候如果产品经理直接说“我觉得这不健康”,很容易被理解为不支持增长,甚至像是在用一个不够显眼的风险指标,否定大家刚刚拿到的结果。更现实的是,品牌方已经准备追加预算,第二波活动的窗口不会等太久。这时候提出再补一轮分析,意味着活动节奏可能被打断,运营同学要重新解释预算,品牌方也会问:第一场不是很好吗,为什么还要等?

如果只看这些数据,这个结论并不荒唐。新品首发就是要卖货,GMV 破纪录当然重要;分销海报成交占比高,说明活动机制确实带来了传播;裂变系数 2.3,说明用户不是孤立购买,而是拉来了新成交;获客成本低,说明这条路径比常规投放更划算。品牌方在意销量也不是短视,新品首发阶段,销量本来就是最直接的压力。运营同学被数据鼓舞,也不是不专业,活动确实跑出了短期结果,谁都不希望在一组漂亮数据面前泼冷水。但有一个指标让我们产品团队觉得不太对,这个指标不是 GMV,也不是裂变系数,而是佣金提现率。当时看板上,所有人的注意力都在进攻指标上:成交额、新客、裂变系数、获客成本。佣金提现率看起来更像一个财务或结算指标,不够刺激,也不适合放在汇报第一页。但我们注意到,产生分销订单的用户里,申请佣金提现的比例接近 80%,远高于日常营销活动。我们日常做返利、补贴、任务激励时,提现率通常不超过 30%。当然,提现率高不一定就是坏事,用户愿意提现,说明激励有效。但当一个被我们理解为“社交裂变”的活动里,提现率突然高得异常,它就不再只是一个结算数据,而是一个需要解释的信号。我们当时没有马上把这个判断抛到会上,因为“提现率高”本身不足以否定活动,它只能说明佣金吸引力很强,不能直接说明用户在套利。如果产品经理拿一个还没有展开的信号,去挑战一组完整的增长数据,讨论很容易变成谁更谨慎、谁更激进,而不是事实本身。所以我们只能暂时把它当成一个反常识信号,而不是结论,让它提醒我们:现有数据能证明活动被激活了,但还不能证明被激活的是消费者需求。

这个指标的异动让我们产品团队开始怀疑一件事:这些用户到底是在分享一个自己认可的商品,还是在经营一个佣金机会?这两件事差别很大,如果用户下单购买了,觉得产品不错,分享给朋友,朋友也因为产品价值下单,这叫社交裂变,佣金在这里是加速器,不是核心动机。但如果用户只是看到 15%佣金,就开始动员身边的人下单,甚至自己用多个账号下单、用家人地址收货、低价转卖或压货,那这就不是新品冷启动模型,而是一场短期套利游戏,它也会带来 GMV,也会带来分销订单,也会让裂变系数变好,但它证明不了模型健康。这里最容易犯的错误,就是把“增长发生了”直接理解成“模型跑通了”。增长发生,是一个事实;模型跑通,是一个判断。**事实可以由主指标证明,判断需要更多证据。**GMV 可以证明卖得好,裂变系数可以证明传播链条被激活,获客成本可以证明这次获客费用低,但它们不能证明被带来的用户是真实消费者,也不能证明这些用户未来还有价值,更不能证明这套活动能作为新品首发的标准化模型反复复制。

所以产品团队当时没有急着反对活动,也没有说“佣金裂变不成立”。我们只是把判断拆小了一点:如果我们只是说“这场活动销量不错”,现有数据已经够了;如果我们要说“分销裂变模型跑通,可以成为新品冷启动的标准动作”,现有数据不够。我们还要知道这些成交到底来自谁,用户是否真实消费,佣金是否引来了套利行为,以及砍掉或降低佣金后,这批用户还会不会留下来。这个拆小动作很重要,它把讨论从“你是不是反对增长”变成了“我们现在的数据能证明多大的结论”。产品经理在这里要做的第一件事,不是判断数据好不好,而是先问清楚:我们到底在证明什么。很多争论其实不是数据争论,而是大家要证明的东西不一样。品牌方说活动好,因为它在看销量;运营说活动好,因为它在看成交和传播;产品经理如果说模型可以复制,就必须看用户质量、套利风险和长期行为。大家都在说“数据好”,但每个人脑子里“好”的含义不一样。

8.2 拆开指标——不同数据承担不同证明任务#

带着这个疑问,我们请数据团队对分销用户和被邀请下单的用户做了几层拆解。做这件事不是为了在报告里堆更多数字,而是让不同数据回答不同问题。如果要证明“这场活动有没有跑起来”,主指标就够了。GMV、分销订单占比、裂变系数、获客成本,这些指标都在回答同一类问题:活动有没有带来增长。它们很重要,没有它们,活动连基本结果都说不清,但主指标有边界,它们像一盏明灯能照出结果的轮廓,却照不见结果背后的来源。那么我们需要回答的问题就很清晰:这批增长到底从哪里来的?

我们先把分销用户按“是否有过自购行为”和“历史购买均价”做分层,结果发现:Top 20% 佣金赚取者里,超过 60% 是纯分销型用户,这些人自己从没在平台上有过任何消费记录,只在有高佣金活动时出现,拿到佣金就提现离开。他们当然也能带来成交,但他们不是平台意义上的真实消费用户,更像是被佣金召唤来的机会型分销者。继续追踪被邀请下单用户的收货地址,我们发现了一个更反常的现象:同一个分销用户带来的订单,收货地址高度集中在 1~2 个地址,而且 70% 的订单集中在最低客单价商品上。这个信号已经很难用“真实社交传播”来解释了,如果用户真的把新品推荐给不同朋友,收货地址不应该这么集中;如果被邀请的人都是终端消费者,订单也不该集中在最低客单价商品上。更合理的解释是:相当一部分订单是分销用户自买冲单,用自己或家人的账号下单,赚佣金差价,再把货压在手里或低价处理。

到了这一步,我们对活动的判断就必须修正了,不是“分销裂变模型跑通”,而是“佣金杠杆在没有止损设计的情况下,引来的可能不是社交裂变,而是套利行为”。这句话没有复盘 PPT 上那句漂亮,但更接近事实,它没有否定活动带来的销量,也没有否定佣金机制的价值,只是把这组增长放回了更真实的解释里。这里面有一个方法上的分水岭:产品经理不能只把指标分成”好看”和”不好看”,得看它们在判断里承担什么任务:

  • 主指标:回答的是“有没有增长”。在佣金裂变里,它们是 GMV、裂变系数、分销订单占比和获客成本。没有主指标,活动效果无法评价,但主指标容易让团队兴奋,也容易被拿来证明一个过大的结论。
  • 解释指标:回答的是“增长从哪里来”。佣金提现率、用户历史自购行为、历史购买均价、佣金赚取者画像,这些解释指标没有 GMV 那么漂亮,但它们能解释增长背后的用户结构。如果不看解释指标,团队就会把所有成交都当成同一种成交,把真实消费、职业分销和套利冲单揉成一个平均数。
  • 护栏指标:回答的是”增长有没有副作用”。收货地址重复率、非活动商品转化率、30 日非活动商品消费率、提现率和留存比,这些指标保护团队不要用短期销量换长期质量。它们通常不适合放在活动战报第一页,因为它们经常让漂亮数据变得没那么漂亮,但正因为如此,它们才重要。
  • 反证指标:回答的是”什么情况会推翻当前判断”。如果纯分销用户占比过高、地址高度集中、提现率很高但留存很低,就不能再说”社交裂变模型跑通”了。反证指标的价值在于,它提前给判断留了一个退出口。没有反证指标,复盘时团队很容易只找支持自己的数字;有了反证指标,团队至少知道:出现什么事实时,我们要承认判断不成立。

这四类指标可以压缩成一张表,但不是我们遇到的所有项目都要机械的照搬,很多项目不需要这么重,有些小功能只看一个主指标和一个护栏指标就够了。它真正想提醒的是:一组数据不是因为数量多才有价值,而是因为它们各自承担了不同的证明任务

指标类型回答的问题常见误区佣金裂变里的例子
主指标有没有达到目标把增长当健康GMV、裂变系数、获客成本
解释指标增长从哪里来不看用户结构提现率、历史自购、佣金赚取者画像
护栏指标有没有副作用只看收益不看代价地址重复率、非活动消费率、提现率/留存比
反证指标什么会推翻判断只找支持证据纯分销用户过高、地址集中、留存低

后来我们没有叫停第一场活动,但做了几个止损动作:增加同一收货地址限购;增加佣金提现门槛,要求用户完成一次非活动商品消费后才能提现;对后续新品首发活动的分销模型加入约束,把佣金率和用户历史自购行为挂钩,纯分销用户的佣金率下调;更重要的是,明确本次活动的模型不可直接复制,下一场活动必须先跑一个带护栏指标的版本。加上护栏后,结果确实不如第一场漂亮:裂变系数从 2.3 降到 0.8,GMV 也回落了。品牌方最初不太理解,甚至问我们为什么加这么多限制,把数据搞难看了。这个反应很真实,对品牌方来说,销量下降当然不是好消息。可当我们把第一场活动的收货地址重复率、纯分销用户占比和最低客单价集中度展示出来后,对方很快意识到:第一场活动真实触达的终端消费者,可能远低于表面数据显示的规模。但是第二场活动也有更好的数据:分销用户的非活动商品转化率从几乎为零提升到 12%,收货地址重复率从约 70% 压到 15% 以内。这意味着裂变系数虽然下降了,但套利订单被挤掉,留下来的用户更接近真实消费者。

第二场活动的数据变差并不意味着失败,而是活动更健康了,很多时候,健康的数据不一定更好看。产品经理如果只追求数据好看,就会自然偏向主指标;如果想让判断可靠,就必须愿意面对那些会让主指标变难看的证据。护栏指标不是给主指标泼冷水,而是在保护团队别把短期热闹误读成可持续能力;反证指标也不是为了否定项目,而是让团队有能力在错误方向上停下来。这里最难的不是会不会设计指标,而是能不能接受一个事实:有些数据变差,恰恰说明我们开始看见真实问题。

8.3 设计采集——没有被采集的行为,不会出现在看板上#

你想看的证据,系统得先能采到,这一点听起来像数据团队或技术团队的事,但产品经理不能完全置身事外。埋点不只是一项技术配置,它还决定了团队未来能看见什么,也决定了团队会把什么误以为不存在。**很多时候,数据看板没显示问题,不是因为真没问题,而是当初就没把那个问题变成可采集的行为。**我早期在做新零售平台时遇到过类似情况,那是一个主营数码3C品类的平台,产品团队接到的命题是优化商品详情页转化效率,让”逛”的用户更容易”买”。很常见的命题,大家的第一反应也很自然:商详页漏斗分析。

当时的商详页埋点非常基础,只有三个关键事件:page_view(页面曝光)、btn_add_to_cart_click(加购按钮点击)、btn_buy_now_click(立即购买按钮点击)。拉出来的数据是:商详页转化率(加购PV+购买PV)/页面曝光PV看起来还算健康,过去三个月也没有明显波动。看板上的数据很平静,会议上却不太平,运营同学认为,转化率没有下降,说明商详页没有明显问题,应该把精力放到流量侧,去找更精准的人群和更好的入口;UED同学不太认同,他看过一些用户录屏,发现很多用户会在页面中部反复滑动,好像在某个区域犹豫,但这个行为在漏斗里完全看不见。两边争了半个小时,其实谁都有道理,运营看的是真实转化率,设计师看到的也是真实用户行为,问题是,当时的看板没有能力把这两件事连接起来。

我后来问了一个很基础的问题:那些离开的用户,到底是在哪一屏流失的?商品主图区、价格规格区、用户评价区,还是图文详情区?这个问题听起来简单,但当时没人答得出来,我们只知道用户进入了商详页,也知道他有没有点击加购或立即购买,但中间发生了什么,全被压在 page_view 这一个事件里。就像拍了一张全班合影,知道谁来了、谁没来,却不知道谁在课间和谁聊过天,谁听到一半开始走神,谁在某道题上卡了很久。数据看板能回答”来了多少人、多少人点了按钮”,但回答不了”没点按钮的人为什么没有点”。于是我们做了一次埋点改造:先不新增商详页复杂事件,只是给 page_view 补了两个属性:scroll_depth (滚动深度)和 dwell_time_section(模块停留时长)。前者记录用户页面滚动到了哪个模块区域,后者记录用户在每个模块区域的停留时长。口径也尽量简单:滚动深度的有效触发条件,是模块区域顶部触及屏幕顶部超过2秒,排除快速划过;停留时长按用户进入某模块到离开该模块的时间差计算,低于3秒不算有效停留。补完这两个属性后,数据很快推翻了“商详页没问题”的结论。价格规格区的触达率高达85%,评价区掉到60%,图文详情区只剩35%。这意味着近三分之二的用户看完价格规格区后,就没再往下看商品详情。更关键的是,价格规格区的平均停留时长是所有模块里最长的,用户不是简单看了一眼价格就走,而是反复停留和滑动。结合用户录屏和页面结构,我们才意识到问题出在规格选择上,当时商详页默认展示SPU信息,只有选中对应SKU后,页面内容才会切换成对应SKU的信息。这是早期比较常见的一种呈现方式,但它把一道选择题直接甩给了用户:这么多规格里,我到底该选哪个?尤其是3C商品,规格之间涉及容量、颜色、版本、套餐、保修、配件差异,用户不是不想买,而是不知道哪个更适合自己。原来的漏斗看不见这种犹豫,所以团队才会在“页面没问题”和“用户好像卡住了”之间来回争论。

如果只看老数据,优化方向大概率是顺手的那条路:改按钮颜色、强化促销标签、把立即购买按钮做得更醒目,或者继续从流量侧找原因。这些动作不一定没用,但没打中当时真正的问题。新数据告诉我们,用户不是没看到按钮,也不是缺促销刺激,而是在价格规格区需要一个更低成本的选择依据。最后我们没有优先改按钮,而是在价格规格区加了“平台推荐规格”和默认选中逻辑,推荐规格的依据不复杂,基于销量和好评率做综合权重,不包装成某个单一指标的绝对结论。这个设计的目的不是替用户做决定,而是在用户明显犹豫时给一个可参考的选择。上线后,商详页转化率提升了约1.7%的绝对值。

产品经理不需要变成数据开发,也不需要在每个项目里设计复杂事件。但产品经理必须能判断:当前的埋点,能不能回答我们要验证的问题。判断用户是不是卡在规格选择,只有页面曝光和按钮点击是不够的;判断分销用户是不是套利,只看GMV和裂变系数也是不够的;判断到手价有没有降低算账成本,只看点击同样不够,还要看停留、转化、客服咨询和不同活动档位之间的差异。产品经理不能对着“没采集过的数据”下“没问题”的结论。很多数据看板上的平静,并不代表真实世界平静,只代表我们安装的观察窗口没有捕捉到波动。数据证据要进入判断,第一步不是把图表做得更漂亮,而是让关键行为有机会被看见。这也是为什么我现在看埋点时,会比以前更在意三个很直接的问题:事件有没有对应用户动作?属性有没有保留判断所需的场景?口径有没有排除掉噪音?事件回答“用户做了什么”,属性回答“在什么情况下做的”,口径回答“我们把什么算作有效行为”。这三件事如果说不清,后面的分析再完整,也可能只是把一堆模糊事实做成了精致报表。

商详案例里,把每个模块都拆成独立事件,不是不可以,但那样会让埋点变重,看板也容易凌乱。我们选择给 page_view 补属性,是因为当时真正要验证的,不是“用户有没有点击某个新功能”,而是“用户在页面内部走到哪里、停在哪里”。所以 scroll_depthdwell_time_section 已经足够回答问题。埋点不是越细越好,而是要和判断匹配。判断很粗,埋点再细也是噪音;判断清楚了,几个简单属性就能让问题浮出来。口径也很关键,为什么滚动深度要卡模块顶部触及屏幕超过2秒?因为快速滑过不代表真的看见了;为什么停留低于3秒不算有效停留?因为惯性划过、网络卡顿或无意停顿,都不等于犹豫。口径不是为了学术严谨,而是为了让数据更接近真实行为,如果所有快速划过都算触达,价格规格区、评价区、图文详情区都会显得很热闹;如果所有停顿都算犹豫,数据又会把很多无意义停留误判成决策困难。产品经理不需要在口径上追求完美,但要知道口径会改变结论。

很多产品同学把埋点当成需求文档里最后一张表:页面名称、事件名称、触发时机、上报属性,写完就交给研发。这样做功能上线后当然有数据,但不一定能回答你的问题。更好的顺序是倒过来:先说清楚我要验证什么判断,再决定需要看什么行为,再设计事件、属性和口径。商详案例里,如果判断是“用户在规格选择上犹豫”,那我们要看的就不是按钮点击,而是规格区触达、停留和选择前后的行为;佣金裂变里,如果判断是“分销用户是不是真实消费者”,那我们要看的就不是分销成交本身,而是历史自购、地址重复、提现和非活动消费。数据采集不是附属动作,它从一开始就应该服务于判断。

8.4 放进评审——数据要提前约定,而不是事后挑选#

与问题定义和体验设计一样,数据证据的设计同样也不能只依赖某个产品经理的个人敏感度,这是不牢靠的方式。这个项目你留意到了提现率、地址重复率、非活动消费率,下个项目排期一紧,团队可能又只看 GMV 和转化率;这个项目你补了模块停留时长和滚动深度,下个项目大家又回到页面曝光和按钮点击。让方法稳定下来,靠的不是每个产品经理都记一堆指标,而是在评审和复盘里提前约定数据证据。很多团队不是不看数据,而是看得太晚,立项时写目标,上线后看结果,中间缺了一句关键的话:这次的判断,到底要靠什么来证明?

佣金裂变就是典型,如果立项只写“通过分销佣金提升新品首发销量”,复盘时 GMV 和裂变系数就会成为最重要甚至唯一的指标,只要 GMV 好看,团队很容易说活动成功。但如果立项写的是“验证佣金裂变能否成为新品冷启动的可复制模型”,证据要求就完全不同了,它不只要看销量,还要看用户质量、分销用户结构、地址重复率、非活动消费、佣金提现和后续留存,因为“卖得好”和“可复制模型”不是同一个判断。商详埋点也一样,需求只写“优化详情页转化效率”,上线后团队自然只看整体转化率涨没涨。但如果评审时说清楚了“我们怀疑用户卡在规格选择,而不是按钮不明显”,上线前就必须确认有没有模块触达、模块停留、规格区域行为、提示曝光和提示后转化,否则功能上线后,数据即使变了,也很难知道它到底验证了什么。

所以我更倾向于在评审前把数据问题提前写清楚,不是写一份厚厚的数据方案,也不是每个需求都附一套复杂指标体系,而是让产品经理在讲方案之前,先把判断句讲清楚。目标指标通常很大:提升转化率、提升 GMV、降低流失、提高使用率。判断句要更具体:佣金裂变带来的成交是否来自真实消费者;用户是否在规格选择上犹豫;到手价是否降低了算账成本;自动调价是否减少了一线运营的责任成本。目标指标告诉团队“我们要往哪走”,判断句告诉团队“我为什么相信这个方案能推动那个数字”。评审会上如果只讲目标指标,团队很容易默认目标和判断是一回事。“提升新品销量”和“佣金裂变模型可复制”听起来都跟增长有关,但证据完全不同,前者看销售结果就够,后者必须看用户质量和套利风险;“优化详情页转化”和“用户卡在规格选择”也不是一回事,前者可以用转化率评价,后者必须看价格规格区的触达、停留、选择行为和提示后的转化。产品经理在评审里把判断句讲清楚,是为了把讨论从“我要达成什么数字”拉到“我为什么相信这个方案能改变这个数字”。所以判断句讲清楚之后,下一步不是直接进入开发,而是明确数据指标体系,数据证据应该由哪些指标组成。方案上线后,总能找到一些变好的数据,也总能找到一些不理想的。如果团队没有提前约定,就很容易各取所需,支持方案的人拿转化率说话,反对的人拿投诉或成本说话,复盘最后变成观点争夺。提前约定证据,不是为了限制讨论,也不是为了让数据变成裁判,而是给讨论定一个共同基准:先看当初约定的证据是否支持判断,再看有哪些新发现。这里还有一个经常被忽略的环节:上线前确认采集口径。很多项目复盘很虚,不是团队不想认真复盘,而是关键数据根本没采。商详案例里,没有模块触达和停留时长,用户在价格规格区的犹豫就不会出现在看板上。佣金裂变里,没有收货地址重复率、分销用户历史自购和提现率,套利行为就会被裹在 GMV 里。产品经理不需要亲自写埋点代码,但是需要明确数据指标是否存在埋点采集的缺失,其实也就是意味着:上线后,我们能不能看到验证判断所需的证据?这句话很小,但它决定复盘是回到事实,还是回到感觉。

这几个动作看起来会让流程变重,但实际往往能减少后面的争论。以前团队可能要争论“这次活动到底算不算成功”,现在可以拆开说:销量成功,用户质量一般,套利风险较高,作为单次活动可以接受,作为标准模型不能直接复制。以前团队可能要争论“详情页到底有没有问题”,现在可以拆开说:整体转化率没有明显下降,但价格规格区停留异常,说明问题不在整页转化,而在规格决策。拆开以后,讨论不一定更轻松,但会更准确。我在带团队时,会希望产品同学在推进重点项目时,能够回答几个问题:这次真正要验证的判断是什么?哪些数据能支持这个判断?哪些数据会推翻这个判断?这不是要求每个项目都做复杂分析,只是让数据在项目开始前就进入判断,而不是在项目结束后才进入汇报。数据如果只出现在汇报里,很容易变成包装;数据如果提前进入评审,才有机会成为证据。这里还要避免另一个误区:数据证据设计不等于追求完美实验,真实工作里,很多项目没有足够样本做严格的 A/B,没有足够周期看长期留存,也没有条件把所有变量控制干净。需要明确哪些数据上线后一周就能看,哪些要等一个月;哪些数据只能证明短期行为,哪些才接近长期质量;哪些信号足够支持继续投入,哪些信号只说明还需要观察。证据不完美,不代表判断只能靠感觉,它只是要求产品经理把证据边界说清楚,别把一个只能证明局部有效的数据,包装成全局正确的结论。

8.5 复盘判断——数据不是为了证明自己对#

数据证据设计的最后一站,是复盘。很多团队复盘时会问目标有没有达成、指标有没有上涨、问题有没有解决。这些当然要问,但如果只问这些,团队很难积累判断能力。因为产品经理最需要复盘的,不只有方案效果,还有当初那个判断是否成立。

佣金裂变第一场活动,如果只看目标,几乎可以写成成功案例:GMV破纪录,裂变系数2.3,获客成本极低,品牌方满意。但如果复盘判断,事情就没那么简单,当初真正想验证的是“分销裂变能否成为新品冷启动的标准化模型”。第一场活动证明了佣金能快速撬动成交,却没证明用户质量健康;证明了高佣金能激活传播,却没证明传播来自真实消费;证明了短期GMV能起来,却没证明模型可以复制。第二场活动反而更有意思,主指标不好看,裂变系数从2.3降到0.8,GMV也回落了。如果只按战报逻辑,它当然不如第一场,但按证据逻辑,第二场反而更接近答案。分销用户非活动商品转化率提升到12%,收货地址重复率压到15%以内,说明套利被挤掉了一部分,真实消费者的质量在提升。它让团队看到了两件事:高佣金不加约束会带来什么,加上护栏后又需要牺牲什么,这个复盘比“第一场成功、第二场不够成功”更有价值,因为它让团队看见了模型的边界。

所以复盘时不能只问“数据好不好”,还要问“数据是否验证了当初的判断”。如果主指标涨了但护栏指标变坏,判断不一定成立;如果主指标变差但虚假增长被挤掉,判断可能反而更清楚;如果数据看板没有变化,也要问是不是采集方式漏掉了用户真正的行为。数据不是奖杯,不是用来证明产品经理当初有多聪明,它更像一面镜子,照出来的不只有方案效果,还有我们当初判断的漏洞。我更倾向于把复盘结论拆成三种,而不是简单写成成功或失败:

第一种,判断成立

商详埋点案例里,补充模块触达和停留时长后,我们确实看到用户集中卡在价格规格区;上线推荐规格后,整体转化率提升约1.7个百分点。这说明“用户在规格选择上存在决策成本,辅助推荐能降低一部分犹豫”这个判断基本成立。但即使成立,也不能无限外推,它不等于所有详情页问题都能靠推荐规格解决,也不等于所有转化问题都出在规格区。复盘要守住这个边界,否则一次有效的方案,很快就会变成下一次误判的经验负债。

第二种,判断部分成立

佣金裂变第一场活动就是这样。它证明了高佣金能快速撬动成交,也证明了分销机制能激活传播,但没有证明模型健康,更没有证明它可以标准化复制。很多项目其实都卡在这个状态:方向有价值,但解释不完整;方案有效果,但代价还没算清;主指标变好,但护栏还在报警。如果复盘只能写”成功”或”失败”,这种中间状态就会被抹掉,团队也就学不到最要紧的东西。

第三种,判断不成立

这个结论最难写,也最有价值。比如商详补了规格区埋点后发现用户并没有在规格区停留,反而在评价区大量流失,那“用户卡在规格选择”就不成立;如果佣金裂变加上提现门槛后,真实消费没有提升、地址重复率也没下降,那“套利是关键问题”这个解释就还需要被挑战。判断不成立不代表产品经理失败,它只意味着团队在错误解释上少浪费了一轮资源。

好的复盘不应该只给团队带来一种情绪:成功或失败。它更应该带来一种更清楚的认识:我们原来相信什么,哪些被证明了,哪些没有被证明,哪些被推翻了,下一次要少相信什么、多观察什么。产品经理如果每次复盘只想证明自己当初是对的,就会本能地选择支持自己的数据;如果他愿意把复盘当成判断训练,就会更在意那些让自己不舒服的证据。这里有一句话很重要:数据不是为了保护产品经理的自尊,而是为了保护团队不在错误判断上继续加码。很多时候,承认判断不成立并不丢人,真正危险的是,指标已经提示问题,团队还在用另一个更漂亮的数字安慰自己。裂变活动里,GMV很漂亮,但提现率、地址重复率和用户质量已经在提醒风险;商详项目里,整体转化率没变,但模块停留和用户录屏已经在暗示犹豫。产品经理要训练自己听见这些不顺耳的数据。它们不一定马上推翻方案,但至少应该让我们停下来重新确认:这个判断到底还站不站得住。

闲言碎语#

产品经理做久了,会越来越依赖数据,这是一件好事。没有数据,很多讨论会被经验、职位和声音大小带走;有了数据,团队至少多了一种回到事实的方式。我不怀念那种纯靠感觉拍板的时代,也不觉得“数据驱动”有什么问题。真正的问题在于,数据太容易让人获得一种廉价的确定感。一张趋势图往上走,一组转化率变好,一个实验组赢了对照组,都会让人心里安定下来。它给了产品经理一种感觉:我不是凭感觉,我有证据。可越是这样,越要小心。因为数据并不会自动告诉你,它到底证明了多大的结论。很多时候,它只证明了一个很窄的事实,而我们会忍不住把这个事实扩展成一个更大的判断。GMV 涨了,就说模型跑通;停留时长变长,就说用户更感兴趣;转化率没变,就说页面没问题;使用率上升,就说功能有效。这些话都太顺了,顺到像是专业判断,实际上可能只是数据包装过的经验惯性。

我现在更愿意相信那些能被推翻的判断,不是因为我喜欢否定自己,而是因为一个不能被推翻的判断,往往也无法真正被证明。如果一个产品经理在立项时说不清什么数据会推翻自己的方案,他其实也说不清什么数据能真正支持它。所有数据都能被解释成“还有优化空间”,所有结果都能被包装成“方向基本正确”,那团队就会失去停下来的能力。这件事说起来理性,做起来并不轻松。因为每个产品经理都希望自己的判断成立,也希望自己推动的项目有结果。项目跑出漂亮数据时,很难主动去看那些让它变难看的指标;方案上线后转化涨了,很难继续追问是不是牺牲了别的东西;老板和业务都满意时,也很难说“我们还不能证明它可以复制”。但产品经理越往后走,越要学会这种不舒服。不是为了显得谨慎,而是因为组织会把越来越多的资源交给你的判断。如果你的判断只会寻找支持自己的证据,它迟早会把团队带到一个很贵的错误里。

数据最好的地方,不是让人更强势,而是让人更诚实。它让我们有机会承认:这件事确实有效,但只在这个场景有效;这个指标确实涨了,但代价也被转移了;这个方案没有失败,但我们原来的解释错了;这个项目看起来不够漂亮,但它让我们看清了真实边界。产品经理能不能接受这些答案,决定了数据到底是证据,还是装饰。你不一定每次都能设计出完美指标,也不一定每个项目都有严谨实验,但你至少要在心里保留一个位置,放那些可能证明你错了的数据。这个位置越早留出来,你的判断反而越稳,真正值得信任的产品判断,不是从来没有被质疑过,而是经得起证据的追问。

img
img

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

第 8 章 · 数据证据
https://www.shanfengpm.com/posts/jianshan/2026-03-22-data-evidence/
作者
山风
发布于
2026-03-22
许可协议
CC BY-NC-SA 4.0
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
公告
欢迎来到我的博客!我将竭力帮助产品人夯实需求拆解、方案设计、项目管控、数据决策的核心专业能力,精准把握行业趋势与技术脉搏,在复杂商业场景中实现产品价值的精准锚定与高效落地,共攀产品专业主义的进阶之巅。
站点统计
文章
15
分类
4
标签
46
总字数
126,513
运行时长
0
最后活动
0 天前
站点信息
构建平台
Cloudflare Pages
博客版本
Firefly v6.14.3
文章许可
CC BY-NC-SA 4.0