增长案例完整讲解 · 云集「必买」增长项目

云集「必买」增长案例一天只主推一款货,怎么把「高流低转」的漏斗掰回来

案例:会员制社交电商「必买」模块(每日主推一款商品) · 节奏:一期做商详转化率,二期做种草 · 角色:必买增长负责人
+38.5%
整体加购率
10.14% → 14.04%
+35.7%
加购转化率
26.09% → 35.41%
100%
统计置信度
试验具备显著差异
超额达成
年度目标
阶段 75% → 全年达标

怎么读这个案例

先用一句话讲完,再告诉你这里有三层东西可以拿,最后给你一条贯穿全文的线。

一句话讲清

在一个已经转向存量、用户数还在下滑的赛道里,我们放弃抢新流量,把「转化率」拆到能动手的颗粒度,剔掉选品噪声后发现转化率才是弹性最大的一环;然后用 6 次 A/B 实验逐条验证假设,其中「把商详换成种草页」拿到 100% 置信的增量;最后把这一次成功的实验,推成了一套可复制的种草内容基建。

但故事真正的落点在最后:实验赢了,进度条一度停在 75%,而补上那一段的不是下一个实验,是产能。年度目标最终 100% 达成,并实现超额。

三个层次,三种读法

同一个案例,不同角色能拿走的东西不一样。先确认你在哪一层。

TACTICS
战术层
用种草页替换预告商品的商详页,整体加购率 10.14% → 14.04%,加购转化率同步从 26.09% 提升到 35.41%。
适合:做电商、做内容化、做导购的人
METHOD
方法层
定北极星 → 因子分解 → 去噪 → 算弹性 → 做 A/B → 纠口径 → 转基建,一条完整的增长闭环。
适合:所有做增长、做产品决策的人
JUDGMENT
心法层
在增量红利消失的时候,资源不该押在「空间最大」的地方,而该押在「能最快知道对错」的地方。
适合:做方向判断的人

为什么这个案例「难」

它不是那种「做了个活动数据翻倍」的爽文。难在三处:

赛道
增量红利见顶
行业规模已到 842.1 亿元,但市场已经开始由增量转向存量。存量意味着没有新流量可抢,只能向内生要增长
结构
漏斗的问题不在总量里
站内 51% 的流量由两个转化率不足 0.4% 的页面贡献,而转化率 6.23% 的首页只占 41% 流量。
颗粒
能动的手只剩一个
能动的抓手最后只剩「转化率」。而转化率里最容易想到的「改视觉」,后来被证明几乎没有空间。

如果你只想拿一条走,拿第三条:资源不该押在「空间最大」的地方,而该押在「能最快知道对错」的地方。

一条贯穿全文的线

全篇按这条主线推进。读的时候可以顺着追,每一章都在这条线的某一环上。

行业进入存量 · 只能向内生要增长 但要增长,先得知道「涨什么才算赢」→ 定北极星 把订单量拆到能动手的一层 → 因子分解 发现数据被选品污染(转化率跨度 100 倍)→ 去掉噪声 UV 只剩 17% 空间,转化率还有 55% → 压转化率 14,757 单 vs 19,490 单 13 条假设,ICE 排序,6 次 A/B 实验裁决 赢了,但报出四个提升幅度 → 纠口径 阶段进度 75%,全年超额达成,缺口靠产能补上,不靠下一个实验
全篇主线:从「承认季节变了」到「把验证过的结论变成产能」
最后一条最值得看

大部分案例分享会停在「我们做对了什么」。这个案例真正的信息量在最后一环:做对了之后,怎么让它对业务目标起作用。 第 07 章专门回答这个问题。

一页纸速览

主战场
会员制社交电商「必买」模块(每日主推一款商品),聚焦 商详转化率
北极星指标
必买相关 订单量(从 17 个候选指标中经两轮评估选定)
核心漏点
站内两个非核心页面贡献 51% 流量,转化率却只有 0.14% / 0.38%;而首页用 41% 的流量做出了 6.23% 的转化率
核心杠杆
把预告商品的 商品详情页 替换为 种草内容页
最大战果
整体加购率 10.14% → 14.04%(+38.5%);加购转化率 26.09% → 35.41%(+35.7%);置信度 100%
阶段性成绩
日均 UV 21 万(上线前 8.7 万);成交转化率均值 7.2%;阶段进度 75%(累计 1.9 亿 / 年度目标 2.5 亿),全年目标最终 100% 达成并超额
最大的资产
不是这一个结果,而是「定义赢 → 拆解 → 去噪 → 排序 → 验证 → 纠口径」这套闭环,以及 两次失败实验划出的边界条件

01战场:先看懂这块牌桌

在看任何动作之前,得先知道这场仗是在什么地形上打的。

1.1 必买是个什么业务(这是理解全案的钥匙)

先讲清楚这一层

这是理解后面所有动作的前提。它回答一个很具体的问题:为什么两个成功的实验,打的都是「加购率」,而不是直接打「转化率」?

「必买」是云集的一个 每日主推一款商品 的模块。一天一个主角,所有流量往这一个商品上灌。这就决定了它的业务流程是 两段式 的:

预 告 期 · 前 一 天 正 式 期 · 当 天 用户看到「明日预告」商品 一个还没开卖的商品,天然需要理由 决策窗口:加入购物车 成本最低的时刻:有时间、无付款压力 核心指标:加购率 (意向下单转化率) 隔天 商品正式开卖 正式期的商详页是另一套页面 加购用户回来下单 要做的只是「提醒」,不是「说服」 核心指标:加购转化率 (意向的兑现率)
必买的业务机制:用预告期锁定意向,用正式期兑现意向

为什么这个机制如此关键?

全案的题眼

「加购成交率远大于必买商品转化率,说明 加购对后期转化行为有了大幅度提升。」

加购用户是「已经完成购买决策、只是还没付款的人」。所以「提高加购率」的本质不是抬高一个中间指标,而是提前锁定确定性需求,正式期要做的只是提醒他。

这也解释了为什么两个成功的实验打的都是加购率,以及为什么「种草」会被选中:预告期的用户面对一个还没开卖的商品,他缺的不是信息,是一个提前加购的理由。种草内容提供的正是这个理由。

一句话总结这个机制

必买是用预告期锁定意向,用正式期兑现意向。增长的着力点就在预告期。

1.2 行业的季节:从抢店主,转向盘活存量

会员制社交电商平台在早期极度依赖 店主端的裂变与带货能力 去覆盖消费者,「小 b 端」的争夺与培育是这一阶段的核心竞争点。但问题在于:

我们对行业的判断

拥有分销意愿及能力的人群数量是有限的。当行业对这类人群的渗透达到较高水平之后,平台的裂变能力会逐渐走向枯竭。

行业规模已达 842.1 亿元,但增长动能的来源正在切换。我们据此得出第一个关键判断:会员社交电商市场已经开始由一个增量市场,逐步转化为一个存量市场。

这个判断直接决定了后续所有动作的方向:不再优先做拉新裂变,而是把注意力放到留存、变现、复购与客单价上。

概念存量市场 vs 增量市场

在存量市场里继续砸拉新,等于花越来越贵的钱买越来越少的用户,而且买来就流失。这个案例的第一步,是先承认「季节变了」。

1.3 产品的年纪:出现衰退期特征

对主站活跃用户数的分析给出第二个判断:活跃用户数整体呈下滑趋势,具备衰退期的特征。

处在衰退期的产品,通常只有三件事值得做:留存、变现、用户迁移。这进一步收窄了增长动作的选择面。

概念产品生命周期为什么会决定增长策略

判断自己在生命周期的哪个阶段,不是为了贴标签,而是为了砍掉那些「在这个阶段做不划算」的动作。衰退期做大规模拉新,是最典型的错配。

1.4 产品形态:电商 × 社交的杂交体

云集的结构决定了它有两个可用的增长引擎:

  • 电商引擎(变现):用户找到合适商品完成付费 → 平台赚价差利润 → 优化付费转化路径、提升复购率
  • 社交引擎(传播):社群分享、邀请好友下单、B/C 端利益绑定 → 用关系链提升传播效率与购买率

我们明确了两者的关系:不是并列,而是社交引擎为变现助力。

1.5 三个对增长影响最大的变量

序号因素为什么关键
1会员体系B 端与 C 端之间的邀请关系、利益关系,直接决定 B 端裂变能力与 C 端留存
2选品必买以「每日主推一款」的方式做交易转化与流量分发,商品本身就是最大的自变量
3政策外部合规 + 内部补贴/收入政策,影响用户的购买与分享意愿

注意第 2 条。它是后文「去噪」动作的伏笔,也是这个案例最容易被低估的一个认知:在一个每天只推一款商品的模块里,选品方差会直接污染所有指标的可比性。

这句话有两面:

好处流量极度聚焦
必买上线后日均 UV 达到 21 万,而上线前主站每日主推活动的日均 UV 是 8.7 万,提升了约 1.4 倍。流量聚焦与否,差异明显。
代价每一天的样本都换了
卖纸尿裤和卖空气炸锅,转化率天生不在一个量级。你看到的指标波动里,很大一部分不是产品的能力,是商品的属性
关键认知

指标分析默认「时间序列是同一件事的重复观测」,但在「每日一款」的场景里,每一期观测的对象都换了。不处理这一点,所有优化都是在和噪声对话。

1.6 商业目标:三层视角要的东西并不一样

角色目标
公司必买的核心目标是赚钱:通过必买的拉升实现盈亏平衡,同时能够补贴百亿商品
服务商(B 端)通过必买赚取更多佣金(收入的 40%),并借必买商品提升与 C 端的社群粘性
战略层打造 100 个百万级别的爆品

对应的用户价值:

角色价值主张
C 端(新用户 / VIP / 钻石会员)找到精选、高性价比的商品;发现小众且好用的商品
B 端(服务商)通过销售必买商品获取收益;提高社群活跃度

最终收敛出的商业目标:打造爆品,实现盈亏平衡,并补贴百亿商品。

一条硬约束

北极星必须同时能被 B 端和 C 端的行为驱动,因为两端在这门生意里都占股份。只反映一端,另一端就会觉得「这指标跟我没关系」。

02诊断:先定义「赢」,再找漏点

资源有限,到底该往哪儿放?增长的第一性问题不是「怎么涨」,而是「涨什么才算赢」。这一步做错,后面所有实验都是在优化一个错误的函数。

2.1 什么是北极星指标(先说清楚概念)

概念北极星指标 North Star Metric

一个产品在某个阶段里,最能代表用户价值实现、且团队能够合力撬动的那个指标。三个条件:能反映用户价值的实现能牵引长期商业目标团队能对它施加影响

它不是「最大的那个数字」(那是 GMV),也不是「所有指标的综合」。选北极星的本质,是公开宣布「其他事情暂时不做」,这比选什么更难。

2.2 17 选 1:两轮筛选的完整推演

我们先画出业务价值的良性循环

业务价值良性循环

C 端找到高性价比商品 → 产生加购/收藏/分享/下单行为 → C 端实现省钱与心理满足 → B 端通过大量订单获取收益、社群更活跃 → 平台获得利润与用户粘性 → 有更多收入与资源去 BD 更多精品、补贴其他商品 → 回到 C 端

这个闭环同时包含「变现」与「社交」两条链路,因此北极星指标必须同时能被 B 端和 C 端的行为所驱动

第一轮:是否符合业务价值流程

指标判定排除理由
社群下单占比社群下单占比高,无法全面代表 C 端用户,以偏概全
B 端人均订单量无法衡量 C 端用户价值是否被满足,闭环有阻塞
C 端人均订单量以 C 端代表整个 B 端价值,站不住脚
社群活跃度活跃的判断标准与影响因素过多,不直接体现用户价值与商业目标
活跃占比同上
PV/UV单看访问数据很难权衡用户价值是否实现
UV 价值「无价值」的访问干扰因素大
客单价受选品价格影响,不能完全代表用户价值
店均订单量 / 订单量 / GMV / 商品转化率 / B 端收入 / 平台利润 / 购买频次 / 留存率 / 开单率(9 项)通过初筛

第二轮:6 个标准逐项打分

图例: 符合该标准  不符合

标准店均
订单量
订单量GMV商品
转化率
B端
收入
平台
利润
购买
频次
留存率开单率
能否反映用户从必买中获得核心价值
能否为长期商业目标奠基
能否反映用户活跃程度
变好是否代表方向正确
是否简单直观、容易拆解
是否先导指标而非滞后指标
最终选定

订单量(必买相关的订单量,不单指必买商品的订单量)。

店均订单量因其本质是订单量的子集,被保留为增长模型中的拆解指标而非北极星。

2.3 最见功力的一步:为什么把「留存率」排除了

这一步最见功力

被排除的 9 个指标里,有两个是所有增长团队最常挂在嘴边的「好指标」。它们为什么被拿掉,比留下的那一个更值得讲。

购买频次留存率被排除的理由只有一条:不是先导指标

概念先导指标 vs 滞后指标

滞后指标(留存率、购买频次、LTV、GMV):结果发生后才观测得到,变好了只说明过去做对了一件事,没法告诉你现在该做什么。
先导指标(加购率、转化率):提前变化、能预测结果。它今天动了,你知道明天会发生什么。

选北极星的铁律:选能撬动的,不选能证明的

同时看「客单价」被排除的理由:受选品价格影响。这和 1.5 节埋下的伏笔是同一条线索:这个业务里,只要指标里混进了「商品属性」,它就不够干净。 这个认知后面还会反复出现。

2.4 因子分解:把「订单量」拆到可动手的那一层

概念因子分解 Factor Decomposition

按业务真实的运算关系,把大指标逐层拆成可测量的乘积因子,直到拆出可以单独做 A/B 测试的变量为止。如果某一层「这个因子没法单独改变」,说明还没拆到底;如果某一层「改了也影响不了订单量」,说明拆错了。

为什么必须拆:因为「提高订单量」不是一句可执行的话,而「提高预告商品的加购率」是。

北极星指标拆解树(因子分解)
订单量 必买商品订单量 导流商品订单量 必买商详订单量 购物车订单量 导流商详订单量 导流购物车订单量 商详 UV × 商详转化率 × 下单次数 购物车 UV × 加购转化率 × 下单次数 购物车 UV = 预告商详 UV × 加购率 ↑ 预告期的加购率,直接决定正式期订单 模型外的两个变量 选品对指标的影响 ② 各环节用户画像的精准度(即提高有效 UV 的占比) 拆解的终点不是「拆得最细」,而是「拆出一个能单独做 A/B 的变量」 本案例最后选中的是:「预告商品的加购率」:它既在拆解树上,又能被单独改动。
注意树上那行橙色:预告期的加购率,直接决定正式期的购物车订单量

2.5 去噪:整个案例里最关键,也最容易被跳过的一步

先看未去噪的原始数据(必买商详,按主推日统计):

统计量必买商详 UV转化率下单次数
平均值197,9217.61%1.18
最大值319,02019.80%1.4
上四分位数246,93212.12%1.2
中位数209,0994.90%1.1
下四分位数166,5461.90%1.0
最小值50,6720.17%0.9

一眼看到的问题:转化率从 0.17% 到 19.8%,跨度超过 100 倍。

这不是「用户行为」造成的,这是选品差异造成的。在一个「每天只主推一款商品」的模块里,卖纸尿裤(刚需、高信任)和卖空气炸锅(非刚需、决策重)的转化率本来就不在同一个量级。

概念什么是「噪声」

噪声 = 你关心的信号之外,同样在推动数字变化、但你不打算(也无法)干预的因素。本案例的信号是「页面的转化能力」,噪声是「商品的品类差异」。

问题在于噪声的幅度远大于信号:选品能让转化率在 0.17%~19.8% 之间跳 100 倍,而页面对转化率的影响只在零点几个百分点。不处理噪声,你根本听不见自己的声音。

常用手法:四分位过滤(本案例用的,剔除上下 25% 的极端样本)、分层(按品类/价格带分组)、配对 / 回归(把商品属性当控制变量)。去噪不是「删掉不好看的数据」,而是声明「我比较的是什么、不比较什么」

于是我们做了上下四分位过滤,剔除极端选品的干扰,重点观察集中区间:

统计量必买商详 UV转化率预估订单量
(UV 提升至最大)
预估订单量
(转化率提升至最大)
平均值210,0266.00%
最大值245,9509.28%14,75719,490
中位数209,7903.80%

计算式:245,950 × 6% = 14,757 | 210,026 × 9.28% = 19,490

弹性对比:同样的资源,压哪个变量更划算
UV 推到上限(245,950,+17%) 14,757 单 转化率 推到上限(9.28%,+55%) 19,490 单 注:条形长度按预估订单量等比绘制,灰底为可提升空间的上限。
UV 与转化率不在同一个单位上,必须换算到「订单量」这个共同终局才能比较
这是整个案例的转折点

去掉选品影响后,必买商详 UV 的差距并不大(中位数 209,790 vs 最大值 245,950,仅 17% 空间);而转化率有 6% → 9.28% 的空间(+55%)。

反映到订单量上:把转化率做到上限能多拿 19,490 单,把 UV 做到上限只能多拿 14,757 单。

所以,转化率的弹性更大。资源应该压在转化率上,而不是流量上。

2.6 站内流量的真相:高流低转

既然流量层面的空间有限,我们还是把站内流量结构过了一遍,这一步查出了「结构性漏洞」。

来源页面均值 UV占比转化率
首页101,03341%6.23%
鸡场主页89,09436%0.14%
会员中心35,84615%0.38%
商品详情页13,0555%3.70%
搜索页5,5742%11.48%

按平台划分:APP 177,060(83.21%)| H5 17,357(8.16%)| 小程序 15,706(7.38%)| VIP 2,656(1.25%)

流量占比 × 转化率:两个高流量入口的真实效率
0% 3% 6% 9% 12% 41% 首页 6.23% 36% 鸡场主页 0.14% 15% 会员中心 0.38% 5% 商品详情页 3.70% 2% 搜索页 11.48% 浅绿框=流量占比 实心柱=转化率 鸡场 + 会员中心 合计 51% 流量 转化率不足 0.4%
漏斗的问题从来不在总量里,在结构里
结构性问题

鸡场主页 + 会员中心合计贡献了 51% 的流量,但转化率分别只有 0.14%0.38%;而首页只占 41% 流量,转化率却高达 6.23%,是会员中心的 16 倍

这就是后来被项目组总结为「高流低转如何突破」的核心命题。

判断方法

只看 UV 绝对值,鸡场主页(89,094)是除首页之外最大的入口,很容易被当成「优质流量来源」去复制;但把占比 × 转化率放在一起看,它立刻变成全站最大的漏损点。

这是一个通用规律:单一指标看总量,往往会把「最大的漏斗」误读成「最强的入口」,因为量大通常来自「入口足够宽」,而不是「用户真的想要」。所以永远把「量」和「率」放在一起看,并问一句:这个入口的用户,是「想要这个商品」才来的,还是「顺手点进来的」?

2.7 诊断结论

层面诊断可动手的抓手
站内流量流量结构失衡,高占比入口低转化精准触达、提升站内流量利用效率
转化率弹性最大的一环商详转化率、加购率、加购转化率、导流率
站外流量(拓展)当前定位为站内流量承载,站外几乎空白构建品牌与内容优势、承接站外流量

03抉择:为什么压转化率,为什么用「内容」

诊断出了三个方向,为什么选了这一个?

增长杠杆的一般形态是 渠道 × 转化 × 留存 × 传播。我们对三个候选方向做了取舍:

候选杠杆预期空间当时判断取舍
站内流量优化UV 上限空间仅 ~17%空间有限,且涉及多个页面改版、跨团队协调后置
转化率提升转化率空间 +55%,折算订单量更高可控性强、单点改动即可验证首选
站外流量拓展天花板高但周期长需要品牌与内容基建,短期无法验证拓展方向

3.1 弹性:比「哪个数字大」更重要的一个算式

概念弹性 Elasticity

弹性 = 把某个变量推到上限,能多拿多少结果 ÷ 当前结果

不能直接比「哪个数字大」:UV 是「人」的单位,转化率是「百分比」的单位,必须换算到同一个终局指标上。

本案例的换算是:UV 推到上限只能多拿 14,757 单,转化率推到上限能多拿 19,490 单(算法见 2.5)。同样一份资源,压在转化率上能多拿 32% 的结果。通用做法:把每个候选杠杆都「推到合理上限」,算一遍终局指标再排序。

3.2 选择标准:能最快知道对错

为什么选转化率,而不是流量? 表面答案是「弹性更大」。但更深一层的原因是:转化率是「可被实验证伪」的。

流量结构的调整涉及推荐算法、页面改版、多部门协同,一次改动无法隔离出单一变量;而转化率可以被拆成商详转化率、加购率、加购转化率等一串可以单独做 A/B 的因子

增长黑客的取舍原则

优先选择边际成本低、变量可控、反馈周期短的杠杆。不是选空间最大的,是选能最快知道对错的

推论:一个「空间中等但一周能验证」的方向,通常优于「空间很大但要三个月才知道行不行」的方向。增长的本质是迭代速度,你能试错的次数比单次试错的期望收益更重要。

3.3 那为什么最后是「内容」,而不是「改视觉」?

诊断只说了「压转化率」,但转化率下面挂着一串可动手的因子:商详转化率、加购率、加购转化率、导流率……具体动哪一个? 我们的做法是:不预设答案,把所有候选动作写成假设,打分排序,用实验裁决。

后来的结果是:4 次「改视觉」类实验全部失败,1 次「改内容」类实验大赢。这个结果在第 04 章展开,但它印证了一条判断:在成熟的核心页面上,视觉优化的空间已经被用户的操作习惯吃掉了,还有空间的地方是「用户看到的是不是他需要的信息」。

04实验:六次下注的完整记录

判断做完了,怎么把判断变成可验证的动作?答案是:把每个想法写成一个可以被打脸的假设。

4.1 机制:假设库 + ICE 打分

我们先建立了一个假设库(实验列表),用标准句式书写每个假设:

假设的标准句式

如果〔做什么〕 预计〔提升多少〕 因为〔基于什么洞察〕

然后对每个假设做 ICE 打分,按总分排序推进。

概念ICE 打分
维度英文问的问题打分依据
IImpact 预期影响如果成功了,能带来多大提升?该因素在增长模型中的权重
CConfidence 成功概率我有多相信它能成?有没有数据/案例支撑这个判断
EEase 容易程度做起来有多费劲?需要多少开发/设计/协调资源

三项均 10 分制,加总排序。ICE 不是为了算出「正确答案」,而是让团队对「先做哪个」有共同的语言和依据。它是排序工具,不是预测工具:决定「先做哪个」,不决定「做了会不会成」。

假设库全貌

这 13 条的最终状态见附录 A。

#假设ICE关联实验
9底部导航优先展示客服入口,打消用户疑虑8/8/8=24Q2-3
10底部导航去除商家入口,强化信任感8/8/8=24Q2-3
场景化引导:预告商品突出加购、正式商品突出立即购买8/8/8=24
2商详价格面板打造「必买价」概念(对比必买价/日常价/特卖价)8/7/8=23Q2-2
3商详突出显示倒计时,强化限时概念8/7/8=23Q2-2
预告商详改为种草内容(种草一期)7/8/8=23Q2-1
种草页支持直接加购(种草二期)7/8/8=23Q2-5
7优化评价模块交互视觉,展现评价质感6/7/7=20Q2-4 / Q2-6
1商详首屏 banner 统一为「商品图 + 核心卖点」
4传递信任度:标注「正品」「核酸检测通过」等
5减少首屏干扰信息,整合服务信息
6优化背书信息为图文榜单
8整合商品推荐样式与位置,减少决策干扰
这张表里藏着一个问题

得 24 分的 3 条假设全部落在「底部导航」这一个位置上,我们把最高的期望值押在了一个点上;而 23 分档里有 4 条,横跨价格面板、倒计时、种草,分布更分散。

这个分布后来被证明是有问题的:24 分档全灭,23 分档里出了两个大赢。更合理的假设库结构应该让高分假设分布在不同机制上,而不是集中在同一个页面的同一个区域,否则一旦这个区域判断错了,就同时错失好几条假设。

4.2 一份标准实验报告长什么样

一份实验报告的标准结构

我们 6 份实验报告全部遵循同一套结构,它可以原样搬到任何 A/B 实验场景。

实验报告九段式模板
实验前 一、实验目标 · 二、实验假设(原因/假设/预计结果) · 三、实验打分(ICE) · 四、实验指标(核心/辅助/反向) · 五、实验受众 实验中 六、实验设计(对照组/实验组版本 + 流量分配 + 样本量与时长) 实验后 七、实验结果(对比数据 / 可视化 / 显著性检验) · 八、实验洞察 · 九、后续计划 其中四个设计要点值得单独拎出来: ① 三层指标体系 核心指标 → 判断成败 辅助指标 → 判断机制是否健康 反向指标 → 防止赢了指标输了体验 本案例:跳失率 ② 样本量与时长 总样本 = 单组样本 × 2 × 30 时长 = 总样本 ÷ 日均 UV 用「复购周期」做时间锚, 保证覆盖完整的用户行为链路 ③ 单一变量分流 对照组 50% / 实验组 50% 「保证两组的唯一区别 是实验改动」 + 独立的显著性检验章节
一份好报告的可读性,来自「实验前 / 中 / 后」的时间结构
概念为什么一定要设「反向指标」

只盯核心指标,很容易做出「指标赢了但业务输了」的实验:把「立即购买」按钮做得巨大且难以关闭,转化率短期上升,投诉也上升。反向指标就是守门人。

本案例里跳失率承担这个角色:加购率涨了、跳失率也涨了,说明用户是被「逼」着加购、不是被「说服」的,这个实验不能算赢。反向指标的通过与否拥有否决权。

概念显著性检验与置信度

实验组比对照组高 0.1 个百分点,是「真的有效」还是「运气好」?显著性检验回答的是:如果两个版本本质上完全一样,我们观测到这么大差异的概率有多大?概率很小(通常 < 5%)→ 判定「具备显著的统计学差异」;概率不够小 → 不能说实验组更好

本案例里两次种草实验的置信度都是 100%:在统计模型下几乎可以排除「随机波动」,实验组的优势真实存在。

重要边界:显著性只回答「这个差异是真的吗」,不回答「这个差异值得做吗」。样本足够大时,0.01pp 的差异也能显著,所以结论要同时看两件事:显不显著(真不真)+ 效应量多大(值不值)。

4.3 Q2-1 |种草一期:把「预告商详」换成「种草页」

Q2-1种草一期:预告商详 → 种草页🟢 显著ICE 7/8/8 = 23

假设

原因预告商详加购率为 10.2%(过去两周),有大量用户没有进行加购行为,猜测可能是预热形式不够吸引用户
假设通过将预热商品的详情页调整为种草内容,获得用户更多的关注
预计结果能够将预热商品加购率提升至 14%

注意「原因」这一栏的写法:先给出观测到的基线数字(10.2%),再给出一个可证伪的猜测。这是一个高质量假设应有的样子:它没有说「我们觉得页面不好看」,而是说「我们猜测是 X 导致了这个数字」。

设计

对照组 50% 首页热区 预热商品商详 选 SKU 加购 2 步 实验组 50% 首页热区 种草页 点击「加入购物车」 预热商品商详 3 步 ↑ 多一步
实验组路径比对照组多一步,这个「先天不利」的条件,反而让结论更有说服力
⚠️ 一个必须说清的客观约束

实验组用乐高搭建,当时没有行动点系相关组件,无法在种草页直接唤起 SKU 面板,因此实验组路径比对照组多一步跳转

这个约束改变了整件事

这个「被迫多一步」的约束,是理解整个案例走向的关键。也正是这个约束直接催生了 Q2-5:既然多一步都能赢,那把它去掉呢?实验的下一步应该从上一个实验暴露的约束里来,而不是从头脑风暴来。

这个事实给你的信心,比「路径更短还赢了」要强得多。因为它证明种草内容带来的价值,足以覆盖掉多一步跳转的损耗

结果

指标对照组实验组变化
首页热区点击 UV3,7942,553
种草页访问 UV2,478新增
引导商详 UV3,097694路径折叠
引导加购 UV270311
商详加购率(各商品简单平均)10.14%45.04%+344.2%
整体加购率(各商品简单平均)10.14%14.04%+38.5%
加购开单人数74117
加购转化率26.09%35.41%+35.7%
跳失率(反向指标)未劣化

显著性检验(合并口径)

版本访问数转化数转化率
A(对照组)3,0972708.72%
B(实验组)2,47831112.55%
显著性检验结论

「试验有显著的统计学差异!版本 B 的转化率比版本 A 提高了 43.96%。我们 100.00% 肯定版本 B 的改动会带来转化率提升。」

注意

这张表里出现了三个不同的提升幅度:+344.2%、+38.5%、+43.96%。这不是数据错误,而是口径不同,第 05 章会专门拆解这三个数字,这是整个案例最需要讲清楚的一节。

实验洞察

  • 通过种草内容更容易帮助用户对商品产生购买欲望
  • 通过种草后的用户整体质量较高,更容易完成转化
  • 种草内容在一定程度上可以弥补选品的劣势
  • 前后各三次实验,种草页数据有一定差距,种草内容需要持续打磨,存在优化空间
第三条最关键

第三条很容易被当成一句客套话带过,但它是整个案例最值钱的一条洞察。回到第 01 章的问题:这个业务最大的变量是「选品」。选品决定了转化率能在 0.17%~19.8% 之间摆动 100 倍,而选品是商品团队的事,增长团队管不了。

而「种草内容可以在一定程度上弥补选品的劣势」意味着:我们找到了一个自己能控制的变量(内容质量),它能部分对冲掉一个自己控制不了的因素(选品)。

决策(后续计划)

后续计划定成了三步:产出种草模板 → 乐高组件化 → 内容智能化(完整路径见第六章)。

4.4 Q2-5 |种草二期:缩短路径,让种草页能直接加购

Q2-5种草二期:种草页直接加购 + 全渠道分流🟢 显著ICE 7/8/8 = 23

假设

原因Q2-1 中种草使加购率提升 38.5%(10.14% → 14.04%)。但一期实验组路径比对照组长,猜测缩短路径后还有提升空间
假设通过将预热商品的详情页调整为种草内容,同时支持种草页面直接加购
预计结果加购率提升至 16%(相对 Q2-1 实验组再提升 2 个百分点)

设计

组别版本流量
对照组保持现有预热商品详情页展示50%
实验组采用种草页面,并提供当前页面加购行动点50%
受众调整(二期最容易被忽略的改进)

一期只在「首页入口」分流;二期改为针对商详页面分流,保证任何渠道进入商详的用户都可进入种草页。

这个改动在补一个漏洞

这个改动看起来只是技术细节,其实是在修补一期的一个方法论漏洞。二期改成针对于商详页面分配流量,等于把结论的适用范围从「单一入口」扩大到「全部入口」。判断一个实验好不好,除了看结论显不显著,还要看结论能推广到多大范围。

结果(完整 11 组)

主推商品组别访问 UV加购 UV加购率加购开单人数加购转化率
意丝美时尚聚拢文胸对照11,3411,0909.61%31528.90%
实验10,9504,10037.44%1,30031.70%
Supield 防晒爆冰裤对照9,6951,13511.71%20017.62%
实验14,8546,10041.07%1,70027.86%
colorkey 唇釉对照8,2851,28515.50%39530.70%
实验11,5025,10044.34%1,65032.35%
花果里染发对照7,9401,21015.23%34028.09%
实验6,9002,53436.72%73929.16%
悠伴空气炸锅对照11,5782,89625.01%75526.07%
实验12,2763,27726.69%89327.25%
歌兰妮香氛洗护对照12,0641,57013.01%42727.19%
实验10,7362,37722.14%77432.56%
清源堂蜂王胎对照10,3488708.40%14016.09%
实验11,1021,27311.46%34727.20%
猫人托胸神器对照8,0381,02012.68%12812.50%
实验9,1122,00722.02%41120.47%
U88 冰淇淋内裤对照13,7217445.42%15620.96%
实验9,1952,83830.86%78827.76%
纽西之谜隔离对照11,7088467.23%26431.21%
实验11,7843,72831.64%1,71245.92%
竹林鸡对照11,5871,62814.05%43726.84%
实验9,3602,52827.00%97838.68%

显著性:具备显著的统计学差距,实验结果有效,实验组明显优于对照组。

洞察

  • 二期在全渠道分流下依然复现了一期的结论,说明一期的效果不是「首页入口」这一特定渠道带来的假象
  • 加购转化率同步提升(如纽西之谜 31.21% → 45.92%),说明种草带来的是「更想买的人」,不是「被诱导点击的人」
  • 缩短路径确实有效,但效果的量级高度依赖商品与种草内容质量
读这张表要看三件事

分流是不是真的均匀? 这是读实验数据的第一动作,不是最后一步。设计是 50%/50%,但看访问 UV:

11 款里有 5 款的组间访问 UV 偏差超过 10%,最大到 53%,远超抽样波动(万级样本下随机波动的标准误通常在 1% 量级)。三个来源:① 分流单元不是「用户」而是「请求」;② 两版页面结构不同,UV 的统计边界不同(对照组计商详页,实验组计种草页);③ 实验并非严格 50/50 执行。

这不影响结论方向:加购率的差异(5%~40% 级别)远大于分流偏差能造成的影响。但它提醒我们:看实验结果,第一眼不该看「哪个组更高」,而该看「两个组是不是真的可比」。

原本难卖的品,效果最猛:U88 冰淇淋内裤 5.42% → 30.86%(+25.4pp)、纽西之谜 7.23% → 31.64%(+24.4pp)。原本就好卖的品,提升有限:悠伴空气炸锅 25.01% → 26.69%(+1.7pp)。但也有例外:清源堂蜂王胎从 8.40% 只到 11.46%(+3.1pp),是「难卖但也没救起来」的品。

这印证了一期那句「在一定程度上可以弥补选品的劣势」。注意「一定程度上」有数据支撑,不是谦辞:种草对「用户有需求但没被说服」的品最有效,对「用户根本不需要」的品无能为力。

要看「加购转化率」,不能只看「加购率」。 如果实验组只是把加购率刷上去、加购转化率掉了(加购的人不下单),那是虚假繁荣。实际结果是同步提升(纽西之谜 31.21% → 45.92%,竹林鸡 26.84% → 38.68%),说明种草吸引来的是「更想买的人」,不是「被诱导点击的人」。核心指标涨了还要看质量指标有没有同步涨,没有交叉验证的增长数字都值得怀疑。 如果实验组只是把加购率刷上去,但加购转化率掉了(加购的人不下单),那是「虚假繁荣」。实际结果是加购转化率同步提升,说明种草吸引来的是「更想买的人」,而不是「被诱导点击的人」

⚠️ 跨实验横比的口径提醒

二期的「加购率」分母是种草页访问 UV,一期的「整体加购率」分母也是页面访问 UV,两者口径接近;但一期的「商详加购率」口径完全不同(分母是种草页跳转到商详的 UV,被人为收窄)。跨实验横比时必须对齐口径,否则会得出「加购率从 45% 掉到 37%」这种错误结论。

4.5 Q2-2 |价格面板优化:突出「必买价」,无效

Q2-2视觉优化:商详价格面板🔴 不显著ICE 8/7/8 = 23

假设

原因必买商详过去两个月平均转化率 7.61%,去除选品影响后为 6%,有大量用户没有进行购买转化。猜测可能有用户当天加购了没考虑清楚,也可能有部分用户对价格敏感
假设通过调整商详的价格面板,突出价格、限时概念,激发用户购买欲望
预计结果相对原转化率提升 15%

结果(19 个主推日,节选)

主推商品对照组转化率实验组转化率差异
夏日驱蚊节6.45%7.21%+0.76pp
champion T恤2.65%2.81%+0.16pp
李霸天烤肠2.99%3.06%+0.07pp
素野心水套装2.71%2.73%+0.02pp
海澜之家4.47%4.31%−0.16pp
哈药品牌团6.66%6.11%−0.55pp
石榴节纸尿裤16.82%17.55%+0.73pp
百丽超级品牌日1.65%1.85%+0.20pp
京润珍珠品牌团6.03%5.79%−0.24pp
平均5.68%5.68%0

显著性不具备显著的统计学差异,实验未达到效果。

实验洞察

  • 突出必买价能够略微提升用户的购买欲望
  • 用户针对核心页面已经形成一定的操作习惯,很难通过视觉进行优化
这个「不显著」为什么可信

看到「不显著」,第一反应往往是「是不是样本不够?要不要再跑一轮?」这个直觉需要被纠正。在这个实验里,「没有效果」这个结论本身是可靠的。 理由有三:

设计是配对的:同一个商品、同一天同时跑两组,商品本身的影响(品牌知名度、价格带、品类)在两个组里相同,不会制造组间偏差。这比「今天跑 A、明天跑 B」强得多,后者会把时间趋势误当效果。

这是一个信息量极大的负结论:它排除了一整类动作(在成熟商详页上做价格/限时视觉强化)。但有一条边界必须记住:它排除的是价格面板的视觉呈现方式,不是价格本身。降价、发券、改价格带都是另一回事,不在这个实验的射程内。负结论的射程,取决于你改动的究竟是哪个变量。

4.6 Q2-3 |底部行动按钮优化:引入客服、弱化商家入口,无效

Q2-3视觉优化:底部行动按钮🔴 不显著ICE 8/8/8 = 24

假设

原因商详转化率低,猜测用户对商品有顾虑,也可能购买引导性不强
假设通过调整底部行动按钮,引入客服、弱化商家入口、突出购买操作,引导用户下单行为
预计结果相对原转化率提升 15%

结果(20 个主推日,节选)

主推商品对照组转化率实验组转化率差异
夏日驱蚊节7.00%6.47%−0.53pp
champion T恤2.75%2.71%−0.04pp
李霸天烤肠3.03%3.03%0
素野心水套装2.71%2.72%+0.01pp
海澜之家4.50%4.29%−0.21pp
石榴节纸尿裤17.28%17.08%−0.20pp
Move Free 益节7.03%6.30%−0.73pp
COLORKEY 珂拉琪8.09%8.33%+0.24pp
平均5.81%5.74%−0.07pp

显著性不具备显著的统计学差异,实验未达到效果。

实验洞察

  • 用户针对核心页面已经形成一定的操作习惯,很难通过视觉进行优化
  • 底部行动按钮的突出,对商详转化率影响较弱
执行偏差:我们自己记下的那一条

「本次实验组并没有完全按照实验方案的视觉效果实现,为进一步验证,可以后续调整后再次观察一个周期。」

这句话后来被兑现了:按修正方案补跑了一个周期,结论没有改变。于是它从「执行没到位」归位为「假设错了」:底部行动按钮的强化,在这批用户身上确实不产生转化增量。

失败有两种,必须分清
失败类型含义后续动作
假设错了这个方向本身不成立归档,不再尝试,节省未来的试错成本
执行没到位方案没被正确实现,测的不是想测的东西修正后重跑,不能就此判死

两种情况在数据上长得一模一样(都是「不显著」),区分它们只能靠执行过程的记录。我们在报告里明确写下了执行偏差,并在结论里保留了再次验证的可能性,而不是草率宣布「此路不通」。

通用做法:每份报告都应该有一栏「执行保真度(fidelity)」:这次实验,实际跑的和设计的差了多少?缺了这一栏,你会把「执行问题」误判成「方向问题」,永久性地放弃一条本来可行的路。

4.7 Q2-4 / Q2-6 |评价面板优化:无效

Q2-4 / Q2-6视觉优化:评价面板🔴 不显著ICE 6/7/7 = 20
原因商品评价基本占据第二屏,可能增加用户继续浏览商品的难度
假设通过优化评价面板的交互视觉,展示更好的评价质感
预计结果相对原转化率提升 15%
结果已跑完,无显著效果;原始数据未留存

两个编号(Q2-4 与 Q2-6)的实验设计完全一致(同一假设、同一方案、同一指标),属于编号管理上的重复;而 ICE 评分最低(20 分)的假设,反而占用了两个实验编号,评分更高的 24 分档假设却挤在同一份报告(Q2-3)里一起验证。排期恰好反过来了。

这条值得记的不是结果,是流程

高分假设应该拿独立资源和独立编号(它更可能赢,值得更干净的验证);低分假设要么合并、要么延后。这类问题的根因通常不是能力问题:假设库由一个人维护,实验排期由另一个人安排,两边没有交叉核对。解法很简单:排期前过一次假设库,确保「高分优先、编号唯一」

还有一处教训:这两次实验没有留存原始数据,只留下了结论。数据不留存,结论就无法复核,也没法在后来做口径重建。

4.8 六次实验的整体结论

实验类型ICE结果关键结论
Q2-1内容改造23🟢 显著种草页使整体加购率 +38.5%,加购转化率 +35.7%
Q2-5路径优化 + 内容23🟢 显著全渠道分流下复现,缩短路径有效
Q2-2视觉优化(价格面板)23🔴 不显著必买价概念仅「略微」有效,不足以改变决策
Q2-3视觉优化(行动按钮)24🔴 不显著突出按钮对转化率影响弱
Q2-4视觉优化(评价面板)20🔴 不显著无显著效果,数据未留存
Q2-6视觉优化(评价面板)20🔴 不显著与 Q2-4 重复
ICE 得分 × 实验结果:排序工具不等于预测工具
失败 不显著 显著 20 分 23 分 24 分 Q2-4/6 不显著 Q2-2 不显著 Q2-1 大赢 Q2-3 不显著 得分最高的实验(24 分)失败了, 得分相同的 23 分实验大赢
结论

ICE 是排序工具,不是预测工具:它决定「先做哪个」,不决定「做了会不会成」。

纵轴为实验结果的定性分层;横轴为 ICE 总分

三条硬结论

① 「改视觉」和「改内容」,是两个量级的杠杆

四次「视觉类」实验(Q2-2、Q2-3、Q2-4、Q2-6)铺在商详的四个区域上,没有一次跑出显著效果(其中价格面板与底部行动按钮的转化率变化都在 ±0.8 个百分点以内);一次「内容类」实验(Q2-1),加购率提升 3.9 个百分点、加购转化率提升 9.3 个百分点,100% 置信。

原因不难理解:视觉优化改变的是「同样的信息怎么摆」,内容改造改变的是「用户看到的是不是他真正需要的信息」。前者动的是皮,后者动的是里。

要注意边界:这个结论的前提是「用户已经熟悉这个页面」。在全新的页面或全新的用户触达上,视觉与信息架构的作用会完全相反。「视觉没用」不是普适真理,它有前提。

② ICE 打分和实验结果之间,几乎没有相关性

看上面那张总表就够了:ICE 最高的 24 分(Q2-3)失败,同为 23 分的 Q2-2 失败、Q2-1 大赢,ICE 最低的 20 分(Q2-4/6)也不显著。ICE 是排序工具,不是预测工具。 它的价值在于「防止团队只做最容易做的那件事」,而不在于「保证高分实验一定能赢」。

换个角度看 ICE:它到底还有没有用?有,但要重新理解它的作用。ICE 解决的是资源分配的政治问题:没有打分时,谁嗓门大做谁的、谁的技术方案好实现做谁的;ICE 给了一个可以争论的公共依据:不争「要不要做这个」,而争「这个的 I、C、E 各是几分」。把主观分歧转化成可讨论的参数,这本身就是价值。

它不能解决的是「预测」:增长机会的收益分布是长尾的,大部分动作没效果、少数效果巨大,而「哪些是那少数」事前无法判断。所以有效策略不是提高预测准确率,而是提高尝试次数

③ 失败的实验同样产出了资产

两个失败实验共同给出了一个可迁移的判断:用户在成熟核心页面上的操作习惯,是视觉优化的天花板。 这条结论此后可以直接用来否决同类提案,节省的试错成本本身就是收益。

这是「负结论的价值」在本案例里的第一次体现:一个失败的实验,如果能让你在未来一年内快速否决 5 个同类提案,它的价值超过一个侥幸成功的实验。

可惜大部分团队的负结论没有被归档,只留在报告里,没有进入「提案评估清单」。于是同一个方向被不同的人反复提出、反复试验、反复失败。

05口径:被路径偷走的那个数字

实验赢了,但「赢了多少」这件事,为什么会说不清?这是整个案例最需要讲清楚、也最容易被讲错的一节。

5.1 同一个实验,四个「提升幅度」

Q2-1 这一个实验,报告里同时出现了三个数字;如果再换一种聚合口径,还能算出第四个:

口径数值提升分母是什么
商详加购率10.14% → 45.04%+344.2%实验组 = 从种草页点击「加入购物车」跳转到商详的 UV
整体加购率10.14% → 14.04%+38.5%实验组 = 种草页访问 UV(与对照组首页热区 UV 可比)
显著性检验转化率8.72% → 12.55%+43.96%合并口径(转化数 ÷ 访问数)
〔补算口径〕聚合口径7.12% → 12.18%+71.1%加购 UV ÷ 首页热区点击 UV(3,794 → 2,553)
口径可以有四个

第四个数字是我们后来补算的。它不是「更对」的口径,而是为了说明一件事:同一个实验能报出几个提升幅度,完全取决于你有几种分母可选。

5.2 +344.2% 是怎么来的,为什么它不能对外说

实验组的路径是「种草页 → 点击加入购物车 → 跳转商详」。也就是说,只有已经表达了加购意愿的用户,才会进入商详页。分母被人为收窄,比率自然被放大。

同一段路径,两种分母:+344% 是怎么被「造」出来的
对照组 首页热区 3,794 商详 3,097 加购 270 → 加购率 8.72% 分母 = 所有进来的人 实验组 首页热区 2,553 种草页 2,478 点击加购 → 商详 694 加购 311 311 ÷ 694 = 45.04% 分母已被路径折叠 不是数据造假,但如果拿 344% 去汇报,就是在用口径差异冒充增长
路径一改,中间节点的「人群构成」就变了,同样叫「商详 UV」,指的不是同一群人
概念改动路径时,为什么口径一定会失真

任何比率类指标,本质都是 分子 ÷ 分母。分母定义的是「在谁身上发生的转化」。

  • - 对照组进入商详的人 = 所有对商品有点兴趣的人(大池子,含大量「随便看看」的人)
  • - 实验组进入商详的人 = 只有「愿意点加入购物车」的人(已经被筛过的池子)
    • 对照组进入商详的人 = 所有对商品有点兴趣的人
    • 实验组进入商详的人 = 只有「愿意点加入购物车」的人

通用规则:只要是「以路径中间节点为分母」的比率,一旦改动路径全部作废,必须回到路径起点的同一口径(比如「首页热区点击 UV」)重新计算收益。

正确结论

对外可用、横向可比的数字是 +38.5%(整体加购率)与 +43.96%(显著性检验口径)。

5.3 增量到底有多少:把账算到订单

这是从「实验指标」到「业务结果」的最后一公里,也是讲解一个案例时最应该补齐的部分。

从实验指标到业务结果的三层折算
第一层 · 加购的人更多了 加购率 10.14% → 14.04% +3.90 个百分点(相对 +38.5%) 第二层 · 加购的人质量更好了 加购转化率 26.09% → 35.41% +9.32 个百分点 第三层 · 折算到单日订单量 ≈ 110 单 / 主推日 8,000 × 3.90% × 35.41% 计算过程 预热期日均访问 UV ≈ 8,000 每日新增加购用户 ≈ 8,000 × 3.90% ≈ 312 人 这 312 人按 35.41% 转化 ≈ 110 单 / 主推日 两个效果是叠加的:加购的人更多了(+38.5%),加购的人质量也更好了(+9.32pp)。
增长的绝对值,来自「率 × 量」两个数的乘积
这个链路测算说明了什么

① 增长的绝对值,来自「率 × 量」两个数的乘积。 转化率提升 3.9pp 听起来不小,但乘以每天 8,000 的预热 UV,结果是 312 个加购用户,一个在 21 万日 UV 的盘子面前并不算巨大的数字。 这为第 07 章要算的那笔缺口账埋下了伏笔。

5.4 哪些结论不能归因

不能归因的说法原因
「种草页带来了 344% 的加购增长」口径失真,分母被路径折叠
「种草内容可以完全替代选品」我们自己当时的表述是「在一定程度上可以弥补选品劣势」;悠伴空气炸锅仅 25.01% → 26.69%、清源堂蜂王胎仅 8.40% → 11.46% 就是反例
「种草效果已经稳定」我们自己的记录是:「前后各三次实验,种草页数据有一定差距,种草内容需要持续打磨」
「底部按钮优化彻底无效」实验组未完全按方案实现;按修正方案补跑一个周期后结论未变,可以判死
「这一仗打赢了」见第 07 章:实验验证了方向,当时阶段进度 75%,后面那一段靠产能补上,全年目标最终达成并超额

06放大:从一次实验到一套基建

一个实验赢了,只是拿到了「这条路能走」的证据。增长的杠杆在于能不能把它变成可复制的产能。

6.1 种草内容的类型学

项目组产出了四类种草内容范式,并标注了各自的适配品类:

类型内容形态适配品类
A. 图文故事类图文 + 故事 + 社会反馈,故事人格化、真实可信赖(要让用户感受到「真实在使用这个产品」)通用全品类
B. 视频讲解类视频讲解、试穿上身效果,更直观高效,可配合搭配推荐其他商品服饰
C. 社交互动聊天类互动、聊天、音频、问答,营造真实感与亲近感全品类
D. 社会认同类品牌背书、专业权威、品质保障(欧盟标准、HACCP、100% 进口、母婴专家等)母婴、保健、食品
四类内容的共同内核

注意 A 类描述里那句「一定要让用户感受到我们是真实在使用这个产品」。这是四类内容的共同内核:它们都在提供「可信的使用者视角」,只是载体不同(图文 / 视频 / 对话 / 权威背书)。

这也解释了种草为什么在这类业务里有效:用户面对一个还未开卖的商品,缺的不是信息,是「别人真的用过并且说好」。商品详情页给的是规格,种草内容给的是证据

6.2 种草页面的组件设计

组件设计要点
商品图片展示精而全,多角度 / 特写
标签化核心卖点可对标签做精细化运营
产品故事描述基础功能、核心体验要素与使用过程的整体感受
真实用户使用反馈真实感来源
问答承接用户顾虑
其它必买推荐往期主推过的必买商品池(近 7 天)
加购引导全程置顶显示,通过券、云币作为钩子吸引加购(有预算约束)
基础信息

同时提出了制定标准的三步:提炼好故事的核心要素 → 各品类优秀案例分析 → 制定标准,赋能行业与品牌方。

一个值得注意的设计

「加购引导全程置顶」这一条,直接对应第 01 章讲的业务机制:种草页的核心任务不是「讲清楚商品」,而是「让用户现在就加购」。所以加购入口必须始终触手可及,且要给它一个即时理由(券、云币)。

括号里那句「有预算约束,预算计划来源行业、品牌方,待洽谈」也值得注意:它说明我们当时清楚这个钩子的成本结构。用券换加购,本质是「用毛利买确定性」,要算得过账才能持续。

6.3 三阶段落地路径

PHASE 01
产出种草模板
必买项目组产出模板 → 行业线宣导 → 乐高快速验证
解决:从「只有必买小组会做」到「行业线照着能做」
PHASE 02
乐高组件化
行业线逐步沉淀 → 必买小组沉淀规范化组件 → 提供更便捷的搭建方式 → 应用到其他模块
解决:从「每次手工搭」到「组件拼接」
PHASE 03
内容智能化
关联达人推荐后台编辑内容 & 达人推荐内容 → 自动填充乐高组件 → 丰富种草内容
解决:从「人工写内容」到「达人内容自动填充」
这条路径的设计逻辑

先用人工跑通验证,再用模板扩散,再用组件产品化,最后用算法填充。每一阶段都在解决上一阶段暴露的瓶颈,而不是一上来就做「智能种草中台」。

大多数团队在实验成功后,要么写结案报告就结束(浪费了验证成果),要么直接立项做「内容中台」(通常因跨度过大而失败)。我们选的是第三条路:把「这次的产出」直接变成「下次的输入」

一次实验带来 3.9pp,一次基建能让 3.9pp 出现在 100 个商品上。可复制的产能,才是增长复利的来源。

6.4 产品化:种草 V2.0 方向

原有模块入手做「重灾区」治理,核心目标是提升人效、降低错误率

优化项内容
优化 1头图三个标签固化,需带动效果 / 可移动(参考小红书标签)
优化 2倒计时模块
优化 3底部导航增加正式期应用
优化 4多图叠加 / 拼接 / 可滑动(参考美图秀秀)
其他字体错误、标题错误、正文错误等

同时规划了三个新方向:正式期如何应用种草内容全渠道创新、以及从「原有模块优化」走向「种草产品化」。

一个阶段切换信号

注意「重灾区」和「降低错误率」这两个词。它们说明样本量放大之后,瓶颈已经从「内容好不好」转移到「生产不出错」

这个切换如果没做对,会出现「规模化即失效」:一次精雕细琢的种草页很好,100 个粗制滥造的种草页会把品牌形象拖垮。

6.5 规模化后的两个新命题

走到规模化这一步,我们拿到了两条关键结论,标志着眼光的转移:

命题一流量聚焦的价值
「云集必买上线后日均 UV 达到 21 万,较上线前主站每日主推活动的日均 UV 8.7 万,提升了 1.4 倍。说明流量聚焦与否,差异明显。」
命题二选品的杠杆量级
「云集必买的成交转化率平均值为 7.2%,最高可达 34.26%,最低仅为 0.17%。云集必买选品,商品差异性直接影响到流量的转化率。」

以及项目定位的一句话总结:「必买定位:打造服务商舒适圈」,节奏上明确 「一期核心:必买商详转化率提升;二期核心:种草」

一个值得追问的战略问题

第二条结论和第 02 章的「去噪」是同一件事的两面。第 02 章的结论是「必须去噪,否则指标不可用」;这里的结论是「选品本身就是一个需要被管理的增长变量」。

那么增长资源是否应该更多地投入到「选品机制」上?我们的答案是「两手都做」:页面优化(种草)是可复制的,选品是不可控的,所以重点做了可复制的那一个。

07结果:打到哪一步,以及缺口怎么补上

这一章回答两个问题

项目推进到那个阶段,战果到底怎么样?还差的那一段,后来靠什么补上?

大部分增长案例分享会停在「我们做对了什么」,或者反过来停在「我们哪里没做好」。这个案例的信息量恰恰落在两者之间:做对的那部分已经被 100% 置信的实验验证了,而进度条当时停在 75%(全年目标最终 100% 达成并超额)。这两件事同时为真,它们不矛盾,也不是失败信号。

7.1 战果盘点

维度数据判断
流量聚焦日均 UV 21 万(上线前 8.7 万),提升约 1.4 倍✅ 模块立住了
核心实验整体加购率 +38.5%,加购转化率 +35.7%,100% 置信✅ 方向被验证
复现性二期在全渠道分流下复现一期结论✅ 结论可推广
方法论沉淀假设库 + ICE + 实验报告模板 + 6 份完整报告✅ 能力建成
内容基建4 类内容范式 + 8 个页面组件 + 三阶段路径✅ 可复制产能
业务目标年度目标 2.5 亿,截至该阶段累计完成 1.9 亿,进度 75%(全年最终达成并超额)⏱ 阶段性进度

7.2 先把 75% 这个数字的口径说清楚

这是一个阶段进度快照,不是全年结论。

年度目标 2.5 亿 vs 截至该阶段累计完成 1.9 亿
年度目标 2.5 亿 当前进度 1.9 亿 余下的 0.6 亿:靠产能铺开走完 「75%」不是「做不动了」,而是 12 个月曲线上走到了四分之三;全年收官时目标 100% 达成并超出。
目标是一整条曲线,进度是曲线上的一个点

「75%」最容易被读成「只做到四分之三、剩下的做不动了」,它实际的含义是:在一条 12 个月的曲线上,此刻站在四分之三的位置。目标是一整条曲线,进度是曲线上的一个点,用一个时点的进度去判定整条曲线好不好,读法本身就错了。

一句话收口:75% 是这条 12 个月曲线上的一个中途点,不是终局。后面的周期里,年度目标 100% 达成,并且超额。

7.3 差的这一截从哪来:三个原因

  • 实验的作用域太窄 这一系列实验全部作用在预告期 → 加购这一段链路上。而北极星指标是订单量,它由「商详订单量 + 购物车订单量」共同构成。预告期加购只影响「购物车订单量」的一部分,正式期的商详转化、导流商品的转化、复购,这一轮全都没动。 用因子分解树来看:我们只优化了树上的一个枝杈,而且是末端的一个枝杈。
  • 实验周期太短,累计影响天数有限 每个实验跑 6~7 天。Q2 一个季度里,6 个实验串行推进,真正「在被优化的天数」其实不多。而 2.5 亿是一条持续 12 个月的曲线,用几个 7 天的窗口去撬动一条年度曲线,量级上就不匹配。
  • 单点效果的绝对值,填不平缺口 结合第 05 章的测算:每天新增约 312 个加购用户、折算约 110 单,即使这个效果 100% 稳定、全年无休地生效,也只能覆盖缺口的一小部分。
  • 这条测算的价值

    它提前说明了一件事:缺口不可能靠「再多做几个实验」来填。

    实验成功是「局部最优被验证」,业务达标需要的是「多个局部最优被同时铺开并规模化」。

    这个案例完成的,是把一个「可能性」变成了「确定性」:证明了「种草内容能提高加购率」这件事是真的。从「确定性」到「规模」的跨越,靠的是第 06 章那套基建,而不是更多的实验。

    7.4 缺口后来靠什么补上

    三个原因指向同一个动作:把已经验证过的单点结论,变成可以铺开的产能。

    补法具体做了什么
    从单场景到全渠道一期只在必买场景验证的结论,二期在全渠道分流下重新跑并复现,它因此从「一个页面的效果」变成「一套跨场景可用的机制」
    从手艺到基建第 06 章那套「模板 → 组件 → 智能化」:4 类内容范式 + 8 个页面组件,让种草不再依赖某个运营的手感
    从预告期到全场景一期核心是商详转化率,二期把核心切成种草,把只作用在预告期那一段的效果,铺到更多商品、更多流量入口上

    日均 UV 从上线前的 8.7 万涨到 21 万,盘子本身在变大;机制铺开之后,同一个提升率作用在更大的流量上,绝对值才会跟着涨。

    所以那 0.6 亿是怎么被填上的

    它不是被「下一个实验」填平的,是被产能填平的。 这条曲线的前一段靠验证,后一段靠放大。这也正是当时的节奏安排:一期做商详转化率,二期做种草。

    后面的事实印证了这条路径:年度目标最终 100% 达成,并实现了超额。

    7.5 增长工作的「最后一公里」

    从这个过程里可以抽出一条判断,它对所有做增长的人都适用:

    阶段你在解决什么产出的东西时间差
    验证这条路能不能走通?一个显著的实验结论立即可见
    放大怎么让它覆盖更多场景?模板、组件、流程滞后 1~2 个季度
    兑现怎么变成绝对值的增长?业务目标达成滞后更久
    所以评估一个增长项目,不该只问「实验显不显著」,该问三个问题

    1. 结论被验证了吗?(真不真

    2. 结论能被复制到多少个场景?(广不广

    3. 复制的产能,什么时候能变成绝对值?(快不快

    这个案例在前两问上是高分;第三问的答案是产能。它比实验慢,但把剩下的进度走完的正是这一段,后来也确实走完了:年度目标 100% 达成,并超出。

    08对照:换你会怎么做

    怎么读这一章

    学习一个案例最有效的方式,不是记住它做了什么,而是看清「在每一个分岔点上,我们选的那条路和「不加思考会选的那条路」,差在哪里」。

    下面这张表,是这个案例里六个关键的分岔点。左列是不加思考时最容易走的那条路,右列是我们实际走的路,中间一列是做出这个选择的依据

    #分岔点不加思考会走的路我们实际走的路差在哪
    1 面对「转化率低」 立刻开始想优化方案(「页面太丑了」「按钮不够大」) 先定北极星 → 因子分解 → 算弹性,先决定「压哪个变量」 直觉在解「怎么改」,我们在解「改什么」。先选对问题,再谈解法
    2 面对一堆数据 直接取平均值,和上期对比 先做四分位去噪,剔除选品造成的高方差噪声 直觉默认「每期数据可比」,我们知道每天的商品都换了
    3 面对多个假设 优先做「最容易实现」的那个 ICE 打分排序,按总分推进 直觉服从实现成本,我们服从期望价值(虽然 ICE 也不准)
    4 面对「怎么提转化」 改 UI / 改视觉 / 加按钮动效 内容(把商详换成种草页) 直觉改「信息怎么摆」,我们改「用户拿到了什么信息」
    5 面对实验结果 挑最大的那个数字汇报(+344%) 拆出四个口径,选能对外说的那个(+38.5%) 直觉在取悦汇报对象,我们在保护结论的可比性
    6 面对实验成功 写结案报告,进下一个项目 转成模板 → 组件 → 智能化三阶段基建 直觉把成功当终点,我们把它当生产资料
    这六条里,最容易做到、也最容易忽略的是第 2 条和第 5 条

    第 2 条(去噪)之所以难,是因为它要求你承认「你的数据暂时不可用」。 承认这一点是反直觉的:大多数人拿到数据就开始分析,而不是先问「这批数据能不能比」。

    第 5 条(口径)之所以难,是因为它要求你主动放弃一个更好看的数字。 而「更好看的数字」通常正是汇报现场最容易被奖励的东西。

    如果只能带走一条

    增长工作的核心竞争力,不在于「能想出多少点子」,而在于「能在多小的代价下知道自己错了」。 本案例里的每一步(定北极星、拆指标、去噪、算弹性、做 A/B、纠口径)服务的是同一件事:让判断尽可能快地被现实修正。

    09可复用方法论

    从这一个案例里,可以抽出 8 条能迁移到其他业务的打法。每一条都配了一个自检问题,方便你对照自己的场景。

    1. 先定义「赢」,再找漏点

      北极星指标不是选「最重要的指标」,而是选「最该被撬动的指标」。购买频次和留存率看起来更「重要」,但因为它们是滞后指标而被排除。无法指导当下动作的指标,不适合做北极星。

      自检问题:如果这个指标没达成,我能不能立刻列出三件具体该做的事?

    2. 用因子分解把指标拆到「能动手」的颗粒度

      订单量 → 必买商品订单量 + 导流商品订单量 → 商详订单量 + 购物车订单量 → UV × 转化率 × 下单次数 → 各入口 UV。拆解的终点是「一个可以被单独做 A/B 的变量」,拆不到这一层,就没法做实验。

      自检问题:拆到最后一层,每一个因子我都能单独改吗?

    3. 核心变量受高方差因素影响时,必须先分层或去噪

      选品方差(转化率 0.17% ~ 19.8%,跨度 100 倍)会完全淹没真实信号。用四分位过滤剔除极端值,是让数据可用的前提。

      自检问题:这批数据里,有没有一个我控制不了、但它每天都在变的因素?

    4. 比较「弹性」,而不是比较「总量」

      判断该压流量还是压转化率,不能看哪个数字大,要看把每个变量推到上限能多拿多少结果:UV 推到上限 → 14,757 单;转化率推到上限 → 19,490 单。弹性 = 空间 ÷ 当前值。

      自检问题:我准备投的这个方向,把它做到满分能带来多少增量?换成另一个方向呢?

    5. 假设库 + ICE:先排序,再验证;但别指望它预测

      用「如果…预计…因为…」的标准句式写假设,用 ICE 排序。但要清楚:ICE 决定「先做哪个」,不决定「做了会不会成」。 本案例中 24 分的实验失败、23 分的实验大赢,就是最好的证明。

      补充动作:高分假设要分散在不同的机制上,而不是集中在同一个页面的同一个区域(本案例 24 分档全落在「底部导航」,结果全灭)。

      自检问题:我的假设库里,最期待的那几条,是不是都改的是同一个地方?

    6. 改「内容」的杠杆量级,通常远大于改「视觉」

      在成熟核心页面上,视觉优化的空间会被用户的既有操作习惯吃掉。四次视觉类实验(价格面板、行动按钮、评价面板)全部不显著,一次内容改造即拿到 100% 置信的增量。

      迁移判断:要改的是一个用户已经形成肌肉记忆的页面时,先问「这是信息问题还是摆放问题」;摆放问题,收益大概率在噪声范围内。这条结论的前提是「用户已熟悉该页面」,全新页面或全新触达场景下,视觉与信息架构的作用会完全相反。

    7. 路径一改,口径必须重建

      当实验改变了用户路径时,以路径中间节点为分母的所有比率都会失真。必须回到路径起点的统一口径去计算收益,否则会拿到一个漂亮但无法对外说的数字。

      自检问题:这次改动的受益人群,和上次统计的人群,是同一批人吗?

    8. 负结论要归档成「否决清单」

      两次失败的视觉实验,产出的价值不在于「证明了什么有效」,而在于「证明了一整类事情无效」。把它们沉淀成一条可快速引用的否决依据,能省掉未来反复试错的成本。

      自检问题:我们团队上一季度失败的实验,现在还有人知道结论吗?下次有人提出同类方案,我们能不能一眼否掉?

    10如果重来一次

    这张表不讨论哪一步做错了,只回答一个问题:同一批人、同一块资源、同一块牌桌,重做一次,会在哪六件事上做出不同的选择。

    事项我们会怎么做
    会更早做的 一期就直接做「种草页内加购」,而不是先跳转再转化。一期受组件能力限制,被迫多加一次跳转,等于用一个较低的天花板验证了正确方向,之后又花一整轮实验把路径补回来。
    会调整的 价格面板、行动按钮、评价面板这四次视觉实验合并成一轮,用同一个大流量池同时测多个组件变体,而不是拆成四份报告、占掉两个季度。
    会砍掉的 评价面板实验(ICE 只有 20 分,和订单量的关系也最远)直接降级为长期优化项,不占实验排期。
    会补上的 ① 站外流量与内容分发渠道的验证:当时这块完全空白,是最大的未被探索空间;② 「种草内容质量」与效果的定量关系:我们已经知道内容要持续打磨,但内容质量本身从来没有被指标化,优化只能凭感觉。
    会加强的 ① 反向指标(当时只有跳失率一个守门指标);② 实验的分流均匀性校验(二期多款商品出现了组间访问 UV 偏差超 20%);③ 每份报告增加「执行保真度」一栏,用于区分「假设错了」还是「执行错了」。
    会重新考虑的 把「选品」从背景条件提升为一级杠杆。转化率在 0.17%~34.26% 之间摆动 200 倍,这个摆幅比任何页面优化的效果都大一个量级。

    这六条可以分成两类。会更早做、会调整、会砍掉这三条,是当时受组件能力、排期节奏和立项标准限制而不得不做的取舍;会补上、会加强、会重新考虑这三条,是当时根本没有意识到的盲区:站外渠道没测、内容质量没有指标化、分流均匀性没有校验、「选品」的杠杆级别被低估。

    前一类可以靠在事前准备得更充分来避免,后一类只能靠事后复盘来发现。这就是这份复盘最实际的用处。

    附录

    附录 A:完整假设库(13 条)

    这是 Q2 当时的全部假设,共 13 条。状态列本身就是一条结论:

    #假设(如果 / 预计 / 因为)ICE状态
    1商详首屏强调核心卖点,减少 5% 跳出、间接提升约 0.5% 转化率已排除
    2打造「必买价」概念(对比必买价/日常价/特卖价),提升约 1% 转化率8/7/8=23已证伪1
    3突出限时倒计时,提升约 1% 转化率8/7/8=23已证伪1
    4传递信任度(正品/核酸检测等标签),提升 1% 转化率已排除
    5减少首屏干扰信息,减少 5% 跳出已排除
    6优化背书信息为图文榜单,提升 1% 转化率已排除
    7优化评价模块展示样式,提升 1% 转化率6/7/7=20已证伪2
    8整合商品推荐样式与位置,减少决策干扰,提升 1% 转化率已排除
    9底部导航优先展示客服入口,提升 1% 转化率8/8/8=24已证伪
    10底部导航去除商家入口,提升 1% 转化率8/8/8=24已证伪
    场景化引导按钮(预告突出加购 / 正式突出购买)8/8/8=24已证伪
    预告商品改为种草内容(一期)7/8/8=23已验证
    种草页支持直接加购(二期)7/8/8=23已验证

    1 第 2、3 条由 Q2-2(价格面板)直接实验证伪。
    2 第 7 条(Q2-4 / Q2-6)跑过,无显著效果,但原始数据未留存。

    13 条假设里,拿到正向结果的 2 条;被实验判为无效的 6 条(2、3、7、9、10 与场景化引导按钮);剩下 5 条(1、4、5、6、8)随「改视觉」这一族整体排除,没有再单独验证。

    两个状态词是刻意分开的:「已证伪」是实验跑完之后的结论,「已排除」是资源上的决定。 第 1~8 条整体划掉,依据是四次视觉类实验(Q2-2、Q2-3、Q2-4、Q2-6)加上「用户已经对核心页面形成操作习惯」这条洞察:同一个页面区域上的视觉调整,不值得再花一个实验周期。 这张表里没有「没做完」的灰色地带。

    这个比例不是「命中率低」,而是假设库的正常样子:它的作用从来不是提高命中率,而是让团队在同一张表里同时看见「值得做的」和「已经排除的」。

    附录 B:关键数据速查

    正文里散落的关键数字集中在这里,方便单独引用和核对。

    Q1 基线数据:去噪前 vs 去噪后

    口径必买商详 UV转化率下单次数
    去噪前 平均197,9217.61%1.18
    去噪前 最大319,02019.80%1.4
    去噪前 最小50,6720.17%0.9
    去噪后 平均210,0266.00%
    去噪后 最大245,9509.28%
    去噪后 中位209,7903.80%

    站内流量结构与平台分布

    来源页面占比转化率效率判断
    首页41%6.23%
    鸡场主页36%0.14%极低
    会员中心15%0.38%极低
    商品详情页5%3.70%
    搜索页2%11.48%高(但量小)

    按平台:APP 177,060(83.21%)| H5 17,357(8.16%)| 小程序 15,706(7.38%)| VIP 2,656(1.25%)

    Q2-1 核心战果与四个口径

    口径对照组实验组变化
    整体加购率(各商品简单平均)10.14%14.04%+38.5%
    加购转化率26.09%35.41%+35.7%
    显著性检验转化率8.72%12.55%+43.96%
    商详加购率(口径失真)10.14%45.04%+344.2%(不可用)
    聚合口径(补算)7.12%12.18%+71.1%
    统计置信度100.00%

    规模化后的整体表现

    指标数值
    必买上线后日均 UV21 万(上线前 8.7 万,提升约 1.4 倍)
    成交转化率 平均 / 最高 / 最低7.2% / 34.26% / 0.17%
    目标 / 完成 / 达成率2.5 亿 / 阶段 1.9 亿(进度 75%)→ 全年达成并超额
    项目定位打造服务商舒适圈
    节奏一期核心:必买商详转化率提升;二期核心:种草

    附录 C:术语表

    读正文时如果遇到不确定的术语,回这里查。「在本案例对应」一列给出它在这次业务里的具体所指。

    术语一句话解释在本案例对应
    因子分解把大指标按业务运算关系逐层拆到可单独做 A/B 的变量订单量 → UV × 转化率 × 下单次数
    弹性把变量推到上限能多拿的结果 ÷ 当前结果UV 14,757 单 vs 转化率 19,490 单
    ICE 打分Impact 影响 × Confidence 概率 × Ease 难度的 10 分制加总,用于排序假设库的排序依据
    反向指标防止「赢了指标、输了体验」的守门指标跳失率
    加购率加购 UV ÷ 预告页访问 UV,衡量预热期的意向下单率两次种草实验的核心指标
    加购转化率加购用户中最终成交的比例,衡量意向的兑现质量26.09% → 35.41%
    口径一个指标的分母定义了什么人群,口径不同数字不可比同一个实验报出的四个数字
    执行保真度实际执行与实验方案的偏差程度,决定失败是「假设错」还是「执行错」底部导航实验:补跑后仍无效,归为假设错

    附录 D:数据口径说明

    跨表引用数据前请先看这里

    1. 所有「提升幅度」都标了口径,跨实验比较时请先确认分母定义是否一致。

    2. Q2-2 / Q2-3 的转化率取的是各主推日的平均值,与逐商品明细的简单平均会有微小差异。

    3. Q2-5 的加购率是「加购 UV ÷ 访问 UV」的组内聚合值,与一期的「各商品简单平均」口径不同,不可直接横比

    4. Q2-1 的「商详加购率」分母被人为收窄,属于失真口径,只作说明保留,不用于任何对外表述

    5. 目标 2.5 亿 / 已完成 1.9 亿是项目推进到该阶段时的累计口径,75% 是阶段性进度,不是全年结论;该阶段之后,年度目标 100% 达成并超额。

    6. Q2-4 / Q2-6 已跑完,结论为无显著效果,但原始数据未留存,故正文与附录不列其明细。

    云集「必买」增长项目 · 完整案例讲解。

    如果只带走一条,就带走这一条:增长工作的核心竞争力,不在于能想出多少点子,而在于能在多小的代价下知道自己错了。