序怎么读这个案例
先用一句话讲完,再告诉你这里有三层东西可以拿,最后给你一条贯穿全文的线。
在一个已经转向存量、用户数还在下滑的赛道里,我们放弃抢新流量,把「转化率」拆到能动手的颗粒度,剔掉选品噪声后发现转化率才是弹性最大的一环;然后用 6 次 A/B 实验逐条验证假设,其中「把商详换成种草页」拿到 100% 置信的增量;最后把这一次成功的实验,推成了一套可复制的种草内容基建。
但故事真正的落点在最后:实验赢了,进度条一度停在 75%,而补上那一段的不是下一个实验,是产能。年度目标最终 100% 达成,并实现超额。
三个层次,三种读法
同一个案例,不同角色能拿走的东西不一样。先确认你在哪一层。
为什么这个案例「难」
它不是那种「做了个活动数据翻倍」的爽文。难在三处:
如果你只想拿一条走,拿第三条:资源不该押在「空间最大」的地方,而该押在「能最快知道对错」的地方。
一条贯穿全文的线
全篇按这条主线推进。读的时候可以顺着追,每一章都在这条线的某一环上。
大部分案例分享会停在「我们做对了什么」。这个案例真正的信息量在最后一环:做对了之后,怎么让它对业务目标起作用。 第 07 章专门回答这个问题。
一页纸速览
01战场:先看懂这块牌桌
在看任何动作之前,得先知道这场仗是在什么地形上打的。
1.1 必买是个什么业务(这是理解全案的钥匙)
这是理解后面所有动作的前提。它回答一个很具体的问题:为什么两个成功的实验,打的都是「加购率」,而不是直接打「转化率」?
「必买」是云集的一个 每日主推一款商品 的模块。一天一个主角,所有流量往这一个商品上灌。这就决定了它的业务流程是 两段式 的:
为什么这个机制如此关键?
「加购成交率远大于必买商品转化率,说明 加购对后期转化行为有了大幅度提升。」
加购用户是「已经完成购买决策、只是还没付款的人」。所以「提高加购率」的本质不是抬高一个中间指标,而是提前锁定确定性需求,正式期要做的只是提醒他。
这也解释了为什么两个成功的实验打的都是加购率,以及为什么「种草」会被选中:预告期的用户面对一个还没开卖的商品,他缺的不是信息,是一个提前加购的理由。种草内容提供的正是这个理由。
必买是用预告期锁定意向,用正式期兑现意向。增长的着力点就在预告期。
1.2 行业的季节:从抢店主,转向盘活存量
会员制社交电商平台在早期极度依赖 店主端的裂变与带货能力 去覆盖消费者,「小 b 端」的争夺与培育是这一阶段的核心竞争点。但问题在于:
拥有分销意愿及能力的人群数量是有限的。当行业对这类人群的渗透达到较高水平之后,平台的裂变能力会逐渐走向枯竭。
行业规模已达 842.1 亿元,但增长动能的来源正在切换。我们据此得出第一个关键判断:会员社交电商市场已经开始由一个增量市场,逐步转化为一个存量市场。
这个判断直接决定了后续所有动作的方向:不再优先做拉新裂变,而是把注意力放到留存、变现、复购与客单价上。
在存量市场里继续砸拉新,等于花越来越贵的钱买越来越少的用户,而且买来就流失。这个案例的第一步,是先承认「季节变了」。
1.3 产品的年纪:出现衰退期特征
对主站活跃用户数的分析给出第二个判断:活跃用户数整体呈下滑趋势,具备衰退期的特征。
处在衰退期的产品,通常只有三件事值得做:留存、变现、用户迁移。这进一步收窄了增长动作的选择面。
判断自己在生命周期的哪个阶段,不是为了贴标签,而是为了砍掉那些「在这个阶段做不划算」的动作。衰退期做大规模拉新,是最典型的错配。
1.4 产品形态:电商 × 社交的杂交体
云集的结构决定了它有两个可用的增长引擎:
- 电商引擎(变现):用户找到合适商品完成付费 → 平台赚价差利润 → 优化付费转化路径、提升复购率
- 社交引擎(传播):社群分享、邀请好友下单、B/C 端利益绑定 → 用关系链提升传播效率与购买率
我们明确了两者的关系:不是并列,而是社交引擎为变现助力。
1.5 三个对增长影响最大的变量
| 序号 | 因素 | 为什么关键 |
|---|---|---|
| 1 | 会员体系 | B 端与 C 端之间的邀请关系、利益关系,直接决定 B 端裂变能力与 C 端留存 |
| 2 | 选品 | 必买以「每日主推一款」的方式做交易转化与流量分发,商品本身就是最大的自变量 |
| 3 | 政策 | 外部合规 + 内部补贴/收入政策,影响用户的购买与分享意愿 |
注意第 2 条。它是后文「去噪」动作的伏笔,也是这个案例最容易被低估的一个认知:在一个每天只推一款商品的模块里,选品方差会直接污染所有指标的可比性。
这句话有两面:
指标分析默认「时间序列是同一件事的重复观测」,但在「每日一款」的场景里,每一期观测的对象都换了。不处理这一点,所有优化都是在和噪声对话。
1.6 商业目标:三层视角要的东西并不一样
| 角色 | 目标 |
|---|---|
| 公司 | 必买的核心目标是赚钱:通过必买的拉升实现盈亏平衡,同时能够补贴百亿商品 |
| 服务商(B 端) | 通过必买赚取更多佣金(收入的 40%),并借必买商品提升与 C 端的社群粘性 |
| 战略层 | 打造 100 个百万级别的爆品 |
对应的用户价值:
| 角色 | 价值主张 |
|---|---|
| C 端(新用户 / VIP / 钻石会员) | 找到精选、高性价比的商品;发现小众且好用的商品 |
| B 端(服务商) | 通过销售必买商品获取收益;提高社群活跃度 |
最终收敛出的商业目标:打造爆品,实现盈亏平衡,并补贴百亿商品。
北极星必须同时能被 B 端和 C 端的行为驱动,因为两端在这门生意里都占股份。只反映一端,另一端就会觉得「这指标跟我没关系」。
02诊断:先定义「赢」,再找漏点
资源有限,到底该往哪儿放?增长的第一性问题不是「怎么涨」,而是「涨什么才算赢」。这一步做错,后面所有实验都是在优化一个错误的函数。
2.1 什么是北极星指标(先说清楚概念)
一个产品在某个阶段里,最能代表用户价值实现、且团队能够合力撬动的那个指标。三个条件:能反映用户价值的实现、能牵引长期商业目标、团队能对它施加影响。
它不是「最大的那个数字」(那是 GMV),也不是「所有指标的综合」。选北极星的本质,是公开宣布「其他事情暂时不做」,这比选什么更难。
2.2 17 选 1:两轮筛选的完整推演
我们先画出业务价值的良性循环:
C 端找到高性价比商品 → 产生加购/收藏/分享/下单行为 → C 端实现省钱与心理满足 → B 端通过大量订单获取收益、社群更活跃 → 平台获得利润与用户粘性 → 有更多收入与资源去 BD 更多精品、补贴其他商品 → 回到 C 端
这个闭环同时包含「变现」与「社交」两条链路,因此北极星指标必须同时能被 B 端和 C 端的行为所驱动。
第一轮:是否符合业务价值流程
| 指标 | 判定 | 排除理由 |
|---|---|---|
| 社群下单占比 | ✗ | 社群下单占比高,无法全面代表 C 端用户,以偏概全 |
| B 端人均订单量 | ✗ | 无法衡量 C 端用户价值是否被满足,闭环有阻塞 |
| C 端人均订单量 | ✗ | 以 C 端代表整个 B 端价值,站不住脚 |
| 社群活跃度 | ✗ | 活跃的判断标准与影响因素过多,不直接体现用户价值与商业目标 |
| 活跃占比 | ✗ | 同上 |
| PV/UV | ✗ | 单看访问数据很难权衡用户价值是否实现 |
| UV 价值 | ✗ | 「无价值」的访问干扰因素大 |
| 客单价 | ✗ | 受选品价格影响,不能完全代表用户价值 |
| 店均订单量 / 订单量 / GMV / 商品转化率 / B 端收入 / 平台利润 / 购买频次 / 留存率 / 开单率(9 项) | ✓ | 通过初筛 |
第二轮:6 个标准逐项打分
图例:● 符合该标准 ○ 不符合
| 标准 | 店均 订单量 | 订单量 | GMV | 商品 转化率 | B端 收入 | 平台 利润 | 购买 频次 | 留存率 | 开单率 |
|---|---|---|---|---|---|---|---|---|---|
| 能否反映用户从必买中获得核心价值 | ● | ● | ○ | ● | ○ | ○ | ● | ● | ● |
| 能否为长期商业目标奠基 | ● | ● | ● | ● | ● | ● | ● | ● | ● |
| 能否反映用户活跃程度 | ● | ● | ○ | ○ | ○ | ○ | ○ | ● | ○ |
| 变好是否代表方向正确 | ● | ● | ● | ● | ● | ● | ● | ● | ● |
| 是否简单直观、容易拆解 | ● | ● | ● | ● | ● | ● | ○ | ○ | ● |
| 是否先导指标而非滞后指标 | ● | ● | ● | ● | ● | ● | ○ | ○ | ● |
订单量(必买相关的订单量,不单指必买商品的订单量)。
店均订单量因其本质是订单量的子集,被保留为增长模型中的拆解指标而非北极星。
2.3 最见功力的一步:为什么把「留存率」排除了
被排除的 9 个指标里,有两个是所有增长团队最常挂在嘴边的「好指标」。它们为什么被拿掉,比留下的那一个更值得讲。
购买频次和留存率被排除的理由只有一条:不是先导指标。
滞后指标(留存率、购买频次、LTV、GMV):结果发生后才观测得到,变好了只说明过去做对了一件事,没法告诉你现在该做什么。
先导指标(加购率、转化率):提前变化、能预测结果。它今天动了,你知道明天会发生什么。
选北极星的铁律:选能撬动的,不选能证明的。
同时看「客单价」被排除的理由:受选品价格影响。这和 1.5 节埋下的伏笔是同一条线索:这个业务里,只要指标里混进了「商品属性」,它就不够干净。 这个认知后面还会反复出现。
2.4 因子分解:把「订单量」拆到可动手的那一层
按业务真实的运算关系,把大指标逐层拆成可测量的乘积因子,直到拆出可以单独做 A/B 测试的变量为止。如果某一层「这个因子没法单独改变」,说明还没拆到底;如果某一层「改了也影响不了订单量」,说明拆错了。
为什么必须拆:因为「提高订单量」不是一句可执行的话,而「提高预告商品的加购率」是。
2.5 去噪:整个案例里最关键,也最容易被跳过的一步
先看未去噪的原始数据(必买商详,按主推日统计):
| 统计量 | 必买商详 UV | 转化率 | 下单次数 |
|---|---|---|---|
| 平均值 | 197,921 | 7.61% | 1.18 |
| 最大值 | 319,020 | 19.80% | 1.4 |
| 上四分位数 | 246,932 | 12.12% | 1.2 |
| 中位数 | 209,099 | 4.90% | 1.1 |
| 下四分位数 | 166,546 | 1.90% | 1.0 |
| 最小值 | 50,672 | 0.17% | 0.9 |
一眼看到的问题:转化率从 0.17% 到 19.8%,跨度超过 100 倍。
这不是「用户行为」造成的,这是选品差异造成的。在一个「每天只主推一款商品」的模块里,卖纸尿裤(刚需、高信任)和卖空气炸锅(非刚需、决策重)的转化率本来就不在同一个量级。
噪声 = 你关心的信号之外,同样在推动数字变化、但你不打算(也无法)干预的因素。本案例的信号是「页面的转化能力」,噪声是「商品的品类差异」。
问题在于噪声的幅度远大于信号:选品能让转化率在 0.17%~19.8% 之间跳 100 倍,而页面对转化率的影响只在零点几个百分点。不处理噪声,你根本听不见自己的声音。
常用手法:四分位过滤(本案例用的,剔除上下 25% 的极端样本)、分层(按品类/价格带分组)、配对 / 回归(把商品属性当控制变量)。去噪不是「删掉不好看的数据」,而是声明「我比较的是什么、不比较什么」。
于是我们做了上下四分位过滤,剔除极端选品的干扰,重点观察集中区间:
| 统计量 | 必买商详 UV | 转化率 | 预估订单量 (UV 提升至最大) | 预估订单量 (转化率提升至最大) |
|---|---|---|---|---|
| 平均值 | 210,026 | 6.00% | — | — |
| 最大值 | 245,950 | 9.28% | 14,757 | 19,490 |
| 中位数 | 209,790 | 3.80% | — | — |
计算式:245,950 × 6% = 14,757 | 210,026 × 9.28% = 19,490
去掉选品影响后,必买商详 UV 的差距并不大(中位数 209,790 vs 最大值 245,950,仅 17% 空间);而转化率有 6% → 9.28% 的空间(+55%)。
反映到订单量上:把转化率做到上限能多拿 19,490 单,把 UV 做到上限只能多拿 14,757 单。
所以,转化率的弹性更大。资源应该压在转化率上,而不是流量上。
2.6 站内流量的真相:高流低转
既然流量层面的空间有限,我们还是把站内流量结构过了一遍,这一步查出了「结构性漏洞」。
| 来源页面 | 均值 UV | 占比 | 转化率 |
|---|---|---|---|
| 首页 | 101,033 | 41% | 6.23% |
| 鸡场主页 | 89,094 | 36% | 0.14% |
| 会员中心 | 35,846 | 15% | 0.38% |
| 商品详情页 | 13,055 | 5% | 3.70% |
| 搜索页 | 5,574 | 2% | 11.48% |
按平台划分:APP 177,060(83.21%)| H5 17,357(8.16%)| 小程序 15,706(7.38%)| VIP 2,656(1.25%)
鸡场主页 + 会员中心合计贡献了 51% 的流量,但转化率分别只有 0.14% 和 0.38%;而首页只占 41% 流量,转化率却高达 6.23%,是会员中心的 16 倍。
这就是后来被项目组总结为「高流低转如何突破」的核心命题。
只看 UV 绝对值,鸡场主页(89,094)是除首页之外最大的入口,很容易被当成「优质流量来源」去复制;但把占比 × 转化率放在一起看,它立刻变成全站最大的漏损点。
这是一个通用规律:单一指标看总量,往往会把「最大的漏斗」误读成「最强的入口」,因为量大通常来自「入口足够宽」,而不是「用户真的想要」。所以永远把「量」和「率」放在一起看,并问一句:这个入口的用户,是「想要这个商品」才来的,还是「顺手点进来的」?
2.7 诊断结论
| 层面 | 诊断 | 可动手的抓手 |
|---|---|---|
| 站内流量 | 流量结构失衡,高占比入口低转化 | 精准触达、提升站内流量利用效率 |
| 转化率 | 弹性最大的一环 | 商详转化率、加购率、加购转化率、导流率 |
| 站外流量(拓展) | 当前定位为站内流量承载,站外几乎空白 | 构建品牌与内容优势、承接站外流量 |
03抉择:为什么压转化率,为什么用「内容」
诊断出了三个方向,为什么选了这一个?
增长杠杆的一般形态是 渠道 × 转化 × 留存 × 传播。我们对三个候选方向做了取舍:
| 候选杠杆 | 预期空间 | 当时判断 | 取舍 |
|---|---|---|---|
| 站内流量优化 | UV 上限空间仅 ~17% | 空间有限,且涉及多个页面改版、跨团队协调 | 后置 |
| 转化率提升 | 转化率空间 +55%,折算订单量更高 | 可控性强、单点改动即可验证 | 首选 |
| 站外流量拓展 | 天花板高但周期长 | 需要品牌与内容基建,短期无法验证 | 拓展方向 |
3.1 弹性:比「哪个数字大」更重要的一个算式
弹性 = 把某个变量推到上限,能多拿多少结果 ÷ 当前结果
不能直接比「哪个数字大」:UV 是「人」的单位,转化率是「百分比」的单位,必须换算到同一个终局指标上。
本案例的换算是:UV 推到上限只能多拿 14,757 单,转化率推到上限能多拿 19,490 单(算法见 2.5)。同样一份资源,压在转化率上能多拿 32% 的结果。通用做法:把每个候选杠杆都「推到合理上限」,算一遍终局指标再排序。
3.2 选择标准:能最快知道对错
为什么选转化率,而不是流量? 表面答案是「弹性更大」。但更深一层的原因是:转化率是「可被实验证伪」的。
流量结构的调整涉及推荐算法、页面改版、多部门协同,一次改动无法隔离出单一变量;而转化率可以被拆成商详转化率、加购率、加购转化率等一串可以单独做 A/B 的因子。
优先选择边际成本低、变量可控、反馈周期短的杠杆。不是选空间最大的,是选能最快知道对错的。
推论:一个「空间中等但一周能验证」的方向,通常优于「空间很大但要三个月才知道行不行」的方向。增长的本质是迭代速度,你能试错的次数比单次试错的期望收益更重要。
3.3 那为什么最后是「内容」,而不是「改视觉」?
诊断只说了「压转化率」,但转化率下面挂着一串可动手的因子:商详转化率、加购率、加购转化率、导流率……具体动哪一个? 我们的做法是:不预设答案,把所有候选动作写成假设,打分排序,用实验裁决。
后来的结果是:4 次「改视觉」类实验全部失败,1 次「改内容」类实验大赢。这个结果在第 04 章展开,但它印证了一条判断:在成熟的核心页面上,视觉优化的空间已经被用户的操作习惯吃掉了,还有空间的地方是「用户看到的是不是他需要的信息」。
04实验:六次下注的完整记录
判断做完了,怎么把判断变成可验证的动作?答案是:把每个想法写成一个可以被打脸的假设。
4.1 机制:假设库 + ICE 打分
我们先建立了一个假设库(实验列表),用标准句式书写每个假设:
如果〔做什么〕 预计〔提升多少〕 因为〔基于什么洞察〕
然后对每个假设做 ICE 打分,按总分排序推进。
| 维度 | 英文 | 问的问题 | 打分依据 |
|---|---|---|---|
| I | Impact 预期影响 | 如果成功了,能带来多大提升? | 该因素在增长模型中的权重 |
| C | Confidence 成功概率 | 我有多相信它能成? | 有没有数据/案例支撑这个判断 |
| E | Ease 容易程度 | 做起来有多费劲? | 需要多少开发/设计/协调资源 |
三项均 10 分制,加总排序。ICE 不是为了算出「正确答案」,而是让团队对「先做哪个」有共同的语言和依据。它是排序工具,不是预测工具:决定「先做哪个」,不决定「做了会不会成」。
假设库全貌
这 13 条的最终状态见附录 A。
| # | 假设 | ICE | 关联实验 |
|---|---|---|---|
| 9 | 底部导航优先展示客服入口,打消用户疑虑 | 8/8/8=24 | Q2-3 |
| 10 | 底部导航去除商家入口,强化信任感 | 8/8/8=24 | Q2-3 |
| — | 场景化引导:预告商品突出加购、正式商品突出立即购买 | 8/8/8=24 | — |
| 2 | 商详价格面板打造「必买价」概念(对比必买价/日常价/特卖价) | 8/7/8=23 | Q2-2 |
| 3 | 商详突出显示倒计时,强化限时概念 | 8/7/8=23 | Q2-2 |
| — | 预告商详改为种草内容(种草一期) | 7/8/8=23 | Q2-1 |
| — | 种草页支持直接加购(种草二期) | 7/8/8=23 | Q2-5 |
| 7 | 优化评价模块交互视觉,展现评价质感 | 6/7/7=20 | Q2-4 / Q2-6 |
| 1 | 商详首屏 banner 统一为「商品图 + 核心卖点」 | — | — |
| 4 | 传递信任度:标注「正品」「核酸检测通过」等 | — | — |
| 5 | 减少首屏干扰信息,整合服务信息 | — | — |
| 6 | 优化背书信息为图文榜单 | — | — |
| 8 | 整合商品推荐样式与位置,减少决策干扰 | — | — |
得 24 分的 3 条假设全部落在「底部导航」这一个位置上,我们把最高的期望值押在了一个点上;而 23 分档里有 4 条,横跨价格面板、倒计时、种草,分布更分散。
这个分布后来被证明是有问题的:24 分档全灭,23 分档里出了两个大赢。更合理的假设库结构应该让高分假设分布在不同机制上,而不是集中在同一个页面的同一个区域,否则一旦这个区域判断错了,就同时错失好几条假设。
4.2 一份标准实验报告长什么样
我们 6 份实验报告全部遵循同一套结构,它可以原样搬到任何 A/B 实验场景。
只盯核心指标,很容易做出「指标赢了但业务输了」的实验:把「立即购买」按钮做得巨大且难以关闭,转化率短期上升,投诉也上升。反向指标就是守门人。
本案例里跳失率承担这个角色:加购率涨了、跳失率也涨了,说明用户是被「逼」着加购、不是被「说服」的,这个实验不能算赢。反向指标的通过与否拥有否决权。
实验组比对照组高 0.1 个百分点,是「真的有效」还是「运气好」?显著性检验回答的是:如果两个版本本质上完全一样,我们观测到这么大差异的概率有多大?概率很小(通常 < 5%)→ 判定「具备显著的统计学差异」;概率不够小 → 不能说实验组更好。
本案例里两次种草实验的置信度都是 100%:在统计模型下几乎可以排除「随机波动」,实验组的优势真实存在。
重要边界:显著性只回答「这个差异是真的吗」,不回答「这个差异值得做吗」。样本足够大时,0.01pp 的差异也能显著,所以结论要同时看两件事:显不显著(真不真)+ 效应量多大(值不值)。
4.3 Q2-1 |种草一期:把「预告商详」换成「种草页」
假设
| 原因 | 预告商详加购率为 10.2%(过去两周),有大量用户没有进行加购行为,猜测可能是预热形式不够吸引用户 |
| 假设 | 通过将预热商品的详情页调整为种草内容,获得用户更多的关注 |
| 预计结果 | 能够将预热商品加购率提升至 14% |
注意「原因」这一栏的写法:先给出观测到的基线数字(10.2%),再给出一个可证伪的猜测。这是一个高质量假设应有的样子:它没有说「我们觉得页面不好看」,而是说「我们猜测是 X 导致了这个数字」。
设计
实验组用乐高搭建,当时没有行动点系相关组件,无法在种草页直接唤起 SKU 面板,因此实验组路径比对照组多一步跳转。
这个「被迫多一步」的约束,是理解整个案例走向的关键。也正是这个约束直接催生了 Q2-5:既然多一步都能赢,那把它去掉呢?实验的下一步应该从上一个实验暴露的约束里来,而不是从头脑风暴来。
这个事实给你的信心,比「路径更短还赢了」要强得多。因为它证明种草内容带来的价值,足以覆盖掉多一步跳转的损耗。
结果
| 指标 | 对照组 | 实验组 | 变化 |
|---|---|---|---|
| 首页热区点击 UV | 3,794 | 2,553 | — |
| 种草页访问 UV | — | 2,478 | 新增 |
| 引导商详 UV | 3,097 | 694 | 路径折叠 |
| 引导加购 UV | 270 | 311 | — |
| 商详加购率(各商品简单平均) | 10.14% | 45.04% | +344.2% |
| 整体加购率(各商品简单平均) | 10.14% | 14.04% | +38.5% |
| 加购开单人数 | 74 | 117 | — |
| 加购转化率 | 26.09% | 35.41% | +35.7% |
| 跳失率(反向指标) | — | — | 未劣化 |
显著性检验(合并口径)
| 版本 | 访问数 | 转化数 | 转化率 |
|---|---|---|---|
| A(对照组) | 3,097 | 270 | 8.72% |
| B(实验组) | 2,478 | 311 | 12.55% |
「试验有显著的统计学差异!版本 B 的转化率比版本 A 提高了 43.96%。我们 100.00% 肯定版本 B 的改动会带来转化率提升。」
这张表里出现了三个不同的提升幅度:+344.2%、+38.5%、+43.96%。这不是数据错误,而是口径不同,第 05 章会专门拆解这三个数字,这是整个案例最需要讲清楚的一节。
实验洞察
- 通过种草内容更容易帮助用户对商品产生购买欲望
- 通过种草后的用户整体质量较高,更容易完成转化
- 种草内容在一定程度上可以弥补选品的劣势
- 前后各三次实验,种草页数据有一定差距,种草内容需要持续打磨,存在优化空间
第三条很容易被当成一句客套话带过,但它是整个案例最值钱的一条洞察。回到第 01 章的问题:这个业务最大的变量是「选品」。选品决定了转化率能在 0.17%~19.8% 之间摆动 100 倍,而选品是商品团队的事,增长团队管不了。
而「种草内容可以在一定程度上弥补选品的劣势」意味着:我们找到了一个自己能控制的变量(内容质量),它能部分对冲掉一个自己控制不了的因素(选品)。
决策(后续计划)
后续计划定成了三步:产出种草模板 → 乐高组件化 → 内容智能化(完整路径见第六章)。
4.4 Q2-5 |种草二期:缩短路径,让种草页能直接加购
假设
| 原因 | Q2-1 中种草使加购率提升 38.5%(10.14% → 14.04%)。但一期实验组路径比对照组长,猜测缩短路径后还有提升空间 |
| 假设 | 通过将预热商品的详情页调整为种草内容,同时支持种草页面直接加购 |
| 预计结果 | 加购率提升至 16%(相对 Q2-1 实验组再提升 2 个百分点) |
设计
| 组别 | 版本 | 流量 |
|---|---|---|
| 对照组 | 保持现有预热商品详情页展示 | 50% |
| 实验组 | 采用种草页面,并提供当前页面加购行动点 | 50% |
一期只在「首页入口」分流;二期改为针对商详页面分流,保证任何渠道进入商详的用户都可进入种草页。
这个改动看起来只是技术细节,其实是在修补一期的一个方法论漏洞。二期改成针对于商详页面分配流量,等于把结论的适用范围从「单一入口」扩大到「全部入口」。判断一个实验好不好,除了看结论显不显著,还要看结论能推广到多大范围。
结果(完整 11 组)
| 主推商品 | 组别 | 访问 UV | 加购 UV | 加购率 | 加购开单人数 | 加购转化率 |
|---|---|---|---|---|---|---|
| 意丝美时尚聚拢文胸 | 对照 | 11,341 | 1,090 | 9.61% | 315 | 28.90% |
| 实验 | 10,950 | 4,100 | 37.44% | 1,300 | 31.70% | |
| Supield 防晒爆冰裤 | 对照 | 9,695 | 1,135 | 11.71% | 200 | 17.62% |
| 实验 | 14,854 | 6,100 | 41.07% | 1,700 | 27.86% | |
| colorkey 唇釉 | 对照 | 8,285 | 1,285 | 15.50% | 395 | 30.70% |
| 实验 | 11,502 | 5,100 | 44.34% | 1,650 | 32.35% | |
| 花果里染发 | 对照 | 7,940 | 1,210 | 15.23% | 340 | 28.09% |
| 实验 | 6,900 | 2,534 | 36.72% | 739 | 29.16% | |
| 悠伴空气炸锅 | 对照 | 11,578 | 2,896 | 25.01% | 755 | 26.07% |
| 实验 | 12,276 | 3,277 | 26.69% | 893 | 27.25% | |
| 歌兰妮香氛洗护 | 对照 | 12,064 | 1,570 | 13.01% | 427 | 27.19% |
| 实验 | 10,736 | 2,377 | 22.14% | 774 | 32.56% | |
| 清源堂蜂王胎 | 对照 | 10,348 | 870 | 8.40% | 140 | 16.09% |
| 实验 | 11,102 | 1,273 | 11.46% | 347 | 27.20% | |
| 猫人托胸神器 | 对照 | 8,038 | 1,020 | 12.68% | 128 | 12.50% |
| 实验 | 9,112 | 2,007 | 22.02% | 411 | 20.47% | |
| U88 冰淇淋内裤 | 对照 | 13,721 | 744 | 5.42% | 156 | 20.96% |
| 实验 | 9,195 | 2,838 | 30.86% | 788 | 27.76% | |
| 纽西之谜隔离 | 对照 | 11,708 | 846 | 7.23% | 264 | 31.21% |
| 实验 | 11,784 | 3,728 | 31.64% | 1,712 | 45.92% | |
| 竹林鸡 | 对照 | 11,587 | 1,628 | 14.05% | 437 | 26.84% |
| 实验 | 9,360 | 2,528 | 27.00% | 978 | 38.68% |
显著性:具备显著的统计学差距,实验结果有效,实验组明显优于对照组。
洞察
- 二期在全渠道分流下依然复现了一期的结论,说明一期的效果不是「首页入口」这一特定渠道带来的假象
- 加购转化率同步提升(如纽西之谜 31.21% → 45.92%),说明种草带来的是「更想买的人」,不是「被诱导点击的人」
- 缩短路径确实有效,但效果的量级高度依赖商品与种草内容质量
① 分流是不是真的均匀? 这是读实验数据的第一动作,不是最后一步。设计是 50%/50%,但看访问 UV:
11 款里有 5 款的组间访问 UV 偏差超过 10%,最大到 53%,远超抽样波动(万级样本下随机波动的标准误通常在 1% 量级)。三个来源:① 分流单元不是「用户」而是「请求」;② 两版页面结构不同,UV 的统计边界不同(对照组计商详页,实验组计种草页);③ 实验并非严格 50/50 执行。
这不影响结论方向:加购率的差异(5%~40% 级别)远大于分流偏差能造成的影响。但它提醒我们:看实验结果,第一眼不该看「哪个组更高」,而该看「两个组是不是真的可比」。
原本难卖的品,效果最猛:U88 冰淇淋内裤 5.42% → 30.86%(+25.4pp)、纽西之谜 7.23% → 31.64%(+24.4pp)。原本就好卖的品,提升有限:悠伴空气炸锅 25.01% → 26.69%(+1.7pp)。但也有例外:清源堂蜂王胎从 8.40% 只到 11.46%(+3.1pp),是「难卖但也没救起来」的品。
这印证了一期那句「在一定程度上可以弥补选品的劣势」。注意「一定程度上」有数据支撑,不是谦辞:种草对「用户有需求但没被说服」的品最有效,对「用户根本不需要」的品无能为力。
③ 要看「加购转化率」,不能只看「加购率」。 如果实验组只是把加购率刷上去、加购转化率掉了(加购的人不下单),那是虚假繁荣。实际结果是同步提升(纽西之谜 31.21% → 45.92%,竹林鸡 26.84% → 38.68%),说明种草吸引来的是「更想买的人」,不是「被诱导点击的人」。核心指标涨了还要看质量指标有没有同步涨,没有交叉验证的增长数字都值得怀疑。 如果实验组只是把加购率刷上去,但加购转化率掉了(加购的人不下单),那是「虚假繁荣」。实际结果是加购转化率同步提升,说明种草吸引来的是「更想买的人」,而不是「被诱导点击的人」。
二期的「加购率」分母是种草页访问 UV,一期的「整体加购率」分母也是页面访问 UV,两者口径接近;但一期的「商详加购率」口径完全不同(分母是种草页跳转到商详的 UV,被人为收窄)。跨实验横比时必须对齐口径,否则会得出「加购率从 45% 掉到 37%」这种错误结论。
4.5 Q2-2 |价格面板优化:突出「必买价」,无效
假设
| 原因 | 必买商详过去两个月平均转化率 7.61%,去除选品影响后为 6%,有大量用户没有进行购买转化。猜测可能有用户当天加购了没考虑清楚,也可能有部分用户对价格敏感 |
| 假设 | 通过调整商详的价格面板,突出价格、限时概念,激发用户购买欲望 |
| 预计结果 | 相对原转化率提升 15% |
结果(19 个主推日,节选)
| 主推商品 | 对照组转化率 | 实验组转化率 | 差异 |
|---|---|---|---|
| 夏日驱蚊节 | 6.45% | 7.21% | +0.76pp |
| champion T恤 | 2.65% | 2.81% | +0.16pp |
| 李霸天烤肠 | 2.99% | 3.06% | +0.07pp |
| 素野心水套装 | 2.71% | 2.73% | +0.02pp |
| 海澜之家 | 4.47% | 4.31% | −0.16pp |
| 哈药品牌团 | 6.66% | 6.11% | −0.55pp |
| 石榴节纸尿裤 | 16.82% | 17.55% | +0.73pp |
| 百丽超级品牌日 | 1.65% | 1.85% | +0.20pp |
| 京润珍珠品牌团 | 6.03% | 5.79% | −0.24pp |
| 平均 | 5.68% | 5.68% | 0 |
显著性:不具备显著的统计学差异,实验未达到效果。
实验洞察
- 突出必买价能够略微提升用户的购买欲望
- 用户针对核心页面已经形成一定的操作习惯,很难通过视觉进行优化
看到「不显著」,第一反应往往是「是不是样本不够?要不要再跑一轮?」这个直觉需要被纠正。在这个实验里,「没有效果」这个结论本身是可靠的。 理由有三:
① 设计是配对的:同一个商品、同一天同时跑两组,商品本身的影响(品牌知名度、价格带、品类)在两个组里相同,不会制造组间偏差。这比「今天跑 A、明天跑 B」强得多,后者会把时间趋势误当效果。
这是一个信息量极大的负结论:它排除了一整类动作(在成熟商详页上做价格/限时视觉强化)。但有一条边界必须记住:它排除的是价格面板的视觉呈现方式,不是价格本身。降价、发券、改价格带都是另一回事,不在这个实验的射程内。负结论的射程,取决于你改动的究竟是哪个变量。
4.6 Q2-3 |底部行动按钮优化:引入客服、弱化商家入口,无效
假设
| 原因 | 商详转化率低,猜测用户对商品有顾虑,也可能购买引导性不强 |
| 假设 | 通过调整底部行动按钮,引入客服、弱化商家入口、突出购买操作,引导用户下单行为 |
| 预计结果 | 相对原转化率提升 15% |
结果(20 个主推日,节选)
| 主推商品 | 对照组转化率 | 实验组转化率 | 差异 |
|---|---|---|---|
| 夏日驱蚊节 | 7.00% | 6.47% | −0.53pp |
| champion T恤 | 2.75% | 2.71% | −0.04pp |
| 李霸天烤肠 | 3.03% | 3.03% | 0 |
| 素野心水套装 | 2.71% | 2.72% | +0.01pp |
| 海澜之家 | 4.50% | 4.29% | −0.21pp |
| 石榴节纸尿裤 | 17.28% | 17.08% | −0.20pp |
| Move Free 益节 | 7.03% | 6.30% | −0.73pp |
| COLORKEY 珂拉琪 | 8.09% | 8.33% | +0.24pp |
| 平均 | 5.81% | 5.74% | −0.07pp |
显著性:不具备显著的统计学差异,实验未达到效果。
实验洞察
- 用户针对核心页面已经形成一定的操作习惯,很难通过视觉进行优化
- 底部行动按钮的突出,对商详转化率影响较弱
「本次实验组并没有完全按照实验方案的视觉效果实现,为进一步验证,可以后续调整后再次观察一个周期。」
这句话后来被兑现了:按修正方案补跑了一个周期,结论没有改变。于是它从「执行没到位」归位为「假设错了」:底部行动按钮的强化,在这批用户身上确实不产生转化增量。
| 失败类型 | 含义 | 后续动作 |
|---|---|---|
| 假设错了 | 这个方向本身不成立 | 归档,不再尝试,节省未来的试错成本 |
| 执行没到位 | 方案没被正确实现,测的不是想测的东西 | 修正后重跑,不能就此判死 |
两种情况在数据上长得一模一样(都是「不显著」),区分它们只能靠执行过程的记录。我们在报告里明确写下了执行偏差,并在结论里保留了再次验证的可能性,而不是草率宣布「此路不通」。
通用做法:每份报告都应该有一栏「执行保真度(fidelity)」:这次实验,实际跑的和设计的差了多少?缺了这一栏,你会把「执行问题」误判成「方向问题」,永久性地放弃一条本来可行的路。
4.7 Q2-4 / Q2-6 |评价面板优化:无效
| 原因 | 商品评价基本占据第二屏,可能增加用户继续浏览商品的难度 |
| 假设 | 通过优化评价面板的交互视觉,展示更好的评价质感 |
| 预计结果 | 相对原转化率提升 15% |
| 结果 | 已跑完,无显著效果;原始数据未留存 |
两个编号(Q2-4 与 Q2-6)的实验设计完全一致(同一假设、同一方案、同一指标),属于编号管理上的重复;而 ICE 评分最低(20 分)的假设,反而占用了两个实验编号,评分更高的 24 分档假设却挤在同一份报告(Q2-3)里一起验证。排期恰好反过来了。
高分假设应该拿独立资源和独立编号(它更可能赢,值得更干净的验证);低分假设要么合并、要么延后。这类问题的根因通常不是能力问题:假设库由一个人维护,实验排期由另一个人安排,两边没有交叉核对。解法很简单:排期前过一次假设库,确保「高分优先、编号唯一」。
还有一处教训:这两次实验没有留存原始数据,只留下了结论。数据不留存,结论就无法复核,也没法在后来做口径重建。
4.8 六次实验的整体结论
| 实验 | 类型 | ICE | 结果 | 关键结论 |
|---|---|---|---|---|
| Q2-1 | 内容改造 | 23 | 🟢 显著 | 种草页使整体加购率 +38.5%,加购转化率 +35.7% |
| Q2-5 | 路径优化 + 内容 | 23 | 🟢 显著 | 全渠道分流下复现,缩短路径有效 |
| Q2-2 | 视觉优化(价格面板) | 23 | 🔴 不显著 | 必买价概念仅「略微」有效,不足以改变决策 |
| Q2-3 | 视觉优化(行动按钮) | 24 | 🔴 不显著 | 突出按钮对转化率影响弱 |
| Q2-4 | 视觉优化(评价面板) | 20 | 🔴 不显著 | 无显著效果,数据未留存 |
| Q2-6 | 视觉优化(评价面板) | 20 | 🔴 不显著 | 与 Q2-4 重复 |
ICE 是排序工具,不是预测工具:它决定「先做哪个」,不决定「做了会不会成」。
三条硬结论
四次「视觉类」实验(Q2-2、Q2-3、Q2-4、Q2-6)铺在商详的四个区域上,没有一次跑出显著效果(其中价格面板与底部行动按钮的转化率变化都在 ±0.8 个百分点以内);一次「内容类」实验(Q2-1),加购率提升 3.9 个百分点、加购转化率提升 9.3 个百分点,100% 置信。
原因不难理解:视觉优化改变的是「同样的信息怎么摆」,内容改造改变的是「用户看到的是不是他真正需要的信息」。前者动的是皮,后者动的是里。
要注意边界:这个结论的前提是「用户已经熟悉这个页面」。在全新的页面或全新的用户触达上,视觉与信息架构的作用会完全相反。「视觉没用」不是普适真理,它有前提。
看上面那张总表就够了:ICE 最高的 24 分(Q2-3)失败,同为 23 分的 Q2-2 失败、Q2-1 大赢,ICE 最低的 20 分(Q2-4/6)也不显著。ICE 是排序工具,不是预测工具。 它的价值在于「防止团队只做最容易做的那件事」,而不在于「保证高分实验一定能赢」。
换个角度看 ICE:它到底还有没有用?有,但要重新理解它的作用。ICE 解决的是资源分配的政治问题:没有打分时,谁嗓门大做谁的、谁的技术方案好实现做谁的;ICE 给了一个可以争论的公共依据:不争「要不要做这个」,而争「这个的 I、C、E 各是几分」。把主观分歧转化成可讨论的参数,这本身就是价值。
它不能解决的是「预测」:增长机会的收益分布是长尾的,大部分动作没效果、少数效果巨大,而「哪些是那少数」事前无法判断。所以有效策略不是提高预测准确率,而是提高尝试次数。
两个失败实验共同给出了一个可迁移的判断:用户在成熟核心页面上的操作习惯,是视觉优化的天花板。 这条结论此后可以直接用来否决同类提案,节省的试错成本本身就是收益。
这是「负结论的价值」在本案例里的第一次体现:一个失败的实验,如果能让你在未来一年内快速否决 5 个同类提案,它的价值超过一个侥幸成功的实验。
可惜大部分团队的负结论没有被归档,只留在报告里,没有进入「提案评估清单」。于是同一个方向被不同的人反复提出、反复试验、反复失败。
05口径:被路径偷走的那个数字
实验赢了,但「赢了多少」这件事,为什么会说不清?这是整个案例最需要讲清楚、也最容易被讲错的一节。
5.1 同一个实验,四个「提升幅度」
Q2-1 这一个实验,报告里同时出现了三个数字;如果再换一种聚合口径,还能算出第四个:
| 口径 | 数值 | 提升 | 分母是什么 |
|---|---|---|---|
| 商详加购率 | 10.14% → 45.04% | +344.2% | 实验组 = 从种草页点击「加入购物车」跳转到商详的 UV |
| 整体加购率 | 10.14% → 14.04% | +38.5% | 实验组 = 种草页访问 UV(与对照组首页热区 UV 可比) |
| 显著性检验转化率 | 8.72% → 12.55% | +43.96% | 合并口径(转化数 ÷ 访问数) |
| 〔补算口径〕聚合口径 | 7.12% → 12.18% | +71.1% | 加购 UV ÷ 首页热区点击 UV(3,794 → 2,553) |
第四个数字是我们后来补算的。它不是「更对」的口径,而是为了说明一件事:同一个实验能报出几个提升幅度,完全取决于你有几种分母可选。
5.2 +344.2% 是怎么来的,为什么它不能对外说
实验组的路径是「种草页 → 点击加入购物车 → 跳转商详」。也就是说,只有已经表达了加购意愿的用户,才会进入商详页。分母被人为收窄,比率自然被放大。
任何比率类指标,本质都是 分子 ÷ 分母。分母定义的是「在谁身上发生的转化」。
- - 对照组进入商详的人 = 所有对商品有点兴趣的人(大池子,含大量「随便看看」的人)
- - 实验组进入商详的人 = 只有「愿意点加入购物车」的人(已经被筛过的池子)
- 对照组进入商详的人 = 所有对商品有点兴趣的人
- 实验组进入商详的人 = 只有「愿意点加入购物车」的人
通用规则:只要是「以路径中间节点为分母」的比率,一旦改动路径全部作废,必须回到路径起点的同一口径(比如「首页热区点击 UV」)重新计算收益。
对外可用、横向可比的数字是 +38.5%(整体加购率)与 +43.96%(显著性检验口径)。
5.3 增量到底有多少:把账算到订单
这是从「实验指标」到「业务结果」的最后一公里,也是讲解一个案例时最应该补齐的部分。
① 增长的绝对值,来自「率 × 量」两个数的乘积。 转化率提升 3.9pp 听起来不小,但乘以每天 8,000 的预热 UV,结果是 312 个加购用户,一个在 21 万日 UV 的盘子面前并不算巨大的数字。 这为第 07 章要算的那笔缺口账埋下了伏笔。
5.4 哪些结论不能归因
| 不能归因的说法 | 原因 |
|---|---|
| 「种草页带来了 344% 的加购增长」 | 口径失真,分母被路径折叠 |
| 「种草内容可以完全替代选品」 | 我们自己当时的表述是「在一定程度上可以弥补选品劣势」;悠伴空气炸锅仅 25.01% → 26.69%、清源堂蜂王胎仅 8.40% → 11.46% 就是反例 |
| 「种草效果已经稳定」 | 我们自己的记录是:「前后各三次实验,种草页数据有一定差距,种草内容需要持续打磨」 |
| 「底部按钮优化彻底无效」 | 实验组未完全按方案实现;按修正方案补跑一个周期后结论未变,可以判死 |
| 「这一仗打赢了」 | 见第 07 章:实验验证了方向,当时阶段进度 75%,后面那一段靠产能补上,全年目标最终达成并超额 |
06放大:从一次实验到一套基建
一个实验赢了,只是拿到了「这条路能走」的证据。增长的杠杆在于能不能把它变成可复制的产能。
6.1 种草内容的类型学
项目组产出了四类种草内容范式,并标注了各自的适配品类:
| 类型 | 内容形态 | 适配品类 |
|---|---|---|
| A. 图文故事类 | 图文 + 故事 + 社会反馈,故事人格化、真实可信赖(要让用户感受到「真实在使用这个产品」) | 通用全品类 |
| B. 视频讲解类 | 视频讲解、试穿上身效果,更直观高效,可配合搭配推荐其他商品 | 服饰 |
| C. 社交互动聊天类 | 互动、聊天、音频、问答,营造真实感与亲近感 | 全品类 |
| D. 社会认同类 | 品牌背书、专业权威、品质保障(欧盟标准、HACCP、100% 进口、母婴专家等) | 母婴、保健、食品 |
注意 A 类描述里那句「一定要让用户感受到我们是真实在使用这个产品」。这是四类内容的共同内核:它们都在提供「可信的使用者视角」,只是载体不同(图文 / 视频 / 对话 / 权威背书)。
这也解释了种草为什么在这类业务里有效:用户面对一个还未开卖的商品,缺的不是信息,是「别人真的用过并且说好」。商品详情页给的是规格,种草内容给的是证据。
6.2 种草页面的组件设计
| 组件 | 设计要点 |
|---|---|
| 商品图片展示 | 精而全,多角度 / 特写 |
| 标签化核心卖点 | 可对标签做精细化运营 |
| 产品故事 | 描述基础功能、核心体验要素与使用过程的整体感受 |
| 真实用户使用反馈 | 真实感来源 |
| 问答 | 承接用户顾虑 |
| 其它必买推荐 | 往期主推过的必买商品池(近 7 天) |
| 加购引导 | 全程置顶显示,通过券、云币作为钩子吸引加购(有预算约束) |
| 基础信息 | — |
同时提出了制定标准的三步:提炼好故事的核心要素 → 各品类优秀案例分析 → 制定标准,赋能行业与品牌方。
「加购引导全程置顶」这一条,直接对应第 01 章讲的业务机制:种草页的核心任务不是「讲清楚商品」,而是「让用户现在就加购」。所以加购入口必须始终触手可及,且要给它一个即时理由(券、云币)。
括号里那句「有预算约束,预算计划来源行业、品牌方,待洽谈」也值得注意:它说明我们当时清楚这个钩子的成本结构。用券换加购,本质是「用毛利买确定性」,要算得过账才能持续。
6.3 三阶段落地路径
解决:从「只有必买小组会做」到「行业线照着能做」
解决:从「每次手工搭」到「组件拼接」
解决:从「人工写内容」到「达人内容自动填充」
先用人工跑通验证,再用模板扩散,再用组件产品化,最后用算法填充。每一阶段都在解决上一阶段暴露的瓶颈,而不是一上来就做「智能种草中台」。
大多数团队在实验成功后,要么写结案报告就结束(浪费了验证成果),要么直接立项做「内容中台」(通常因跨度过大而失败)。我们选的是第三条路:把「这次的产出」直接变成「下次的输入」。
一次实验带来 3.9pp,一次基建能让 3.9pp 出现在 100 个商品上。可复制的产能,才是增长复利的来源。
6.4 产品化:种草 V2.0 方向
从原有模块入手做「重灾区」治理,核心目标是提升人效、降低错误率:
| 优化项 | 内容 |
|---|---|
| 优化 1 | 头图三个标签固化,需带动效果 / 可移动(参考小红书标签) |
| 优化 2 | 倒计时模块 |
| 优化 3 | 底部导航增加正式期应用 |
| 优化 4 | 多图叠加 / 拼接 / 可滑动(参考美图秀秀) |
| 其他 | 字体错误、标题错误、正文错误等 |
同时规划了三个新方向:正式期如何应用种草内容、全渠道创新、以及从「原有模块优化」走向「种草产品化」。
注意「重灾区」和「降低错误率」这两个词。它们说明样本量放大之后,瓶颈已经从「内容好不好」转移到「生产不出错」。
这个切换如果没做对,会出现「规模化即失效」:一次精雕细琢的种草页很好,100 个粗制滥造的种草页会把品牌形象拖垮。
6.5 规模化后的两个新命题
走到规模化这一步,我们拿到了两条关键结论,标志着眼光的转移:
以及项目定位的一句话总结:「必买定位:打造服务商舒适圈」,节奏上明确 「一期核心:必买商详转化率提升;二期核心:种草」。
第二条结论和第 02 章的「去噪」是同一件事的两面。第 02 章的结论是「必须去噪,否则指标不可用」;这里的结论是「选品本身就是一个需要被管理的增长变量」。
那么增长资源是否应该更多地投入到「选品机制」上?我们的答案是「两手都做」:页面优化(种草)是可复制的,选品是不可控的,所以重点做了可复制的那一个。
07结果:打到哪一步,以及缺口怎么补上
项目推进到那个阶段,战果到底怎么样?还差的那一段,后来靠什么补上?
大部分增长案例分享会停在「我们做对了什么」,或者反过来停在「我们哪里没做好」。这个案例的信息量恰恰落在两者之间:做对的那部分已经被 100% 置信的实验验证了,而进度条当时停在 75%(全年目标最终 100% 达成并超额)。这两件事同时为真,它们不矛盾,也不是失败信号。
7.1 战果盘点
| 维度 | 数据 | 判断 |
|---|---|---|
| 流量聚焦 | 日均 UV 21 万(上线前 8.7 万),提升约 1.4 倍 | ✅ 模块立住了 |
| 核心实验 | 整体加购率 +38.5%,加购转化率 +35.7%,100% 置信 | ✅ 方向被验证 |
| 复现性 | 二期在全渠道分流下复现一期结论 | ✅ 结论可推广 |
| 方法论沉淀 | 假设库 + ICE + 实验报告模板 + 6 份完整报告 | ✅ 能力建成 |
| 内容基建 | 4 类内容范式 + 8 个页面组件 + 三阶段路径 | ✅ 可复制产能 |
| 业务目标 | 年度目标 2.5 亿,截至该阶段累计完成 1.9 亿,进度 75%(全年最终达成并超额) | ⏱ 阶段性进度 |
7.2 先把 75% 这个数字的口径说清楚
这是一个阶段进度快照,不是全年结论。
「75%」最容易被读成「只做到四分之三、剩下的做不动了」,它实际的含义是:在一条 12 个月的曲线上,此刻站在四分之三的位置。目标是一整条曲线,进度是曲线上的一个点,用一个时点的进度去判定整条曲线好不好,读法本身就错了。
一句话收口:75% 是这条 12 个月曲线上的一个中途点,不是终局。后面的周期里,年度目标 100% 达成,并且超额。
7.3 差的这一截从哪来:三个原因
它提前说明了一件事:缺口不可能靠「再多做几个实验」来填。
实验成功是「局部最优被验证」,业务达标需要的是「多个局部最优被同时铺开并规模化」。
这个案例完成的,是把一个「可能性」变成了「确定性」:证明了「种草内容能提高加购率」这件事是真的。从「确定性」到「规模」的跨越,靠的是第 06 章那套基建,而不是更多的实验。
7.4 缺口后来靠什么补上
三个原因指向同一个动作:把已经验证过的单点结论,变成可以铺开的产能。
| 补法 | 具体做了什么 |
|---|---|
| 从单场景到全渠道 | 一期只在必买场景验证的结论,二期在全渠道分流下重新跑并复现,它因此从「一个页面的效果」变成「一套跨场景可用的机制」 |
| 从手艺到基建 | 第 06 章那套「模板 → 组件 → 智能化」:4 类内容范式 + 8 个页面组件,让种草不再依赖某个运营的手感 |
| 从预告期到全场景 | 一期核心是商详转化率,二期把核心切成种草,把只作用在预告期那一段的效果,铺到更多商品、更多流量入口上 |
日均 UV 从上线前的 8.7 万涨到 21 万,盘子本身在变大;机制铺开之后,同一个提升率作用在更大的流量上,绝对值才会跟着涨。
它不是被「下一个实验」填平的,是被产能填平的。 这条曲线的前一段靠验证,后一段靠放大。这也正是当时的节奏安排:一期做商详转化率,二期做种草。
后面的事实印证了这条路径:年度目标最终 100% 达成,并实现了超额。
7.5 增长工作的「最后一公里」
从这个过程里可以抽出一条判断,它对所有做增长的人都适用:
| 阶段 | 你在解决什么 | 产出的东西 | 时间差 |
|---|---|---|---|
| 验证 | 这条路能不能走通? | 一个显著的实验结论 | 立即可见 |
| 放大 | 怎么让它覆盖更多场景? | 模板、组件、流程 | 滞后 1~2 个季度 |
| 兑现 | 怎么变成绝对值的增长? | 业务目标达成 | 滞后更久 |
1. 结论被验证了吗?(真不真)
2. 结论能被复制到多少个场景?(广不广)
3. 复制的产能,什么时候能变成绝对值?(快不快)
这个案例在前两问上是高分;第三问的答案是产能。它比实验慢,但把剩下的进度走完的正是这一段,后来也确实走完了:年度目标 100% 达成,并超出。
08对照:换你会怎么做
学习一个案例最有效的方式,不是记住它做了什么,而是看清「在每一个分岔点上,我们选的那条路和「不加思考会选的那条路」,差在哪里」。
下面这张表,是这个案例里六个关键的分岔点。左列是不加思考时最容易走的那条路,右列是我们实际走的路,中间一列是做出这个选择的依据。
| # | 分岔点 | 不加思考会走的路 | 我们实际走的路 | 差在哪 |
|---|---|---|---|---|
| 1 | 面对「转化率低」 | 立刻开始想优化方案(「页面太丑了」「按钮不够大」) | 先定北极星 → 因子分解 → 算弹性,先决定「压哪个变量」 | 直觉在解「怎么改」,我们在解「改什么」。先选对问题,再谈解法 |
| 2 | 面对一堆数据 | 直接取平均值,和上期对比 | 先做四分位去噪,剔除选品造成的高方差噪声 | 直觉默认「每期数据可比」,我们知道每天的商品都换了 |
| 3 | 面对多个假设 | 优先做「最容易实现」的那个 | 用 ICE 打分排序,按总分推进 | 直觉服从实现成本,我们服从期望价值(虽然 ICE 也不准) |
| 4 | 面对「怎么提转化」 | 改 UI / 改视觉 / 加按钮动效 | 改内容(把商详换成种草页) | 直觉改「信息怎么摆」,我们改「用户拿到了什么信息」 |
| 5 | 面对实验结果 | 挑最大的那个数字汇报(+344%) | 拆出四个口径,选能对外说的那个(+38.5%) | 直觉在取悦汇报对象,我们在保护结论的可比性 |
| 6 | 面对实验成功 | 写结案报告,进下一个项目 | 转成模板 → 组件 → 智能化三阶段基建 | 直觉把成功当终点,我们把它当生产资料 |
第 2 条(去噪)之所以难,是因为它要求你承认「你的数据暂时不可用」。 承认这一点是反直觉的:大多数人拿到数据就开始分析,而不是先问「这批数据能不能比」。
第 5 条(口径)之所以难,是因为它要求你主动放弃一个更好看的数字。 而「更好看的数字」通常正是汇报现场最容易被奖励的东西。
增长工作的核心竞争力,不在于「能想出多少点子」,而在于「能在多小的代价下知道自己错了」。 本案例里的每一步(定北极星、拆指标、去噪、算弹性、做 A/B、纠口径)服务的是同一件事:让判断尽可能快地被现实修正。
09可复用方法论
从这一个案例里,可以抽出 8 条能迁移到其他业务的打法。每一条都配了一个自检问题,方便你对照自己的场景。
-
先定义「赢」,再找漏点
北极星指标不是选「最重要的指标」,而是选「最该被撬动的指标」。购买频次和留存率看起来更「重要」,但因为它们是滞后指标而被排除。无法指导当下动作的指标,不适合做北极星。
自检问题:如果这个指标没达成,我能不能立刻列出三件具体该做的事?
-
用因子分解把指标拆到「能动手」的颗粒度
订单量 → 必买商品订单量 + 导流商品订单量 → 商详订单量 + 购物车订单量 → UV × 转化率 × 下单次数 → 各入口 UV。拆解的终点是「一个可以被单独做 A/B 的变量」,拆不到这一层,就没法做实验。
自检问题:拆到最后一层,每一个因子我都能单独改吗?
-
核心变量受高方差因素影响时,必须先分层或去噪
选品方差(转化率 0.17% ~ 19.8%,跨度 100 倍)会完全淹没真实信号。用四分位过滤剔除极端值,是让数据可用的前提。
自检问题:这批数据里,有没有一个我控制不了、但它每天都在变的因素?
-
比较「弹性」,而不是比较「总量」
判断该压流量还是压转化率,不能看哪个数字大,要看把每个变量推到上限能多拿多少结果:UV 推到上限 → 14,757 单;转化率推到上限 → 19,490 单。弹性 = 空间 ÷ 当前值。
自检问题:我准备投的这个方向,把它做到满分能带来多少增量?换成另一个方向呢?
-
假设库 + ICE:先排序,再验证;但别指望它预测
用「如果…预计…因为…」的标准句式写假设,用 ICE 排序。但要清楚:ICE 决定「先做哪个」,不决定「做了会不会成」。 本案例中 24 分的实验失败、23 分的实验大赢,就是最好的证明。
补充动作:高分假设要分散在不同的机制上,而不是集中在同一个页面的同一个区域(本案例 24 分档全落在「底部导航」,结果全灭)。
自检问题:我的假设库里,最期待的那几条,是不是都改的是同一个地方?
-
改「内容」的杠杆量级,通常远大于改「视觉」
在成熟核心页面上,视觉优化的空间会被用户的既有操作习惯吃掉。四次视觉类实验(价格面板、行动按钮、评价面板)全部不显著,一次内容改造即拿到 100% 置信的增量。
迁移判断:要改的是一个用户已经形成肌肉记忆的页面时,先问「这是信息问题还是摆放问题」;摆放问题,收益大概率在噪声范围内。这条结论的前提是「用户已熟悉该页面」,全新页面或全新触达场景下,视觉与信息架构的作用会完全相反。
-
路径一改,口径必须重建
当实验改变了用户路径时,以路径中间节点为分母的所有比率都会失真。必须回到路径起点的统一口径去计算收益,否则会拿到一个漂亮但无法对外说的数字。
自检问题:这次改动的受益人群,和上次统计的人群,是同一批人吗?
-
负结论要归档成「否决清单」
两次失败的视觉实验,产出的价值不在于「证明了什么有效」,而在于「证明了一整类事情无效」。把它们沉淀成一条可快速引用的否决依据,能省掉未来反复试错的成本。
自检问题:我们团队上一季度失败的实验,现在还有人知道结论吗?下次有人提出同类方案,我们能不能一眼否掉?
10如果重来一次
这张表不讨论哪一步做错了,只回答一个问题:同一批人、同一块资源、同一块牌桌,重做一次,会在哪六件事上做出不同的选择。
| 事项 | 我们会怎么做 |
|---|---|
| 会更早做的 | 一期就直接做「种草页内加购」,而不是先跳转再转化。一期受组件能力限制,被迫多加一次跳转,等于用一个较低的天花板验证了正确方向,之后又花一整轮实验把路径补回来。 |
| 会调整的 | 价格面板、行动按钮、评价面板这四次视觉实验合并成一轮,用同一个大流量池同时测多个组件变体,而不是拆成四份报告、占掉两个季度。 |
| 会砍掉的 | 评价面板实验(ICE 只有 20 分,和订单量的关系也最远)直接降级为长期优化项,不占实验排期。 |
| 会补上的 | ① 站外流量与内容分发渠道的验证:当时这块完全空白,是最大的未被探索空间;② 「种草内容质量」与效果的定量关系:我们已经知道内容要持续打磨,但内容质量本身从来没有被指标化,优化只能凭感觉。 |
| 会加强的 | ① 反向指标(当时只有跳失率一个守门指标);② 实验的分流均匀性校验(二期多款商品出现了组间访问 UV 偏差超 20%);③ 每份报告增加「执行保真度」一栏,用于区分「假设错了」还是「执行错了」。 |
| 会重新考虑的 | 把「选品」从背景条件提升为一级杠杆。转化率在 0.17%~34.26% 之间摆动 200 倍,这个摆幅比任何页面优化的效果都大一个量级。 |
这六条可以分成两类。会更早做、会调整、会砍掉这三条,是当时受组件能力、排期节奏和立项标准限制而不得不做的取舍;会补上、会加强、会重新考虑这三条,是当时根本没有意识到的盲区:站外渠道没测、内容质量没有指标化、分流均匀性没有校验、「选品」的杠杆级别被低估。
前一类可以靠在事前准备得更充分来避免,后一类只能靠事后复盘来发现。这就是这份复盘最实际的用处。
附附录
附录 A:完整假设库(13 条)
这是 Q2 当时的全部假设,共 13 条。状态列本身就是一条结论:
| # | 假设(如果 / 预计 / 因为) | ICE | 状态 |
|---|---|---|---|
| 1 | 商详首屏强调核心卖点,减少 5% 跳出、间接提升约 0.5% 转化率 | — | 已排除 |
| 2 | 打造「必买价」概念(对比必买价/日常价/特卖价),提升约 1% 转化率 | 8/7/8=23 | 已证伪1 |
| 3 | 突出限时倒计时,提升约 1% 转化率 | 8/7/8=23 | 已证伪1 |
| 4 | 传递信任度(正品/核酸检测等标签),提升 1% 转化率 | — | 已排除 |
| 5 | 减少首屏干扰信息,减少 5% 跳出 | — | 已排除 |
| 6 | 优化背书信息为图文榜单,提升 1% 转化率 | — | 已排除 |
| 7 | 优化评价模块展示样式,提升 1% 转化率 | 6/7/7=20 | 已证伪2 |
| 8 | 整合商品推荐样式与位置,减少决策干扰,提升 1% 转化率 | — | 已排除 |
| 9 | 底部导航优先展示客服入口,提升 1% 转化率 | 8/8/8=24 | 已证伪 |
| 10 | 底部导航去除商家入口,提升 1% 转化率 | 8/8/8=24 | 已证伪 |
| — | 场景化引导按钮(预告突出加购 / 正式突出购买) | 8/8/8=24 | 已证伪 |
| — | 预告商品改为种草内容(一期) | 7/8/8=23 | ✅ 已验证 |
| — | 种草页支持直接加购(二期) | 7/8/8=23 | ✅ 已验证 |
1 第 2、3 条由 Q2-2(价格面板)直接实验证伪。
2 第 7 条(Q2-4 / Q2-6)跑过,无显著效果,但原始数据未留存。
13 条假设里,拿到正向结果的 2 条;被实验判为无效的 6 条(2、3、7、9、10 与场景化引导按钮);剩下 5 条(1、4、5、6、8)随「改视觉」这一族整体排除,没有再单独验证。
两个状态词是刻意分开的:「已证伪」是实验跑完之后的结论,「已排除」是资源上的决定。 第 1~8 条整体划掉,依据是四次视觉类实验(Q2-2、Q2-3、Q2-4、Q2-6)加上「用户已经对核心页面形成操作习惯」这条洞察:同一个页面区域上的视觉调整,不值得再花一个实验周期。 这张表里没有「没做完」的灰色地带。
这个比例不是「命中率低」,而是假设库的正常样子:它的作用从来不是提高命中率,而是让团队在同一张表里同时看见「值得做的」和「已经排除的」。
附录 B:关键数据速查
正文里散落的关键数字集中在这里,方便单独引用和核对。
Q1 基线数据:去噪前 vs 去噪后
| 口径 | 必买商详 UV | 转化率 | 下单次数 |
|---|---|---|---|
| 去噪前 平均 | 197,921 | 7.61% | 1.18 |
| 去噪前 最大 | 319,020 | 19.80% | 1.4 |
| 去噪前 最小 | 50,672 | 0.17% | 0.9 |
| 去噪后 平均 | 210,026 | 6.00% | — |
| 去噪后 最大 | 245,950 | 9.28% | — |
| 去噪后 中位 | 209,790 | 3.80% | — |
站内流量结构与平台分布
| 来源页面 | 占比 | 转化率 | 效率判断 |
|---|---|---|---|
| 首页 | 41% | 6.23% | 高 |
| 鸡场主页 | 36% | 0.14% | 极低 |
| 会员中心 | 15% | 0.38% | 极低 |
| 商品详情页 | 5% | 3.70% | 中 |
| 搜索页 | 2% | 11.48% | 高(但量小) |
按平台:APP 177,060(83.21%)| H5 17,357(8.16%)| 小程序 15,706(7.38%)| VIP 2,656(1.25%)
Q2-1 核心战果与四个口径
| 口径 | 对照组 | 实验组 | 变化 |
|---|---|---|---|
| 整体加购率(各商品简单平均) | 10.14% | 14.04% | +38.5% |
| 加购转化率 | 26.09% | 35.41% | +35.7% |
| 显著性检验转化率 | 8.72% | 12.55% | +43.96% |
| 商详加购率(口径失真) | 10.14% | 45.04% | +344.2%(不可用) |
| 聚合口径(补算) | 7.12% | 12.18% | +71.1% |
| 统计置信度 | — | — | 100.00% |
规模化后的整体表现
| 指标 | 数值 |
|---|---|
| 必买上线后日均 UV | 21 万(上线前 8.7 万,提升约 1.4 倍) |
| 成交转化率 平均 / 最高 / 最低 | 7.2% / 34.26% / 0.17% |
| 目标 / 完成 / 达成率 | 2.5 亿 / 阶段 1.9 亿(进度 75%)→ 全年达成并超额 |
| 项目定位 | 打造服务商舒适圈 |
| 节奏 | 一期核心:必买商详转化率提升;二期核心:种草 |
附录 C:术语表
读正文时如果遇到不确定的术语,回这里查。「在本案例对应」一列给出它在这次业务里的具体所指。
| 术语 | 一句话解释 | 在本案例对应 |
|---|---|---|
| 因子分解 | 把大指标按业务运算关系逐层拆到可单独做 A/B 的变量 | 订单量 → UV × 转化率 × 下单次数 |
| 弹性 | 把变量推到上限能多拿的结果 ÷ 当前结果 | UV 14,757 单 vs 转化率 19,490 单 |
| ICE 打分 | Impact 影响 × Confidence 概率 × Ease 难度的 10 分制加总,用于排序 | 假设库的排序依据 |
| 反向指标 | 防止「赢了指标、输了体验」的守门指标 | 跳失率 |
| 加购率 | 加购 UV ÷ 预告页访问 UV,衡量预热期的意向下单率 | 两次种草实验的核心指标 |
| 加购转化率 | 加购用户中最终成交的比例,衡量意向的兑现质量 | 26.09% → 35.41% |
| 口径 | 一个指标的分母定义了什么人群,口径不同数字不可比 | 同一个实验报出的四个数字 |
| 执行保真度 | 实际执行与实验方案的偏差程度,决定失败是「假设错」还是「执行错」 | 底部导航实验:补跑后仍无效,归为假设错 |
附录 D:数据口径说明
1. 所有「提升幅度」都标了口径,跨实验比较时请先确认分母定义是否一致。
2. Q2-2 / Q2-3 的转化率取的是各主推日的平均值,与逐商品明细的简单平均会有微小差异。
3. Q2-5 的加购率是「加购 UV ÷ 访问 UV」的组内聚合值,与一期的「各商品简单平均」口径不同,不可直接横比。
4. Q2-1 的「商详加购率」分母被人为收窄,属于失真口径,只作说明保留,不用于任何对外表述。
5. 目标 2.5 亿 / 已完成 1.9 亿是项目推进到该阶段时的累计口径,75% 是阶段性进度,不是全年结论;该阶段之后,年度目标 100% 达成并超额。
6. Q2-4 / Q2-6 已跑完,结论为无显著效果,但原始数据未留存,故正文与附录不列其明细。
云集「必买」增长项目 · 完整案例讲解。
如果只带走一条,就带走这一条:增长工作的核心竞争力,不在于能想出多少点子,而在于能在多小的代价下知道自己错了。