一两口径读数:转化持平,篮子变大
转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 成交金额 ÷ 咨询人数(未成交计 0)。
成交人数
621人
对照 600 人 | 转化 39.60% vs 39.50%(+0.10pp,不显著)
单人产值差
+10.5元
57.1 vs 46.6 元 | +22.5%,p=0.033(本次实验唯一显著项)
客单价差
+22元
144 vs 122 元 | +18.0%,笔数几乎不变但单笔更大
5 天序列转化差
−1.07pp
35.19% vs 36.27%(p=0.342)| 5 天里 4 天为负
| 桶 | 咨询人数 | 成交人数 | 转化率 | 转人工率 | 机器人平均发言条数 | 客单价 | 单人产值 |
| 最优桶 | 1,568 | 621 | 39.60% | 40.4% | 6.30 | 144 元 | 57.1 元 |
| 基础版 | 1,519 | 600 | 39.50% | 39.2% | 5.32 | 122 元 | 46.6 元 |
| 直连人工组 | 76 | 28 | 36.84% | 100% | 1.00 | 146 元 | 53.8 元 |
这店的「负向」是口径造成的。首版只算当日成交,读数是 +0.59pp;补齐机器人促成、跟单、次日成交三条路径后变 +0.10pp,转人工段与纯机器人段的 p 值分别是 0.522 和 0.627 —— 两桶在窗口内统计等价。成交笔数几乎一样(621 vs 600),但篮子更大(客单 122→144 元),所以单人产值 +10.5 元。只看转化率会误杀这个版本;只看 GMV 又会高估它(见第六节)。
顺带证伪一条首版机制。首版猜「会话更长 → 决策拖到次日 → 次日付款被漏算更多」。实际该店次日独占付款(当日未付、次日才付)最优桶 1.48%、基础版 2.44%,方向与假设相反。
直连人工组是该店最低转化(36.84%)。全程不让机器人接待并没有更好。样本仅 76 人、只作方向性参考,但三店方向一致。
二前提体检:这店的前提最干净,问题只在窗口
成立
分桶是随机的
分流比例 50.79%,p = 0.378,未失衡。指标差异可以往下归因。
成立
两天各自完整
成熟运行中的实验,两天每日首请求均在 00:00 前后,两天符号相反且量级都在 ±1.3pp 内 —— 这本身就是「两桶等价」的旁证。
不成立
关键词意图标签可信
首版指认的失血口「纯图/链接」,该店有 94.6% 的买家其实发过明确文本诉求,只是词表没覆盖。它不是「低表达高意向流量」,就是普通的单属性提问。建立在它上面的唯一显著结论(−7.2pp)随标签一起作废。
要改
窗口具有代表性
这两天正落在大促窗口(8/4-8/9)内:该店日转化率从平日 33-35% 跳到 38-40%、单人产值从约 30 元跳到约 50 元,绝对水位被整体抬了一档。前五节读数都应理解为「大促窗口内的读数」,第六节用 5 天序列回调。
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) |
| 08-04 | 779 | 40.05% | 813 | 38.75% | -1.30 |
| 08-05 | 754 | 38.33% | 783 | 39.59% | +1.26 |
人数为「人·天」口径,跨天买家会重复计入,故与全窗口去重人数略有出入;桶内比较不受影响。
三场景下钻:整体持平不是「什么都没发生」,是一涨一跌相互抵消
场景由买家首句原话按优先级规则归入,互斥不重叠。该店首句文本覆盖率在三店 94.5%-98.7% 区间内,不是抽样近似。
| 场景 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | p | 最优桶转人工 | 基础版转人工 |
| 选品适配与喂养 | 443 | 39.3% | 417 | 39.1% | -0.2 | 0.955 | 27.6% | 27.8% |
| 参数与信任凭证 | 237 | 30.4% | 279 | 33.3% | +3.0 | 0.473 | 29.0% | 24.9% |
| 其他无诉求 | 165 | 33.3% | 162 | 40.7% | +7.4 | 0.165 | 53.1% | 48.5% |
| 版本辨识与对比 | 124 | 49.2% | 127 | 47.2% | -1.9 | 0.757 | 41.7% | 46.0% |
| 试吃与退换保障 | 111 | 49.5% | 108 | 53.7% | +4.2 | 0.539 | 38.9% | 36.0% |
| 找货与货源落空 | 87 | 41.4% | 110 | 29.1% | -12.3 | 0.072 | 60.0% | 57.5% |
| 物流订单会员 | 94 | 46.8% | 101 | 58.4% | +11.6 | 0.105 | 57.4% | 72.3% |
| 价格活动与比价 | 108 | 47.2% | 81 | 44.4% | -2.8 | 0.705 | 46.9% | 42.6% |
| 症状驱动选品 | 75 | 34.7% | 97 | 33.0% | -1.7 | 0.818 | 30.9% | 28.0% |
| 直接要人工 | 29 | 37.9% | 35 | 25.7% | -12.2 | 0.294 | 94.3% | 93.1% |
| 品质异议与退换 | 24 | 25.0% | 29 | 10.3% | -14.7 | 0.157 | 86.2% | 87.5% |
| 整体 | 1,519 | 39.50% | 1,568 | 39.60% | +0.10 | — | 40.4% | 39.2% |
跌的一头:找货与货源落空 −12.3pp(p=0.072,折损约 13.5 人,且最优桶该场景占比还多了 1.3pp)。最优桶答不上来的比例 23.6%、基础版 18.4%,转人工 60% 也救不回来。买家问「这个没货了吗 / 怎么下架了 / 兑换不了 / 在哪买」,机器人回一句「抱歉没找到」就结束。这是真实的能力边界,不是促单问题。
涨的一头:物流订单会员 +11.6pp(p=0.105),而且是把转人工率从 72.3% 打到 57.4% 换来的 —— 机器人自己把发货时效、快递、改地址答了,既省人工又多成交。这是本次实验里唯一同时看到「降本」和「提转化」的场景,也是最该横向复制给另外两店的动作。
占 26% 的最大场景「选品适配与喂养」逐场景持平(−0.2pp,p=0.955),说明版本能力没有退化,与整体等价的结论自洽。结构 / 能力分解:能力效应 +0.69pp、结构效应 −0.42pp、交互 −0.16pp —— 买家来问什么两桶几乎一样。
四机制定位:两段都等价,没有可归因的失血点
把每桶拆成「转过人工」和「纯机器人走完」两段,再把最优桶的转人工占比固定回基础版水平做反事实。
| 桶 | 转人工率 | 转人工段人数 | 转人工段转化 | 纯机器人人数 | 纯机器人段转化 | 答不上来 | 整体转化 |
| 基础版 | 39.2% | 595 | 41.0% | 924 | 38.5% | 13.5% | 39.50% |
| 最优桶 | 40.4% | 633 | 42.8% | 935 | 37.4% | 13.8% | 39.60% |
| 分段 | 基础版 | 最优桶 | 差值(pp) | p | 判读 |
| 转人工段 | 41.0% (244/595) | 42.8% (271/633) | +1.8 | 0.522 | 等价 |
| 纯机器人段 | 38.5% (356/924) | 37.4% (350/935) | -1.1 | 0.627 | 等价 |
| 转人工率差 | 实际转化 | 反事实转化(转人工占比固定回对照) | 结构贡献 | 段内能力 | 交互 | 总差值 |
| +1.2pp | 39.60% | 39.54% | +0.03 | +0.04 | +0.03 | +0.10 |
这店没有可定位的失血点,因为整体本来就没失血。两段各自 p>0.5,反事实分解三项全部在 ±0.05pp 内 —— 转人工占比只差 1.2pp,怎么挪都挪不出东西。真正值得追的不是「哪里掉了」,而是客单为什么涨了 22 元(需外部核实是否来自搭配组合推荐,本次未取该字段)。
五机会点折算:以对照桶同场景水位为目标
口径:以基础版同场景转化率为目标水位,算最优桶补齐差值可多产生的成交人数,按该店最优桶实际客单 144 元折算,只列差值为负且两桶合计 ≥60 人的场景。观测 2 天。仅供参考 · 不构成承诺值 · 不作考核依据。
| 场景 | 分层 | 最优桶人数 | 缺口(pp) | 可补成交人数 | 折日均 | 日均 GMV 机会 |
| 找货与货源落空 | B | 110 | 12.3 | 13.5 | 6.8 | 975 元 |
| 直接要人工 | — | 35 | 12.2 | 4.3 | 2.1 | 308 元 |
| 版本辨识与对比 | B | 127 | 1.9 | 2.5 | 1.2 | 179 元 |
| 价格活动与比价 | A | 81 | 2.8 | 2.3 | 1.1 | 162 元 |
| 症状驱动选品 | C | 97 | 1.7 | 1.6 | 0.8 | 117 元 |
| 选品适配与喂养 | B | 417 | 0.2 | 0.8 | 0.4 | 57 元 |
| 合计(实验桶内) | — | — | — | — | — | 约 1,799 元/日 |
全店按实验桶约占售前流量一半放大 ×2 ≈ 3,600 元/日,其中「找货与货源落空」一个场景占 54%。仅供参考 · 不构成承诺值 · 不作考核依据。
六稳健性与复核安排:窗口内的「正向」是选窗选出来的
5 天合计成交人数
1,280人
对照 1,281 人 | 转化 -1.07pp(p=0.342),5 天里 4 天为负
5 天单人产值差
+3.7元
41.6 vs 37.9 元 | +9.8%(窗口内是 +10.5 元 / +22.5%)
发言条数增幅
+18%
6.27 vs 5.23 条 | 5 天里 5 天都更高,从未翻转
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | 基础版单人产值 | 最优桶单人产值 | 差值 | 最优桶发言条数 | 基础版发言条数 |
| 08-01 | 655 | 34.66% | 673 | 33.14% | -1.52 | 34.1 元 | 34.4 元 | +0.3 | 6.47 | 5.31 |
| 08-02 | 669 | 33.48% | 691 | 31.55% | -1.93 | 28.1 元 | 31.8 元 | +3.7 | 6.18 | 5.23 |
| 08-03 | 675 | 33.93% | 677 | 31.61% | -2.32 | 32.3 元 | 24.4 元 | -7.9 | 6.21 | 4.99 |
| 08-04 | 779 | 40.05% | 813 | 38.75% | -1.31 | 45.1 元 | 51.7 元 | +6.6 | 6.18 | 5.28 |
| 08-05 | 754 | 38.33% | 783 | 39.59% | +1.26 | 47.4 元 | 60.8 元 | +13.4 | 6.32 | 5.31 |
| 全序列 | 3,532 | 36.27% | 3,637 | 35.19% | -1.07 (p=0.342) | 37.9 元 | 41.6 元 | +3.7 | 6.27 | 5.23 |
转化率的符号在 5 天里有 4 天是负的,只有 08-05 转正 —— 而锁定窗口恰好包含了这唯一一个正日。5 天并起来是 −1.07pp(p=0.342,仍不显著),方向从「+0.10pp 微正」翻成「−1.07pp 微负」。这说明锁定窗口的「两桶等价」是对的,「版本正向」是选窗选出来的。GMV 侧同理:08-05 单日 +13.4 元把窗口内均值拉到 +10.5 元(p=0.033),5 天口径只剩 +3.7 元。成交笔数 1,280 vs 1,281 —— 几乎一样多的单,最优桶多卖了 3.7 元/人,这才是真实画像。
动作
建「找货与货源落空」的兜底闭环(该店最大失血口,约 975 元/日机会)
现状:答不上来 23.6%、转化 29.1%、转人工 60%,回答「没找到 / 已下架」就结束。动作:缺货或下架判定后必须给同系列替代品 + 到货登记 + 兑换规则说明,禁止以「抱歉没找到」收尾。
把物流订单自助的做法整理成可复制方案(该店已验证)
该场景转人工 72.3%→57.4%、转化 46.8%→58.4%,只依赖订单数据、零商品知识依赖。这是三店里唯一被验证同时降本和提转化的动作,应作为标准方案输出给冠能与 toptrees。
B 层答完必须收口
选品适配、参数凭证、版本对比三档合计占该店大半人数,逐场景持平说明机器人答得住 —— 缺的是最后一句。动作:答完后追加「紧迫 + 背书 + 低风险」并主动收口,配套基建是商品结构化属性库 + 商品定位。
复核安排:要的不是更多样本,而是一个干净窗口
该店已有 3,637 / 3,532 人,样本足够;问题是锁定的两天在大促里。动作是取 8/10 之后的 5 个连续非大促日重跑同一套口径,主看两个指标:成交笔数差(现在是 1,280 vs 1,281)和单人产值差(大促窗口内 +10.5 元、5 天口径 +3.7 元)。
放量门槛:非大促窗口里单人产值优势仍 ≥ +3 元、且转化率不掉超过 1pp,就可以放量;否则按考核指标取舍。
仍需外部核实:客单 +22 元(+18.0%)是否来自搭配组合推荐 —— 需拉「一次会话内推荐商品数 / 成交商品数」验证,本次未取该字段。这条决定了「篮子变大」是版本能力还是流量结构波动。
口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。