一两口径读数:笔数和篮子同时偏负
转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 成交金额 ÷ 咨询人数(未成交计 0)。
成交人数
137人
对照 139 人(人数基数更大)| 转化 36.34% vs 41.25%(−4.91pp,p≈0.4 不显著)
单人产值差
−24.6元
96.5 vs 121.0 元 | −20.3%,p=0.183 不显著
客单价差
−31元
265 vs 296 元 | −10.5%,三店里唯一客单也偏负的店
转人工率
26.0%
对照 38.3% | 低 12.3pp,成本侧确实省了
| 桶 | 咨询人数 | 成交人数 | 转化率 | 转人工率 | 机器人平均发言条数 | 客单价 | 单人产值 |
| 最优桶 | 377 | 137 | 36.34% | 26.0% | 8.67 | 265 元 | 96.5 元 |
| 基础版 | 337 | 139 | 41.25% | 38.3% | 5.59 | 296 元 | 121.0 元 |
| 直连人工组 | 11 | 2 | 18.18% | 100% | 1.00 | 222 元 | 40.4 元 |
口径修正让负向缩小但没消失。首版只算当日成交,读数是 −5.67pp;补齐机器人促成、跟单、次日成交后是 −4.91pp。两段(转人工段 / 纯机器人段)的 p 值分别是 0.413 和 0.374,都不显著。
该店机器人发言条数比对照多 60%(8.67 vs 5.59 条),是三店里增幅最大的。版本明显在多说话、也确实少转了人工,但既没换来成交、也没换来更大的篮子 —— 这是「多说话 ≠ 说到点上」在三店里表现最极端的一家。
直连人工组是该店最低转化(18.18%)。全程不让机器人接待并没有更好。样本仅 11 人、只作方向性参考。
二前提体检:随机性成立,但窗口有硬伤
成立
分桶是随机的
分流比例 52.80%,p = 0.134,未失衡。指标差异可以往下归因。
不成立
窗口完整可比
该店 08-04 下午 14:27 才上线,当天只有半天曝光、仅 73 / 89 人;08-05 承载了 77% 的量,而负向全部住在 08-05(08-04 单独看还是 +3.71pp)。冷启动叠加单日效应,不能与成熟运行的店同等对待。
不成立
关键词意图标签可信
首版指认的失血口「纯图/链接」,该店有 92.6% 的买家其实发过明确文本诉求,只是词表没覆盖。建立在它上面的唯一显著结论(−7.2pp)随标签一起作废。
要改
窗口具有代表性
这两天正落在大促窗口(8/4-8/9)内,绝对水位被整体抬了一档。该店没有非大促期的分桶序列可比 —— 这也是它必须扩样的另一个理由。
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) |
| 08-04(下午上线,半天) | 73 | 35.62% | 89 | 39.33% | +3.71 |
| 08-05 | 267 | 43.07% | 290 | 35.52% | -7.55 |
人数为「人·天」口径,跨天买家会重复计入,故与全窗口去重人数略有出入;桶内比较不受影响。
三场景下钻:没有一个场景能背锅,典型的弥散型
场景由买家首句原话按优先级规则归入,互斥不重叠。
| 场景 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | p | 最优桶转人工 | 基础版转人工 |
| 选品适配与喂养 | 85 | 29.4% | 80 | 31.2% | +1.8 | 0.797 | 16.2% | 24.7% |
| 参数与信任凭证 | 71 | 38.0% | 75 | 36.0% | -2.0 | 0.800 | 22.7% | 32.4% |
| 试吃与退换保障 | 40 | 40.0% | 42 | 38.1% | -1.9 | 0.860 | 14.3% | 27.5% |
| 症状驱动选品 | 25 | 36.0% | 40 | 27.5% | -8.5 | 0.470 | 20.0% | 32.0% |
| 价格活动与比价 | 29 | 55.2% | 26 | 50.0% | -5.2 | 0.701 | 38.5% | 55.2% |
| 物流订单会员 | 28 | 53.6% | 22 | 40.9% | -12.7 | 0.374 | 63.6% | 67.9% |
| 其他无诉求 | 22 | 68.2% | 28 | 39.3% | -28.9 | 0.042 (22/28 人,不采信) | 21.4% | 50.0% |
| 版本辨识与对比 | 14 | 57.1% | 27 | 40.7% | -16.4 | 0.318 | 25.9% | 50.0% |
| 找货与货源落空 | 9 | 11.1% | 19 | 36.8% | +25.7 | 0.159 | 42.1% | 33.3% |
| 整体 | 337 | 41.25% | 377 | 36.34% | -4.91 | — | 26.0% | 38.3% |
所有业务场景的 p 都在 0.3-0.9 之间,唯一 p<0.05 的是残留档(22/28 人,分子不足 20,不采信)。每个场景掉 2-13pp、单独都不显著,加起来才成一个 −4.91pp —— 这就是弥散型负向,指不到具体位置。
但有一个跨场景的一致现象:最优桶几乎每个场景的转人工率都比基础版低约 10pp(选品 16.2% vs 24.7%、参数 22.7% vs 32.4%、试吃 14.3% vs 27.5%、版本对比 25.9% vs 50.0%),机器人平均发言条数 5.59→8.67。「多说了很多、少交了很多给人工」到底值不值钱,见下一节的反事实。
结构 / 能力分解:能力效应 −4.55pp、结构效应 −0.33pp、交互 −0.02pp。买家来问什么两桶几乎一样,差异全在「同一场景里答得怎么样」—— 但那个「怎么样」在每个场景上都不显著。
四机制定位:「少转人工丢了人工兜底」被量化否掉了
把每桶拆成「转过人工」和「纯机器人走完」两段,再把最优桶的转人工占比固定回基础版水平做反事实,直接量化这个假设值多少 pp。
| 桶 | 转人工率 | 转人工段人数 | 转人工段转化 | 纯机器人人数 | 纯机器人段转化 | 答不上来 | 整体转化 |
| 基础版 | 38.3% | 129 | 44.2% | 208 | 39.4% | 9.8% | 41.25% |
| 最优桶 | 26.0% | 98 | 38.8% | 279 | 35.5% | 12.5% | 36.34% |
| 分段 | 基础版 | 最优桶 | 差值(pp) | p | 判读 |
| 转人工段 | 44.2% (57/129) | 38.8% (38/98) | -5.4 | 0.413 | 弥散 |
| 纯机器人段 | 39.4% (82/208) | 35.5% (99/279) | -3.9 | 0.374 | 弥散 |
| 转人工率差 | 实际转化 | 反事实转化(转人工占比固定回对照) | 结构贡献 | 段内能力 | 交互 | 总差值 |
| -12.3pp | 36.34% | 36.74% | -0.59 | -4.50 | +0.18 | -4.91 |
「少转人工」这个假设量化后不成立。转人工占比降了 12.3pp,但这只解释 −0.59pp(占 −4.91pp 的 12%)。原因很直白:两段的转化落差本来就不大(基础版 44.2% vs 39.4%,只差 4.8pp),人群在两段之间怎么挪都挪不出几个百分点。转人工率是成本指标,不要当转化杠杆用。另外要注意:该店直连人工组转化只有 18.18%,所谓「人工兜底更强」在这店本身就不成立。
剩下的 −4.50pp 是弥散的,指不到具体位置。两段各降 4-5pp 但 p=0.413 / 0.374,场景层面也无一显著。在 98-279 人的样本量下,这个形态与「冷启动 + 单日效应」完全一致(该店第一天下午才上线、负向全在第二天)。结论:不在本窗口内做归因,扩样复测。
五机会点折算:能定位的只有三分之一
口径:以基础版同场景转化率为目标水位,算最优桶补齐差值可多产生的成交人数,按该店最优桶实际客单 265 元折算,只列差值为负且两桶合计 ≥60 人的场景。观测 2 天。仅供参考 · 不构成承诺值 · 不作考核依据。
| 场景 | 分层 | 最优桶人数 | 缺口(pp) | 可补成交人数 | 折日均 | 日均 GMV 机会 |
| 症状驱动选品 | C | 40 | 8.5 | 3.4 | 1.7 | 451 元 |
| 参数与信任凭证 | B | 75 | 2.0 | 1.5 | 0.8 | 202 元 |
| 试吃与退换保障 | A | 42 | 1.9 | 0.8 | 0.4 | 106 元 |
| 合计(实验桶内) | — | — | — | — | — | 约 759 元/日 |
需要诚实标注:整体 −4.91pp 对应约 18.5 个成交人、折日均约 2,450 元,但场景基只能归到 759 元 —— 差额落在人数不足 60 的碎片场景里,无法定位。这本身就是「弥散型负向」的另一种表述,也是不建议在本窗口做该店归因结论的原因。仅供参考 · 不构成承诺值 · 不作考核依据。
六稳健性与复核安排:唯一同向的是「篮子也没变大」
两天合计转化差
−5.06pp
36.41% vs 41.47%(p=0.165,不显著)
两天合计单人产值差
−24.0元
96.0 vs 120.0 元 | 两天都负约 25 元,是唯一同向的信号
客单价差
−25元
264 vs 289 元 | −8.9%,笔数少了、篮子也没变大
发言条数增幅
+60%
8.49-9.16 vs 5.05-5.68 条 | 三店里增幅最大
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | 基础版单人产值 | 最优桶单人产值 | 差值 | 最优桶转人工 | 基础版转人工 |
| 08-04(下午上线) | 73 | 35.62% | 89 | 39.33% | +3.71 | 124.3 元 | 97.1 元 | -27.2 | 28.1% | 43.8% |
| 08-05 | 267 | 43.07% | 290 | 35.52% | -7.55 | 118.8 元 | 95.6 元 | -23.2 | 25.2% | 36.3% |
| 全序列 | 340 | 41.47% | 379 | 36.41% | -5.06 (p=0.165) | 120.0 元 | 96.0 元 | -24.0 | 25.9% | 37.9% |
这店没有序列可查 —— 更早三天完全没有分桶记录,实验就是 08-04 下午上线的。转化差在两天里符号相反(+3.7 / −7.6),唯一同向的是单人产值两天都负约 25 元,客单也是负的(−8.9%)。它是三店里唯一「笔数少了、篮子也没变大」的店 —— 另外两店至少还有客单上涨可以抵一部分。但 379 / 340 人上的 −5pp 依然不显著,结论不变:扩样后再判。
动作
先复制麦富迪已验证的 A 层订单/物流自助(不依赖本店结论,零风险)
该店物流订单会员场景转人工 63.6% / 67.9%、转化 40.9% vs 53.6%,是本店负向最大的单个场景(−12.7pp)。而麦富迪已验证:该场景只需订单数据就能把转人工从 72.3% 压到 57.4%、转化 +11.6pp。这件事不用等扩样结论就能做。
别再拧转人工率这个 KPI
该店转人工率已经比对照低 12.3pp(26.0% vs 38.3%),成本侧收益是真的,但反事实显示这只解释了 −0.59pp 的转化损失。继续压转人工率不会带来转化,反而会把弥散型风险做大。成本指标和转化指标要分开考核。
C 层(症状驱动选品)老实转人工
该店症状驱动选品 −8.5pp、是场景表里除碎片档外最大的负项,且涉处方粮与病症判断。动作:同一场景连续 2 轮答不上来即转人工并附承接话术,不要让机器人在专业问题上硬撑。
复核安排:三店里优先级最高的一家
现有 379 / 340 人,要把 −5pp 打到 95% 显著需要约 1,200 人/组,按 08-05 的日流量(约 280/组)大约还需 4-5 天。硬性要求两条:
① 必须把 08-04(半天曝光)从主口径剔除,或改用「上线后曝光时长对齐」的口径,否则冷启动会继续污染判断;
② 转人工段与纯机器人段分开出数,看 −4.50pp 的段内能力差在扩样后是收敛还是坐实。
它是三店里唯一转化与客单同时偏负的店,优先级最高。
仍需外部核实:该店负向是否为冷启动效应 —— 需扩样到约 1,200 人/组复测,或拉齐两桶上线后曝光时长再比。本窗口数据无法证伪这一条。
口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。自动复核已排在 8/15。