冠能 · 版本诊断暂缓放量 · 扩样复测

窗口 2026-08-04 ~ 08-05(严格锁定)|该店 08-04 下午 14:27 才上线,更早三天无分桶数据|对比 最优桶 / 基础版 / 直连人工组
转化口径为全渠道付款(当日成交 + 机器人促成 + 跟单 + 次日成交),并列单人产值(成交金额 ÷ 咨询人数,未成交计 0)
一句话:方向确实是负的,但这个负向指不到具体位置,而且窗口本身有硬伤。
转化 −4.91pp(p≈0.4 不显著)、单人产值 −20.3%(p=0.183)。每个场景掉 2-13pp、单独都不显著,加起来才凑成这个 −4.91pp —— 这是弥散型负向。同时该店上线才 1.4 天,第二天承载 77% 的量、负向全部落在第二天(第一天单看还是 +3.71pp),形态与冷启动完全一致。 它是三店里唯一「笔数少了、篮子也没变大」的店,所以扩样优先级最高。

两口径读数:笔数和篮子同时偏负

转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 成交金额 ÷ 咨询人数(未成交计 0)。

成交人数
137
对照 139 人(人数基数更大)| 转化 36.34% vs 41.25%(−4.91pp,p≈0.4 不显著)
单人产值差
−24.6
96.5 vs 121.0 元 | −20.3%,p=0.183 不显著
客单价差
−31
265 vs 296 元 | −10.5%,三店里唯一客单也偏负的店
转人工率
26.0%
对照 38.3% | 低 12.3pp,成本侧确实省了
咨询人数成交人数转化率转人工率机器人平均发言条数客单价单人产值
最优桶37713736.34%26.0%8.67265 元96.5 元
基础版33713941.25%38.3%5.59296 元121.0 元
直连人工组11218.18%100%1.00222 元40.4 元
口径修正让负向缩小但没消失。首版只算当日成交,读数是 −5.67pp;补齐机器人促成、跟单、次日成交后是 −4.91pp。两段(转人工段 / 纯机器人段)的 p 值分别是 0.413 和 0.374,都不显著
该店机器人发言条数比对照多 60%(8.67 vs 5.59 条),是三店里增幅最大的。版本明显在多说话、也确实少转了人工,但既没换来成交、也没换来更大的篮子 —— 这是「多说话 ≠ 说到点上」在三店里表现最极端的一家。
直连人工组是该店最低转化(18.18%)。全程不让机器人接待并没有更好。样本仅 11 人、只作方向性参考。

前提体检:随机性成立,但窗口有硬伤

成立
分桶是随机的
分流比例 52.80%,p = 0.134,未失衡。指标差异可以往下归因。
不成立
窗口完整可比
该店 08-04 下午 14:27 才上线,当天只有半天曝光、仅 73 / 89 人;08-05 承载了 77% 的量,而负向全部住在 08-05(08-04 单独看还是 +3.71pp)。冷启动叠加单日效应,不能与成熟运行的店同等对待。
不成立
关键词意图标签可信
首版指认的失血口「纯图/链接」,该店有 92.6% 的买家其实发过明确文本诉求,只是词表没覆盖。建立在它上面的唯一显著结论(−7.2pp)随标签一起作废。
日期基础版人数基础版转化最优桶人数最优桶转化差值(pp)
08-04(下午上线,半天)7335.62%8939.33%+3.71
08-0526743.07%29035.52%-7.55

人数为「人·天」口径,跨天买家会重复计入,故与全窗口去重人数略有出入;桶内比较不受影响。

场景下钻:没有一个场景能背锅,典型的弥散型

场景由买家首句原话按优先级规则归入,互斥不重叠。

场景基础版人数基础版转化最优桶人数最优桶转化差值(pp)p最优桶转人工基础版转人工
选品适配与喂养8529.4%8031.2%+1.80.79716.2%24.7%
参数与信任凭证7138.0%7536.0%-2.00.80022.7%32.4%
试吃与退换保障4040.0%4238.1%-1.90.86014.3%27.5%
症状驱动选品2536.0%4027.5%-8.50.47020.0%32.0%
价格活动与比价2955.2%2650.0%-5.20.70138.5%55.2%
物流订单会员2853.6%2240.9%-12.70.37463.6%67.9%
其他无诉求2268.2%2839.3%-28.90.042 (22/28 人,不采信)21.4%50.0%
版本辨识与对比1457.1%2740.7%-16.40.31825.9%50.0%
找货与货源落空911.1%1936.8%+25.70.15942.1%33.3%
整体33741.25%37736.34%-4.9126.0%38.3%
所有业务场景的 p 都在 0.3-0.9 之间,唯一 p<0.05 的是残留档(22/28 人,分子不足 20,不采信)。每个场景掉 2-13pp、单独都不显著,加起来才成一个 −4.91pp —— 这就是弥散型负向,指不到具体位置。
但有一个跨场景的一致现象:最优桶几乎每个场景的转人工率都比基础版低约 10pp(选品 16.2% vs 24.7%、参数 22.7% vs 32.4%、试吃 14.3% vs 27.5%、版本对比 25.9% vs 50.0%),机器人平均发言条数 5.59→8.67。「多说了很多、少交了很多给人工」到底值不值钱,见下一节的反事实。
结构 / 能力分解:能力效应 −4.55pp、结构效应 −0.33pp、交互 −0.02pp。买家来问什么两桶几乎一样,差异全在「同一场景里答得怎么样」—— 但那个「怎么样」在每个场景上都不显著。

机制定位:「少转人工丢了人工兜底」被量化否掉了

把每桶拆成「转过人工」和「纯机器人走完」两段,再把最优桶的转人工占比固定回基础版水平做反事实,直接量化这个假设值多少 pp。

转人工率转人工段人数转人工段转化纯机器人人数纯机器人段转化答不上来整体转化
基础版38.3%12944.2%20839.4%9.8%41.25%
最优桶26.0%9838.8%27935.5%12.5%36.34%
分段基础版最优桶差值(pp)p判读
转人工段44.2% (57/129)38.8% (38/98)-5.40.413弥散
纯机器人段39.4% (82/208)35.5% (99/279)-3.90.374弥散
转人工率差实际转化反事实转化(转人工占比固定回对照)结构贡献段内能力交互总差值
-12.3pp36.34%36.74%-0.59-4.50+0.18-4.91
「少转人工」这个假设量化后不成立。转人工占比降了 12.3pp,但这只解释 −0.59pp(占 −4.91pp 的 12%)。原因很直白:两段的转化落差本来就不大(基础版 44.2% vs 39.4%,只差 4.8pp),人群在两段之间怎么挪都挪不出几个百分点。转人工率是成本指标,不要当转化杠杆用。另外要注意:该店直连人工组转化只有 18.18%,所谓「人工兜底更强」在这店本身就不成立。
剩下的 −4.50pp 是弥散的,指不到具体位置。两段各降 4-5pp 但 p=0.413 / 0.374,场景层面也无一显著。在 98-279 人的样本量下,这个形态与「冷启动 + 单日效应」完全一致(该店第一天下午才上线、负向全在第二天)。结论:不在本窗口内做归因,扩样复测。

机会点折算:能定位的只有三分之一

口径:以基础版同场景转化率为目标水位,算最优桶补齐差值可多产生的成交人数,按该店最优桶实际客单 265 元折算,只列差值为负且两桶合计 ≥60 人的场景。观测 2 天。仅供参考 · 不构成承诺值 · 不作考核依据。

场景分层最优桶人数缺口(pp)可补成交人数折日均日均 GMV 机会
症状驱动选品C408.53.41.7451 元
参数与信任凭证B752.01.50.8202 元
试吃与退换保障A421.90.80.4106 元
合计(实验桶内)约 759 元/日
需要诚实标注:整体 −4.91pp 对应约 18.5 个成交人、折日均约 2,450 元,但场景基只能归到 759 元 —— 差额落在人数不足 60 的碎片场景里,无法定位。这本身就是「弥散型负向」的另一种表述,也是不建议在本窗口做该店归因结论的原因。仅供参考 · 不构成承诺值 · 不作考核依据。

稳健性与复核安排:唯一同向的是「篮子也没变大」

两天合计转化差
−5.06pp
36.41% vs 41.47%(p=0.165,不显著)
两天合计单人产值差
−24.0
96.0 vs 120.0 元 | 两天都负约 25 元,是唯一同向的信号
客单价差
−25
264 vs 289 元 | −8.9%,笔数少了、篮子也没变大
发言条数增幅
+60%
8.49-9.16 vs 5.05-5.68 条 | 三店里增幅最大
日期基础版人数基础版转化最优桶人数最优桶转化差值(pp)基础版单人产值最优桶单人产值差值最优桶转人工基础版转人工
08-04(下午上线)7335.62%8939.33%+3.71124.3 元97.1 元-27.228.1%43.8%
08-0526743.07%29035.52%-7.55118.8 元95.6 元-23.225.2%36.3%
全序列34041.47%37936.41%-5.06 (p=0.165)120.0 元96.0 元-24.025.9%37.9%
这店没有序列可查 —— 更早三天完全没有分桶记录,实验就是 08-04 下午上线的。转化差在两天里符号相反(+3.7 / −7.6),唯一同向的是单人产值两天都负约 25 元,客单也是负的(−8.9%)。它是三店里唯一「笔数少了、篮子也没变大」的店 —— 另外两店至少还有客单上涨可以抵一部分。但 379 / 340 人上的 −5pp 依然不显著,结论不变:扩样后再判。

动作

先复制麦富迪已验证的 A 层订单/物流自助(不依赖本店结论,零风险)
该店物流订单会员场景转人工 63.6% / 67.9%、转化 40.9% vs 53.6%,是本店负向最大的单个场景(−12.7pp)。而麦富迪已验证:该场景只需订单数据就能把转人工从 72.3% 压到 57.4%、转化 +11.6pp。这件事不用等扩样结论就能做。
别再拧转人工率这个 KPI
该店转人工率已经比对照低 12.3pp(26.0% vs 38.3%),成本侧收益是真的,但反事实显示这只解释了 −0.59pp 的转化损失。继续压转人工率不会带来转化,反而会把弥散型风险做大。成本指标和转化指标要分开考核。
C 层(症状驱动选品)老实转人工
该店症状驱动选品 −8.5pp、是场景表里除碎片档外最大的负项,且涉处方粮与病症判断。动作:同一场景连续 2 轮答不上来即转人工并附承接话术,不要让机器人在专业问题上硬撑。

复核安排:三店里优先级最高的一家

现有 379 / 340 人,要把 −5pp 打到 95% 显著需要约 1,200 人/组,按 08-05 的日流量(约 280/组)大约还需 4-5 天。硬性要求两条:
必须把 08-04(半天曝光)从主口径剔除,或改用「上线后曝光时长对齐」的口径,否则冷启动会继续污染判断;
② 转人工段与纯机器人段分开出数,看 −4.50pp 的段内能力差在扩样后是收敛还是坐实。
它是三店里唯一转化与客单同时偏负的店,优先级最高
仍需外部核实:该店负向是否为冷启动效应 —— 需扩样到约 1,200 人/组复测,或拉齐两桶上线后曝光时长再比。本窗口数据无法证伪这一条。

口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。自动复核已排在 8/15。