toptrees 领先 · 版本诊断不下结论 · 立即扩样

窗口 2026-08-04 ~ 08-05(严格锁定)|该店 08-05 无分桶记录,锁定窗口内实际只有 08-04 一天、120 / 127 人|对比 最优桶 / 基础版 / 直连人工组
转化口径为全渠道付款(当日成交 + 机器人促成 + 跟单 + 次日成交),并列单人产值(成交金额 ÷ 咨询人数,未成交计 0)
一句话:锁定窗口内不下结论,但这店的机制定位是三店里最干净的一个 —— 负向住在「转人工之后」,不在机器人版本上。
纯机器人段两桶几乎完全一样(28.4% → 29.1%,p=0.920),转人工段直接腰斩(34.0% → 17.1%,p=0.066)。机器人段无差异 + 人工段大幅退化,指向的是人工承接侧(排班 / 分组 / 话术)。 另外两个必须撤回的说法:「客单 76→148 元翻倍」是单日大额订单假象(四天口径 90→116 元),−5.71pp 也是四天里最差的那一天(四天并起来 −2.59pp,p=0.389)。好消息是它不用等排期就能扩样 —— 08-01 起就有数据。

两口径读数:笔数少了,篮子看起来翻倍(但那是假象)

转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 成交金额 ÷ 咨询人数(未成交计 0)。本节全部只有 08-04 一天数据,样本 120 / 127 人。

成交人数
30
对照 39 人 | 转化 25.00% vs 30.71%(−5.71pp,p≈0.3 不显著)
单人产值差
+13.6
37.0 vs 23.5 元 | +57.9%,但 p=0.209 不显著
客单价(窗口内读数)
148
对照 76 元 | 单日大额订单造成,四天口径只有 116 vs 90 元
转人工率
34.2%
对照 41.7% | 低 7.5pp,四天里每天都低约 7pp
咨询人数成交人数转化率转人工率机器人平均发言条数客单价单人产值
最优桶1203025.00%34.2%6.03148 元37.0 元
基础版1273930.71%41.7%5.5276 元23.5 元
直连人工组5120.00%100%1.4099 元19.8 元
口径修正让负向略微变大。首版只算当日成交,读数是 −5.06pp;补齐机器人促成、跟单、次日成交后是 −5.71pp。三店里只有这一家修正后负向反而扩大了一点,说明它的负向不是「漏算了后续付款」造成的。
客单「翻倍」必须撤掉。76 → 148 元这个读数只有 08-04 一天,把该店 08-01 起的四天并起来是 90 → 116 元(+28.6%)。单人产值同理:窗口内 +13.6 元、四天口径只剩 +3.8 元。这两个最抓眼的数字都出在同一天,是典型的单日大额订单效应(详见第六节)。
直连人工组转化只有 20.00%,是本店最低。全程不让机器人接待并没有更好。样本仅 5 人,只作方向性参考、不构成结论。

前提体检:随机性成立,但窗口只有半个

成立
分桶是随机的
分流比例 48.58%,p = 0.656,未失衡。指标差异可以往下归因(前提是样本够 —— 这店恰恰不够)。
不成立
窗口完整可比
锁定窗口内只有 08-04 一天有分桶数据,08-05 该店无任何分桶记录 —— 实际样本是锁定窗口暗示量的一半。但把窗口往前拉会发现 08-01 至 08-03 三天都有数据,实验早就在跑,缺的只是 08-05。所以这店不必等统一复跑,现在就能扩到 401 / 430 人。
不成立
关键词意图标签可信
首版指认的失血口「纯图 / 链接」,该店有 85.2% 的买家其实发过明确文本诉求,只是词表没覆盖。建立在它上面的结论随标签一起作废。
日期基础版人数基础版转化最优桶人数最优桶转化差值(pp)
08-0412730.71%12025.00%-5.71
08-05该店当日无分桶数据

首句可读率:该店基础版 94.5%(三店九个桶里最低的一个,仍在 94.5% 以上),基于原话的场景口径能覆盖几乎全部人群。

场景下钻:样本不够,本节明确不下结论

场景由买家首句原话按优先级规则归入,互斥不重叠。该店场景人数中位数只有 12,下表仅作形态展示,不作归因依据。

场景基础版人数基础版转化最优桶人数最优桶转化差值(pp)p是否采信
参数与信任凭证3122.6%2416.7%-5.90.587分子过小
选品适配与喂养2321.7%210.0% (0/21)-21.70.023不采信(分子 0)
试吃与退换保障1241.7%1844.4%+2.80.880分子过小
其他无诉求1650.0%147.1% (1/14)-42.90.011不采信(分子 1)
找货与货源落空1233.3%1136.4%+3.00.879分子过小
物流订单会员1050.0%757.1%+7.10.772分子过小
版本辨识与对比633.3%1050.0%+16.70.515分子过小
整体12730.71%12025.00%-5.71
两个 p<0.05 的行,分子分别是 0 和 1。在多重比较门槛下(11 次检验,阈值 0.0045)都不成立。「选品适配与喂养 21 人全军覆没」看着很吓人,但 21 人里 0 人成交在该店基准转化 25% 下并不罕见(约 0.2% 概率不算低到可以下结论的程度,且该场景对照组也只有 5 人成交)。本节维持「不下结论」,等四天数据并入后重出。
结构 / 能力分解:能力效应 −7.68pp、结构效应 −0.22pp、交互 +2.19pp。结构效应接近 0 意味着买家来问什么两桶几乎一样,差异全在「同一场景里答得怎么样」—— 与另外两店一致,也一并否掉了首版「最优桶把买家重分类到低转化意图」的解释。但交互项 +2.19pp 在三店里异常大,这本身就是小样本的特征。

机制定位:三店里最干净的一个 —— 负向住在「转人工之后」

把每桶拆成「转过人工」和「纯机器人走完」两段。这是本页唯一可以下判断的一节 —— 不是因为样本变大了,而是因为两段的形态是对立的、方向明确。

转人工率转人工段人数转人工段转化纯机器人人数纯机器人段转化答不上来整体转化
基础版41.7%5334.0%7428.4%20.5%30.71%
最优桶34.2%4117.1%7929.1%21.7%25.00%
分段基础版最优桶差值(pp)p判读
转人工段34.0% (18/53)17.1% (7/41)-16.90.066失血在此
纯机器人段28.4% (21/74)29.1% (23/79)+0.70.920完全无差异
转人工率差实际转化反事实转化(转人工占比固定回对照)结构贡献段内能力交互总差值
-7.6pp25.00%24.09%-0.42-6.62+1.33-5.71
这店的负向能干净地定位到「转人工之后」。纯机器人段两桶几乎完全一样(28.4% → 29.1%,p=0.920 —— 这是全实验里最接近「零差异」的一个读数),转人工段直接腰斩(34.0% → 17.1%,p=0.066)。机器人段无差异 + 人工段大幅退化,指向人工承接侧(排班 / 分组 / 话术),不是机器人版本。这条必须外部核实当日人工排班与分流分组是否有变动,本数据无法证伪。
「少转人工丢了人工兜底」这个假设在这店也不成立。转人工占比降了 7.6pp,反事实分解显示这只解释 −0.42pp(占 −5.71pp 的 7%)。而且该店直连人工组转化只有 20.00%,所谓「人工兜底更强」本身就站不住。真正的失血是段内能力 −6.62pp,而它整块落在转人工段里。转人工率是成本指标,不要当转化杠杆用。
一个必须承认的边界:该店转人工样本里,买家自己打「人工」的比例是 6/6 —— 全部是用户主动点名要人工,不是机器人主动转的。继续压这店的转人工率没有空间,可做的是把转过去之后的承接质量修回来。

机会点折算:本店不折算

无任何场景达到 60 人的折算门槛(场景人数中位数 12)。在这个样本量下折算出来的 GMV 数字没有任何指导意义,本店不做折算。等四天数据并入、或扩样到判定门槛后再出。

可以先做的是不依赖本店结论、已在另一家店验证过的动作:订单 / 物流类自助(该场景在本店转人工 57.1%、人数虽少但转化已是全店最高的 57.1%,属于机器人接得住的类型),以及下一节列出的禁止未成交会话发满意度邀评本页不出现折算金额,故无需承诺值免责声明 —— 但仍提醒:任何后续折算均仅供参考、不构成承诺值、不作考核依据。

稳健性与复核安排:四天序列把两个数字拉回地面

前五节锁在 08-04。这一节问:那一天的读数在该店自己的日序列里稳不稳?答案是 —— 方向稳(三天为负一天为正),量级完全不稳

四天合计成交人数
95
对照 113 人 | 转化 23.69% vs 26.28%(−2.59pp,p=0.389 不显著)
四天合计单人产值差
+3.8
27.5 vs 23.8 元 | +15.9%(窗口内单日读数是 +13.6 元)
四天客单差
+26
116 vs 90 元 | +28.6%(窗口内单日读数是 +94%)
可立即扩样的人数
401/430 人
08-01 起四天已有数据 | 不必等统一复跑排期
日期基础版人数基础版转化最优桶人数最优桶转化差值(pp)基础版单人产值最优桶单人产值差值最优桶转人工基础版转人工
08-018429.76%9325.81%-3.9628.0 元31.9 元+3.828.0%35.7%
08-0210719.63%10221.57%+1.9424.3 元20.9 元-3.427.5%35.5%
08-0311225.00%8622.09%-2.9120.4 元17.5 元-2.932.6%34.8%
08-04(锁定窗口)12730.71%12025.00%-5.7123.5 元37.0 元+13.634.2%41.7%
全序列43026.28%40123.69%-2.59 (p=0.389)23.8 元27.5 元+3.830.7%37.2%
锁定窗口那天(08-04)既是四天里转化最差的一天(−5.71pp),也是单人产值最好的一天(+13.6 元) —— 两个最抓眼的数字出在同一天,典型的单日大额订单效应。四天并起来转化 −2.59pp(p=0.389)、客单 +28.6%,量级都回到噪声区。「客单 76→148 元翻倍」这个说法必须撤掉,四天口径是 90→116 元。
四天里唯一稳定的信号是版本指纹。机器人发言条数每天都更高(5.73-6.41 vs 5.12-5.54,+11%),转人工率四天都低约 7pp,从未翻转。「多接一点、少转一点」这个产品意图在这店实现了;没实现的是把多接下来的会话转成订单 —— 而反事实已经证明,少转人工只解释了 −0.42pp。三店版本指纹对比 →

动作

禁止售前未成交会话发满意度邀评(本店最典型,改动最小)
最优桶未成交抽样 6 通里有 4 通末尾是邀评,而不是任何促单动作。一通里买家问配料表,机器人把「鲜鸡肉 35%、鸡肉粉 20%、5 种益生菌、消化率 94.9%」讲得非常专业,答完直接邀评走人;另一通买家从「哪个适口性好」一路问到「老年猫 10 岁适合吗」,9 轮全部答对且有反问,最后一句还是邀评。动作:把邀评触发条件限制为「已成交 / 已明确表示不买」,或强制排到促单动作之后。这是「答得对但没收口」的标准样本 —— 不缺知识,缺最后一句。
核实 08-04 的人工排班与分流分组(本页最高优先级,但不是产品动作)
转人工段转化腰斩(34.0%→17.1%)而纯机器人段完全无差异(p=0.920)。在归因到机器人版本之前,必须先排除当日人工侧的变动:排班人数、分流分组配置、承接话术是否有调整。本数据无法证伪这条,需要业务侧核实。
复制已验证的 A 层订单 / 物流自助
另一家店已验证:该场景只需订单数据(发货时效、快递公司、改地址、会员门槛),转人工可从 72.3% 压到 57.4%、转化 +11.6pp,零商品知识依赖、零风险。本店该场景转人工仍有 57.1%,是最便宜的一块降本。看已验证结果 →

复核安排:现在就能做,不用等

08-01 至 08-04 已经有 401 / 430 人,把窗口从「锁 08-04 至 08-05」改成「08-01 起至今」即可,不依赖统一复跑排期(8/15)。两条硬性要求:
① 判定门槛:转化差要达到 ±5pp 才有意义(当前样本下 5pp 对应 p≈0.1),低于这个量级一律按噪声处理;
转人工段与纯机器人段必须分开出数 —— 因为负向就住在转人工段,合起来看会把它稀释掉,这正是首版没能定位到它的原因。
仍需外部核实:转人工段转化腰斩(34.0%→17.1%)是否来自当日人工排班 / 分流分组变动。本窗口数据无法证伪这一条,也因此不应把这个负向记在机器人版本头上

口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。本店场景层面全部不达门槛,故第三节明确不下结论。