一两口径读数:笔数少了,篮子看起来翻倍(但那是假象)
转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 成交金额 ÷ 咨询人数(未成交计 0)。本节全部只有 08-04 一天数据,样本 120 / 127 人。
成交人数
30人
对照 39 人 | 转化 25.00% vs 30.71%(−5.71pp,p≈0.3 不显著)
单人产值差
+13.6元
37.0 vs 23.5 元 | +57.9%,但 p=0.209 不显著
客单价(窗口内读数)
148元
对照 76 元 | 单日大额订单造成,四天口径只有 116 vs 90 元
转人工率
34.2%
对照 41.7% | 低 7.5pp,四天里每天都低约 7pp
| 桶 | 咨询人数 | 成交人数 | 转化率 | 转人工率 | 机器人平均发言条数 | 客单价 | 单人产值 |
| 最优桶 | 120 | 30 | 25.00% | 34.2% | 6.03 | 148 元 | 37.0 元 |
| 基础版 | 127 | 39 | 30.71% | 41.7% | 5.52 | 76 元 | 23.5 元 |
| 直连人工组 | 5 | 1 | 20.00% | 100% | 1.40 | 99 元 | 19.8 元 |
口径修正让负向略微变大。首版只算当日成交,读数是 −5.06pp;补齐机器人促成、跟单、次日成交后是 −5.71pp。三店里只有这一家修正后负向反而扩大了一点,说明它的负向不是「漏算了后续付款」造成的。
客单「翻倍」必须撤掉。76 → 148 元这个读数只有 08-04 一天,把该店 08-01 起的四天并起来是
90 → 116 元(+28.6%)。单人产值同理:窗口内 +13.6 元、四天口径只剩 +3.8 元。
这两个最抓眼的数字都出在同一天,是典型的单日大额订单效应(详见
第六节)。
直连人工组转化只有 20.00%,是本店最低。全程不让机器人接待并没有更好。样本仅 5 人,只作方向性参考、不构成结论。
二前提体检:随机性成立,但窗口只有半个
成立
分桶是随机的
分流比例 48.58%,p = 0.656,未失衡。指标差异可以往下归因(前提是样本够 —— 这店恰恰不够)。
不成立
窗口完整可比
锁定窗口内只有 08-04 一天有分桶数据,08-05 该店无任何分桶记录 —— 实际样本是锁定窗口暗示量的一半。但把窗口往前拉会发现 08-01 至 08-03 三天都有数据,实验早就在跑,缺的只是 08-05。所以这店不必等统一复跑,现在就能扩到 401 / 430 人。
不成立
关键词意图标签可信
首版指认的失血口「纯图 / 链接」,该店有 85.2% 的买家其实发过明确文本诉求,只是词表没覆盖。建立在它上面的结论随标签一起作废。
要改
窗口具有代表性
08-04 落在大促窗口(8/4-8/9)内,且它同时是该店四天里转化最差、单人产值最好的一天。把 08-01 至 08-03 的非大促日并进来,量级立刻回到噪声区。
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) |
| 08-04 | 127 | 30.71% | 120 | 25.00% | -5.71 |
| 08-05 | — | — | — | — | 该店当日无分桶数据 |
首句可读率:该店基础版 94.5%(三店九个桶里最低的一个,仍在 94.5% 以上),基于原话的场景口径能覆盖几乎全部人群。
三场景下钻:样本不够,本节明确不下结论
场景由买家首句原话按优先级规则归入,互斥不重叠。该店场景人数中位数只有 12,下表仅作形态展示,不作归因依据。
| 场景 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | p | 是否采信 |
| 参数与信任凭证 | 31 | 22.6% | 24 | 16.7% | -5.9 | 0.587 | 分子过小 |
| 选品适配与喂养 | 23 | 21.7% | 21 | 0.0% (0/21) | -21.7 | 0.023 | 不采信(分子 0) |
| 试吃与退换保障 | 12 | 41.7% | 18 | 44.4% | +2.8 | 0.880 | 分子过小 |
| 其他无诉求 | 16 | 50.0% | 14 | 7.1% (1/14) | -42.9 | 0.011 | 不采信(分子 1) |
| 找货与货源落空 | 12 | 33.3% | 11 | 36.4% | +3.0 | 0.879 | 分子过小 |
| 物流订单会员 | 10 | 50.0% | 7 | 57.1% | +7.1 | 0.772 | 分子过小 |
| 版本辨识与对比 | 6 | 33.3% | 10 | 50.0% | +16.7 | 0.515 | 分子过小 |
| 整体 | 127 | 30.71% | 120 | 25.00% | -5.71 | — | — |
两个 p<0.05 的行,分子分别是 0 和 1。在多重比较门槛下(11 次检验,阈值 0.0045)都不成立。「选品适配与喂养 21 人全军覆没」看着很吓人,但 21 人里 0 人成交在该店基准转化 25% 下并不罕见(约 0.2% 概率不算低到可以下结论的程度,且该场景对照组也只有 5 人成交)。本节维持「不下结论」,等四天数据并入后重出。
结构 / 能力分解:能力效应 −7.68pp、结构效应 −0.22pp、交互 +2.19pp。结构效应接近 0 意味着买家来问什么两桶几乎一样,差异全在「同一场景里答得怎么样」—— 与另外两店一致,也一并否掉了首版「最优桶把买家重分类到低转化意图」的解释。但交互项 +2.19pp 在三店里异常大,这本身就是小样本的特征。
四机制定位:三店里最干净的一个 —— 负向住在「转人工之后」
把每桶拆成「转过人工」和「纯机器人走完」两段。这是本页唯一可以下判断的一节 —— 不是因为样本变大了,而是因为两段的形态是对立的、方向明确。
| 桶 | 转人工率 | 转人工段人数 | 转人工段转化 | 纯机器人人数 | 纯机器人段转化 | 答不上来 | 整体转化 |
| 基础版 | 41.7% | 53 | 34.0% | 74 | 28.4% | 20.5% | 30.71% |
| 最优桶 | 34.2% | 41 | 17.1% | 79 | 29.1% | 21.7% | 25.00% |
| 分段 | 基础版 | 最优桶 | 差值(pp) | p | 判读 |
| 转人工段 | 34.0% (18/53) | 17.1% (7/41) | -16.9 | 0.066 | 失血在此 |
| 纯机器人段 | 28.4% (21/74) | 29.1% (23/79) | +0.7 | 0.920 | 完全无差异 |
| 转人工率差 | 实际转化 | 反事实转化(转人工占比固定回对照) | 结构贡献 | 段内能力 | 交互 | 总差值 |
| -7.6pp | 25.00% | 24.09% | -0.42 | -6.62 | +1.33 | -5.71 |
这店的负向能干净地定位到「转人工之后」。纯机器人段两桶几乎完全一样(28.4% → 29.1%,p=0.920 —— 这是全实验里最接近「零差异」的一个读数),转人工段直接腰斩(34.0% → 17.1%,p=0.066)。机器人段无差异 + 人工段大幅退化,指向人工承接侧(排班 / 分组 / 话术),不是机器人版本。这条必须外部核实当日人工排班与分流分组是否有变动,本数据无法证伪。
「少转人工丢了人工兜底」这个假设在这店也不成立。转人工占比降了 7.6pp,反事实分解显示这只解释 −0.42pp(占 −5.71pp 的 7%)。而且该店直连人工组转化只有 20.00%,所谓「人工兜底更强」本身就站不住。真正的失血是段内能力 −6.62pp,而它整块落在转人工段里。转人工率是成本指标,不要当转化杠杆用。
一个必须承认的边界:该店转人工样本里,买家自己打「人工」的比例是 6/6 —— 全部是用户主动点名要人工,不是机器人主动转的。继续压这店的转人工率没有空间,可做的是把转过去之后的承接质量修回来。
五机会点折算:本店不折算
无任何场景达到 60 人的折算门槛(场景人数中位数 12)。在这个样本量下折算出来的 GMV 数字没有任何指导意义,本店不做折算。等四天数据并入、或扩样到判定门槛后再出。
可以先做的是不依赖本店结论、已在另一家店验证过的动作:订单 / 物流类自助(该场景在本店转人工 57.1%、人数虽少但转化已是全店最高的 57.1%,属于机器人接得住的类型),以及下一节列出的禁止未成交会话发满意度邀评。本页不出现折算金额,故无需承诺值免责声明 —— 但仍提醒:任何后续折算均仅供参考、不构成承诺值、不作考核依据。
六稳健性与复核安排:四天序列把两个数字拉回地面
前五节锁在 08-04。这一节问:那一天的读数在该店自己的日序列里稳不稳?答案是 —— 方向稳(三天为负一天为正),量级完全不稳。
四天合计成交人数
95人
对照 113 人 | 转化 23.69% vs 26.28%(−2.59pp,p=0.389 不显著)
四天合计单人产值差
+3.8元
27.5 vs 23.8 元 | +15.9%(窗口内单日读数是 +13.6 元)
四天客单差
+26元
116 vs 90 元 | +28.6%(窗口内单日读数是 +94%)
可立即扩样的人数
401/430 人
08-01 起四天已有数据 | 不必等统一复跑排期
| 日期 | 基础版人数 | 基础版转化 | 最优桶人数 | 最优桶转化 | 差值(pp) | 基础版单人产值 | 最优桶单人产值 | 差值 | 最优桶转人工 | 基础版转人工 |
| 08-01 | 84 | 29.76% | 93 | 25.81% | -3.96 | 28.0 元 | 31.9 元 | +3.8 | 28.0% | 35.7% |
| 08-02 | 107 | 19.63% | 102 | 21.57% | +1.94 | 24.3 元 | 20.9 元 | -3.4 | 27.5% | 35.5% |
| 08-03 | 112 | 25.00% | 86 | 22.09% | -2.91 | 20.4 元 | 17.5 元 | -2.9 | 32.6% | 34.8% |
| 08-04(锁定窗口) | 127 | 30.71% | 120 | 25.00% | -5.71 | 23.5 元 | 37.0 元 | +13.6 | 34.2% | 41.7% |
| 全序列 | 430 | 26.28% | 401 | 23.69% | -2.59 (p=0.389) | 23.8 元 | 27.5 元 | +3.8 | 30.7% | 37.2% |
锁定窗口那天(08-04)既是四天里转化最差的一天(−5.71pp),也是单人产值最好的一天(+13.6 元) —— 两个最抓眼的数字出在同一天,典型的单日大额订单效应。四天并起来转化 −2.59pp(p=0.389)、客单 +28.6%,量级都回到噪声区。「客单 76→148 元翻倍」这个说法必须撤掉,四天口径是 90→116 元。
四天里唯一稳定的信号是版本指纹。机器人发言条数每天都更高(5.73-6.41 vs 5.12-5.54,+11%),转人工率
四天都低约 7pp,从未翻转。
「多接一点、少转一点」这个产品意图在这店实现了;没实现的是把多接下来的会话转成订单 —— 而反事实已经证明,少转人工只解释了 −0.42pp。
三店版本指纹对比 →
动作
禁止售前未成交会话发满意度邀评(本店最典型,改动最小)
最优桶未成交抽样 6 通里有 4 通末尾是邀评,而不是任何促单动作。一通里买家问配料表,机器人把「鲜鸡肉 35%、鸡肉粉 20%、5 种益生菌、消化率 94.9%」讲得非常专业,答完直接邀评走人;另一通买家从「哪个适口性好」一路问到「老年猫 10 岁适合吗」,9 轮全部答对且有反问,最后一句还是邀评。动作:把邀评触发条件限制为「已成交 / 已明确表示不买」,或强制排到促单动作之后。这是「答得对但没收口」的标准样本 —— 不缺知识,缺最后一句。
核实 08-04 的人工排班与分流分组(本页最高优先级,但不是产品动作)
转人工段转化腰斩(34.0%→17.1%)而纯机器人段完全无差异(p=0.920)。在归因到机器人版本之前,必须先排除当日人工侧的变动:排班人数、分流分组配置、承接话术是否有调整。本数据无法证伪这条,需要业务侧核实。
复制已验证的 A 层订单 / 物流自助
另一家店已验证:该场景只需订单数据(发货时效、快递公司、改地址、会员门槛),转人工可从 72.3% 压到 57.4%、转化 +11.6pp,
零商品知识依赖、零风险。本店该场景转人工仍有 57.1%,是最便宜的一块降本。
看已验证结果 →
复核安排:现在就能做,不用等
08-01 至 08-04 已经有 401 / 430 人,把窗口从「锁 08-04 至 08-05」改成「08-01 起至今」即可,不依赖统一复跑排期(8/15)。两条硬性要求:
① 判定门槛:转化差要达到 ±5pp 才有意义(当前样本下 5pp 对应 p≈0.1),低于这个量级一律按噪声处理;
② 转人工段与纯机器人段必须分开出数 —— 因为负向就住在转人工段,合起来看会把它稀释掉,这正是首版没能定位到它的原因。
仍需外部核实:转人工段转化腰斩(34.0%→17.1%)是否来自当日人工排班 / 分流分组变动。本窗口数据无法证伪这一条,也因此不应把这个负向记在机器人版本头上。
口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。本店场景层面全部不达门槛,故第三节明确不下结论。