客服机器人版本实验 · 单店诊断

窗口 2026-08-04 ~ 08-05(严格锁定),各店另附自身 08-01 起的日序列做稳健性回调
转化口径为全渠道付款(当日成交 + 机器人促成 + 跟单 + 次日成交),并列单人产值(成交金额 ÷ 咨询人数,未成交计 0)
一句话:把口径修对之后,「最优桶人机转化率负向」这个前提在三店里只剩一店半成立,而且成立的那部分不能记在机器人版本头上。
首版有三条站不住 —— 转化口径漏算了三种付款路径;咨询意图标签 85%-95% 是误标;锁定的两天正落在大促里、且三店根本不在同一实验阶段。 修完之后三店结论各不相同,所以按店分开看。

三店并列:只看转化率会误判,两个口径必须一起看

转化率 = 有对话的售前咨询人里,全渠道付款人数占比;单人产值 = 该桶成交金额 ÷ 咨询人数(未成交计 0),衡量「一个咨询人头值多少钱」。

店铺咨询人数成交人数转化率转人工率机器人平均发言条数客单价单人产值
麦富迪最优桶1,56862139.60%40.4%6.30144 元57.1 元
麦富迪基础版1,51960039.50%39.2%5.32122 元46.6 元
麦富迪直连人工组762836.84%100%1.00146 元53.8 元
冠能最优桶37713736.34%26.0%8.67265 元96.5 元
冠能基础版33713941.25%38.3%5.59296 元121.0 元
冠能直连人工组11218.18%100%1.00222 元40.4 元
toptrees最优桶1203025.00%34.2%6.03148 元37.0 元
toptrees基础版1273930.71%41.7%5.5276 元23.5 元
toptrees直连人工组5120.00%100%1.4099 元19.8 元
「机器人挡在中间损害转化」被直接证伪。全程不让机器人接待的直连人工组,在三店都是该店最低转化(36.8% / 18.2% / 20.0%)。样本很小(76 / 11 / 5 人,仅方向性),但三店方向一致,足以排除「纯人工接待更好」这个直觉。
三条被证伪的首版前提,三店通用。① 转化率只算当日成交 —— 补齐机器人促成、跟单、次日成交后绝对水位抬升 0.59 至 3.15pp,麦富迪的负向直接消失;② 关键词意图标签 —— 首版指认的「三店同向失血口」有 85%-95% 的买家其实发过明确文本诉求,建立在它上面的唯一显著结论随标签作废;③ 三店同窗口 —— 三家处在完全不同的实验阶段,且这两天落在大促窗口内。

买家到底在问什么:用原话重建的 9 个场景(三店合看)

读每个买家的首句原话,按优先级规则归入 9 个业务场景 + 3 个无诉求档,互斥不重叠。优先级本身是口径的一部分 —— 例如「猫不吃可以退吗」必须先落售前风险逆转,不能被「退」字抢到售后。残留 10.3%,其中约 124 人本身没有任何文本首句,真正「有话读但归不进去」的只有约 7.3%

场景阶段自动化分层人数转化率机器人独立承接转人工率答不上来客单价
选品适配与喂养售前B 依赖商品定位1,06936.7%73.3%26.7%6.9%106 元
参数与信任凭证售前B 依赖商品定位71732.1%71.4%28.6%9.5%172 元
其他无诉求(残留)40738.3%53.3%46.7%18.9%176 元
试吃与退换保障售前A 直接自动化33147.7%67.1%32.9%17.8%170 元
版本辨识与对比售前B 依赖商品定位30847.7%57.8%42.2%10.1%133 元
物流订单会员售中A 直接自动化26251.9%35.5%64.5%23.7%155 元
价格活动与比价售前A 直接自动化25446.5%55.1%44.9%15.4%290 元
找货与货源落空售前B 依赖商品定位24833.9%45.2%54.8%21.4%147 元
症状驱动选品售前C 保人工·高专业24632.9%72.0%28.0%13.8%143 元
直接要人工8128.4%7.4%92.6%18.5%156 元
品质异议与退换售后C 保人工6317.5%15.9%84.1%60.3%98 元
营销卡片回流6248.4%77.4%22.6%6.5%210 元

按「机器人能否标准化接管」归成三层

A 直接自动化
847 人 20.9%
B 依赖商品定位
2,342 人 57.9%
C 保人工
309 人 7.6%
无诉求档
550 人 13.6%
分层构成人数占比转化率转人工率答不上来
A 直接自动化试吃保障 + 价格活动 + 物流订单84720.9%48.6%46.3%18.9%
B 依赖商品定位选品适配 + 版本对比 + 参数凭证 + 找货落空2,34257.9%36.4%32.3%9.6%
C 保人工症状选品 + 品质异议3097.6%29.8%39.4%23.3%
无诉求档寒暄 / 卡片回流 / 直接要人工55013.6%38.0%50.7%17.5%
A 层是最便宜的一块分,而且已经有店验证过。20.9% 的人、转化率 48.6%(全场最高),但转人工率还有 46.3% —— 其中「物流订单会员」一个场景就有 64.5% 的人被转出去,而它只需要订单数据、不需要商品知识。麦富迪最优桶已经跑通:该场景转人工从 72.3% 压到 57.4%、转化率 +11.6pp。这是能立刻横向复制到另外两店的动作。
B 层是最大的工程主战场,也是最容易白忙的地方。57.9% 的人集中在这里,转化率只有 36.4% —— 但它的转人工率 32.3%、答不上来 9.6% 都是全场最低,说明机器人在这里接得住、答得出,问题是答完没换来成交。要补的基建是商品结构化属性库 + 商品定位,把「答对」升级成「答准并收口」。
B 层里唯一真正的能力硬缺口是「找货与货源落空」。转化率 33.9%、答不上来 21.4%、转人工 54.8% —— 买家问「这个没货了吗 / 怎么下架了 / 兑换不了 / 在哪买」,机器人回一句「抱歉没找到」就结束。它同时是麦富迪的最大失血口(−12.3pp)

结构还是能力:买家来问什么几乎没变,差异全在「同一场景答得怎么样」

店铺总差值(pp)能力效应(同场景答得怎么样)结构效应(买家来问什么变了)交互项
麦富迪+0.10+0.69-0.42-0.16
冠能-4.91-4.55-0.33-0.02
toptrees-5.71-7.68-0.22+2.19
三店的结构效应都在 ±0.5pp 内 —— 买家来问什么,两桶几乎一样。这条同时否掉了首版「最优桶把买家从高转化意图重分类到低转化意图」的辛普森式解释:那个占比位移是关键词标签自身漂移造成的假象,用原话口径重算后并不存在。

「少转人工丢了人工兜底」也被量化否掉

店铺转人工率差实际转化反事实转化(转人工占比固定回对照)结构贡献段内能力交互总差值
麦富迪+1.2pp39.60%39.54%+0.03+0.04+0.03+0.10
冠能-12.3pp36.34%36.74%-0.59-4.50+0.18-4.91
toptrees-7.6pp25.00%24.09%-0.42-6.62+1.33-5.71
冠能转人工占比降了 12.3pp,但这只解释 −0.59pp(占 −4.91pp 的 12%);toptrees 降 7.6pp 只解释 −0.42pp。原因很直白:两段的转化落差本来就不大(冠能对照 44.2% vs 39.4%,只差 4.8pp),人群在两段之间怎么挪都挪不出几个百分点。转人工率是成本指标,不要当转化杠杆用。

三店唯一稳定的版本指纹:版本确实生效了,问题在收口

发言条数更高的店·天
11/11店·天
最优桶机器人平均发言条数每一天都更高,从未翻转
麦富迪 · 发言条数增幅
+18%
6.18-6.47 vs 4.99-5.31 条
冠能 · 发言条数增幅
+60%
8.49-9.16 vs 5.05-5.68 条
toptrees · 发言条数增幅
+11%
5.73-6.41 vs 5.12-5.54 条
跨 11 个店·天,两个信号每一天、每一店都同向,从没翻转:① 最优桶的机器人发言条数系统性更多;② 最优桶的转人工率同向更低或持平(toptrees 四天都低约 7pp,冠能两天都低 11-16pp,麦富迪基本持平)。
也就是说「多接一点、少转一点」这个产品意图实现了;没实现的是把多接下来的会话转成订单。多说话 ≠ 说到点上,这是三店合看后最稳的一句话。

把日序列拉出来之后,哪些结论改了

结论锁定窗口读数加上序列后的读数处置
麦富迪版本方向+0.10pp,GMV +22.5% (p=0.033)转化 -1.07pp(4/5 天为负),GMV +9.8%从「正向放量」回调为「笔数持平偏降、篮子变大」,非大促窗口复核
toptrees 客单76→148 元(+94%)90→116 元(+28.6%)撤销「翻倍」表述
toptrees 样本只有 08-04,须等复跑往前三天已有 401 / 430 人可立即扩样,不必等
冠能窗口污染08-04 下午上线确认更早三天无数据不变,扩样后再判
版本是否生效未单独验证发言条数 11/11 店·天同向偏高新增结论:版本确实生效,问题在收口

三店共用的动作与口径纪律

A 层订单/物流自助,横向复制到冠能与 toptrees(确定性最高)
麦富迪已验证:物流订单会员场景转人工 72.3%→57.4%、转化 46.8%→58.4%。该场景只需订单数据(发货时效、快递公司、改地址、会员门槛),零商品知识依赖、零风险。三店合并该场景仍有 64.5% 转人工率,这是最便宜的一块降本 + 提转化。
建「找货与货源落空」的兜底闭环(麦富迪最大失血口)
现状:答不上来 21.4%、转化 33.9%、转人工 54.8%,回答「没找到 / 已下架」就结束。动作:缺货或下架判定后必须给同系列替代品 + 到货登记 + 兑换规则说明,禁止以「抱歉没找到」收尾。
禁止售前未成交会话发满意度邀评
toptrees 最优桶未成交抽样 6 通里有 4 通末尾是邀评而不是任何促单动作。动作:把邀评触发条件限制为「已成交 / 已明确表示不买」,或强制排到促单动作之后。
B 层答完必须收口(占 51.7% 的人)
这一层机器人接得住(转人工 32.3%、答不上来 9.6% 都是最低),缺的是最后一句。动作:命中单属性 / 版本对比 / 适配提问并答完后,追加「紧迫 + 背书 + 低风险」并主动收口。要配的基建是商品结构化属性库 + 商品定位
C 层老实转人工(仅 7.6% 的人)
品质异议与退换答不上来 60.3%、转化 17.5%;症状驱动选品涉处方粮与病症。动作:同一场景连续 2 轮答不上来即转人工并附承接话术。不要泛化到 A / B 层 —— 已证明转人工率既压不出转化,也不该当 KPI 拧。

复核安排:三店不该用同一个方案,因为它们缺的东西不一样

现在就能做
toptrees · 立即扩样
往前三天已有 401 / 430 人,判定门槛放宽到 ±5pp,转人工段与纯机器人段必须分开出数详见该店页
要的不是样本
麦富迪 · 要一个干净窗口
样本已足够,问题是这两天在大促里。取 8/10 之后 5 个连续非大促日重跑。详见该店页

三店共用两条口径纪律:转化率一律用全渠道付款口径;分子小于 20 的场景 / 分段不判显著,只列区间与真实对话。自动复核已按上述分店窗口重排到 8/15;toptrees 的四天扩样不依赖该排期,可立即执行。

要看完整推演过程:本页与分店页给的是「怎么处置」,完整分析版 → 给的是「为什么这么判、以及哪些说法被推翻了」。 内含五条前提逐条体检(哪两条成立、哪三条不成立)、咨询场景口径如何用买家原话重建、转人工 × 纯机器人四象限与反事实分解、机会点折算明细、以及各店自身 08-01 起序列的稳健性回调 —— 每个结论都留了可证伪的读数。