三店最优桶转化归因完整分析版

窗口 2026-08-04 ~ 08-05(严格锁定)|麦富迪 / 冠能 / toptrees 领先|最优桶 vs 基础版 vs 直连人工组
本页是完整推演过程:五条前提逐条体检、场景口径重建、四象限反事实、机会点折算、稳健性回调。只要结论请看总览与分店页
与分店看板的关系:看板给的是「怎么处置」,本页给的是「为什么这么判、以及哪些说法被推翻了」。 三条被推翻的前提(转化口径漏算、意图标签 85-95% 误标、三店不在同一实验阶段)与两条被量化否掉的机制(少转人工丢兜底、意图结构位移造成辛普森)都在这里逐条留了痕,可以逐条证伪。

窗口 2026-08-04 ~ 08-05(严格锁定)|麦富迪 / 冠能 / toptrees 领先|最优桶 vs 基础版 vs 直连人工组

本版对首版结论做了前提体检与口径修正,首版原文保留以便对照。本页为对外版本,已按业务语言表述,不含内部表 / 字段 / 实验标识。

店铺:麦富迪、冠能、toptrees 领先 分桶:最优桶 / 基础版 / 直连人工组 窗口:2026-08-04 ~ 08-05(按要求严格锁定,未扩窗)

一句话结论(修正后)

首版结论里有三条站不住:转化口径漏了三个付款字段咨询意图口径 85-95% 是误标锁定窗口正落在大促里且三店根本不在同一实验阶段。修完这三条,"最优桶人机转化率负向"这个前提在三店里只剩一店半成立,而且成立的那部分方向与首版指认的机制不同。

店铺首版转化率 Δ
(仅当日成交一路)
修正转化率 Δ
(全渠道付款)
是否显著单人产值 Δ是否显著修正判读
麦富迪+0.59pp+0.10pp否(两段 p>0.5)+10.5 元(+22.5%)是(p=0.033)窗口内转化持平、客单显著抬升;自身 5 天序列为转化率 -1.07pp / 产值 +9.8%,稳定特征是「笔数略降、篮子变大」
冠能-5.67pp-4.91pp否(p≈0.4,两段均不显著)-24.6 元(-20.3%)否(p=0.183)方向负但弥散,窗口被污染(08-04 下午才上线,负向全在 08-05)
toptrees-5.06pp-5.71pp转人工段 p=0.066 / 纯机器人段 p=0.920+13.6 元(+57.9%)否(p=0.209)窗口内仅 08-04、120/127 人,不下结论;扩到自身 08-01 至 08-04 为 -2.59pp(p=0.389);负向定位在转人工之后

四句最关键的修正:

第一,麦富迪的"负向"是口径造成的。 换成全渠道付款后 Δ = +0.10pp,转人工段与纯机器人段的 p 值分别是 0.522 和 0.627 —— 两桶在窗口内统计等价;同时单人产值 +10.5 元且 p=0.033,是本次实验唯一达到 95% 显著的结果,方向为正。

第二,首版指认的"三店同向失血口 「纯图 / 链接」档"不存在。 该标签的真实构成里 94.6%(麦富迪)/ 92.6%(冠能)/ 85.2%(toptrees)的买家其实发过明确文本诉求,只是关键词表没覆盖。它不是"低表达高意向流量",就是普通的单属性提问,被误当成了一个独立场景。首版建立在它上面的意图级唯一显著结论(-7.2pp,z=-2.18)随标签一起作废。

第三,"最优桶少转人工、丢了人工兜底"这个机制被量化否掉了。 冠能转人工占比确实降了 12.3pp,但反事实分解显示这部分只解释 -0.59pp(总 -4.91pp);toptrees 降 7.6pp 只解释 -0.42pp。而且三店的直连人工组转化率都是最低的(36.8% / 18.2% / 20.0%)—— 把机器人整个拿掉、纯人工接待并没有更好。

第四(本版新增,且必须前置声明):锁定的 08-04 至 08-05 窗口本身不具代表性。 它正落在超级 88 年中盛典(8/4-8/9)里——麦富迪日转化率从盛典前的 33-35% 跳到 38-40%、单人产值从约 30 元跳到约 50 元。把各店自己的 08-01 至 08-05 序列拉出来(第十章):麦富迪 5 天里有 4 天转化率略负(全序列 -1.07pp,p=0.342),单人产值优势从 +10.5 元缩到 +3.7 元(+9.8%);toptrees 实际有 08-01 至 08-04 四天数据(缺 08-05),全序列 -2.59pp(p=0.389)、客单优势从 +94% 缩到 +28.6%。所以第二至第九章的读数都应理解为"盛典窗口内的读数",不能外推到日常;结论层面已按第十章回调。

前提体检:五条前提逐条验

首版有五条隐含前提。逐条查完,两条成立、三条要改。

✅ 前提1:分桶是随机的(分流失衡检验通过)

店铺最优桶人数基础版人数最优桶占比卡方p值判定
麦富迪1568151950.79%0.7780.378未失衡
冠能37733752.80%2.2410.134未失衡
toptrees12012748.58%0.1980.656未失衡

分流本身没问题,指标差异可以往下归因。

✅ 前提2:能用买家原话重建口径(首句文本覆盖率 94.5%-98.7%)

首句 = 该买家在该店当日最早一条有效文本消息(排除纯链接、纯图片、长度≤2)。三店九个桶的覆盖率都在 94.5% 以上,最低的 toptrees 基础版也有 94.5%。这意味着基于原话的场景口径能覆盖几乎全部人群,不存在"大半人群没话可读"的问题——这也正是首版关键词口径失效时仍有救的原因。

❌ 前提3(不成立):关键词意图标签可信

首版把"13 个关键词标签全未命中"的人数归为 「纯图 / 链接」档,并把它当作跨店核心失血口。读它们的首句原文:

店铺原档人数真·无任何文本首句有文本首句(被漏召)漏召率
麦富迪9885393594.6%
冠能1761316392.6%
toptrees81126985.2%

漏召率 85-95%,标签名与内容严重不符。结论:整个意图章作废,改用首句原文重建场景口径(第三章)。

⚠️ 前提4(要改,且改动实质):转化率只算当日成交一路

首版转化率分子只算了当日成交一路。规范口径是全渠道付款当日成交 + 机器人促成 + 跟单 + 次日成交 任一 >0。补齐后绝对转化率抬升 +0.59 至 +3.15pp,且麦富迪的负向直接消失(+0.59pp → +0.10pp,且两段 p>0.5)。

首版顺带提出的机制——"最优桶会话更长,把决策拖到次日,所以次日付款被漏掉更多"——也被证伪:麦富迪次日成交独占(当日未付、次日才付)最优桶 1.48%、基础版 2.44%,方向与假设相反。

一个必须标注的口径边界:次日成交在本窗口内只有 08-04 可观测,08-05 的次日落在 08-06、结构性右截尾(三桶同等受影响,不改变桶间比较,但会压低窗口内绝对水位)。

❌ 前提5(不成立):三店共享同一个观测窗口

按日期 × 桶 拆开看,三店根本不在同一实验阶段:

店铺日期基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)
麦富迪08-0477940.05%(312)81338.75%(315)-1.30
麦富迪08-0575438.33%(289)78339.59%(310)+1.26
冠能08-047335.62%(26)8939.33%(35)+3.71
冠能08-0526743.07%(115)29035.52%(103)-7.55
toptrees08-0412730.71%(39)12025.00%(30)-5.71
toptrees08-05无分桶数据

(人数为 「人·天」口径,跨天买家会重复计入,故与全窗口去重人数略有出入。)

还有一层窗口问题比"三店不同阶段"更要紧:08-04 至 08-05 正落在超级 88 年中盛典(8/4-8/9)里。麦富迪日转化率从平日的 33-35% 跳到 38-40%、单人产值从约 30 元跳到约 50 元。所以第二至第九章的读数都应理解为"盛典窗口内的读数",第十章用各店自己的 08-01 至 08-05 序列做稳健性回调。

修正后的总体读数:转化率与单人产值必须并列看

店铺售前咨询人数成交人数
(全渠道)
转化率转人工率机器人平均发言条数客单价单人产值
麦富迪最优桶156862139.60%40.4%6.30144元57.1元
麦富迪基础版151960039.50%39.2%5.32122元46.6元
麦富迪直连人工组762836.84%100%1.00146元53.8元
冠能最优桶37713736.34%26.0%8.67265元96.5元
冠能基础版33713941.25%38.3%5.59296元121.0元
冠能直连人工组11218.18%100%1.00222元40.4元
toptrees最优桶1203025.00%34.2%6.03148元37.0元
toptrees基础版1273930.71%41.7%5.5276元23.5元
toptrees直连人工组5120.00%100%1.4099元19.8元

单人产值的 Welch t 检验(未成交计 0):

店铺最优桶基础版Δtp值95%CIP99封顶后 p
麦富迪57.1元46.6元+10.5元2.140.033[+0.9, +20.1]0.076
冠能96.5元121.0元-24.6元-1.330.183[-60.7, +11.6]0.213
toptrees37.0元23.5元+13.6元1.260.209[-7.6, +34.8]0.209

说白了:只看转化率会误杀麦富迪这个版本。它成交笔数与基础版一样,但篮子更大(客单 122→144 元),单人多产出 10.5 元且这是全实验唯一 95% 显著项。toptrees 同样是"笔数少了、篮子翻倍"(客单 76→148 元),单人产值反而 +58%(不显著,样本太小)。只有冠能是"笔数少了、篮子也没变大"——三店里唯一双口径同向负的店。

直连人工组三店都是该店最低转化率(36.8% / 18.2% / 20.0%)。样本很小(76/11/5 人,仅方向性),但方向一致,足以排除"机器人挡在中间损害转化""人工兜底转化更好"这两个假设。

重建咨询场景口径(替代关键词意图)

口径构造(可证伪)

读每个买家的首句原文,按优先级规则归入 9 个业务场景 + 3 个无诉求档,互斥不重叠(MECE)。优先级顺序本身是口径的一部分,例如"猫不吃可以退吗"必须先落售前风险逆转(试吃与退换保障)、不能被"退"字抢到售后(品质异议与退换)——这类误判在自检抽样里逐条改过。

场景阶段自动化分层典型原话
选品适配与喂养售前B 依赖SKU定位「3个月幼猫吃哪款」「三个月萨摩耶吃哪款」「一天吃多少合适」
版本辨识与对比售前B 依赖SKU定位「这两个有什么区别」「普通的和mcs有什么区别」「升级2.0里面有冻干吗」
参数与信任凭证售前B 依赖SKU定位「膨化粮还是烘焙粮」「配料表可以看一下吗」「有没有检测报告」
试吃与退换保障售前A 直接自动化「有试吃装吗」「猫咪不喜欢可以退吗」「买三包有没有赠品」
价格活动与比价售前A 直接自动化「40元优惠券在哪领」「怎么涨价了」「退差价吗」
找货与货源落空售前B 依赖SKU定位「这个没货了吗」「怎么下架了」「兑换不了」「宠物店进货怎么联系」
症状驱动选品售前C 保人工·高专业「去泪痕哪款好」「肠胃不好吃哪款」「有肝脏处方粮吗」
物流订单会员售中A 直接自动化「什么快递」「什么时候发货」「我改一下地址」+ 订单号粘贴
品质异议与退换售后C 保人工「有股酸味」「冻干变黑了」「碗有瑕疵」「退货运费什么时候给」
营销卡片回流 / 直接要人工 / 其他无诉求「店铺会员券」「☞新会员限时礼」/「转人工」/ 纯寒暄与无法判定

分布与残留(4140 人,三桶合计)

场景人数占比
选品适配与喂养110326.6%
参数与信任凭证72117.4%
试吃与退换保障3338.0%
版本辨识与对比3167.6%
物流订单会员2666.4%
价格活动与比价2646.4%
症状驱动选品2526.1%
找货与货源落空2516.1%
品质异议与退换641.5%
直接要人工822.0%
营销卡片回流621.5%
其他无诉求42610.3%

残留(其他无诉求)10.3%,其中约 124 人本身没有任何文本首句,真正"有话读但归不进去"的只有约 7.3%——比原关键词口径把 25% 的人扫进一个错标签,是数量级的改善。每个场景随机 25 条原话的自检见抽样自检附件,残留 200 条原话另有附件,均可逐条证伪。

场景级下钻:失血点在哪

麦富迪(最优桶 1568 / 基础版 1519)

场景基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)p占比Δ最优桶转人工基础版转人工折损人数
选品适配与喂养44339.3%41739.1%-0.20.955-2.627.6%27.8%-0.8
参数与信任凭证23730.4%27933.3%+3.00.473+2.229.0%24.9%+8.2
其他无诉求16533.3%16240.7%+7.40.165-0.553.1%48.5%+12.0
版本辨识与对比12449.2%12747.2%-1.90.757-0.141.7%46.0%-2.5
试吃与退换保障11149.5%10853.7%+4.20.539-0.438.9%36.0%+4.5
找货与货源落空8741.4%11029.1%-12.30.072+1.360.0%57.5%-13.5
物流订单会员9446.8%10158.4%+11.60.105+0.357.4%72.3%+11.7
价格活动与比价10847.2%8144.4%-2.80.705-1.946.9%42.6%-2.3
症状驱动选品7534.7%9733.0%-1.70.818+1.230.9%28.0%-1.6
直接要人工2937.9%3525.7%-12.20.294+0.394.3%93.1%-4.3
品质异议与退换2425.0%2910.3%-14.70.157+0.386.2%87.5%-4.2
营销卡片回流2240.9%2245.5%+4.50.761-0.027.3%13.6%+1.0

整体 39.60%(621/1568) vs 39.50%(600/1519),Δ +0.10pp

判读:整体持平不是"什么都没发生",而是一涨一跌相互抵消

冠能(最优桶 377 / 基础版 337)

场景基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)p最优桶转人工基础版转人工
选品适配与喂养8529.4%8031.2%+1.80.79716.2%24.7%
参数与信任凭证7138.0%7536.0%-2.00.80022.7%32.4%
试吃与退换保障4040.0%4238.1%-1.90.86014.3%27.5%
症状驱动选品2536.0%4027.5%-8.50.47020.0%32.0%
价格活动与比价2955.2%2650.0%-5.20.70138.5%55.2%
物流订单会员2853.6%2240.9%-12.70.37463.6%67.9%
其他无诉求2268.2%2839.3%-28.90.04221.4%50.0%
版本辨识与对比1457.1%2740.7%-16.40.31825.9%50.0%
找货与货源落空911.1%1936.8%+25.70.15942.1%33.3%

整体 36.34%(137/377) vs 41.25%(139/337),Δ -4.91pp

判读:冠能的负向没有一个场景能背锅。唯一 p<0.05 的是残留档 其他无诉求(n=22/28,两位数样本,不采信)。所有业务场景 p 都在 0.3-0.9 之间。这是典型的弥散型负向——每个场景掉 2-13pp、单独都不显著、加起来才成一个 -4.91pp。

同时有一个跨场景的一致现象:最优桶每个场景的转人工率都比基础版低约 10pp(选品适配与喂养 16.2% vs 24.7%、参数与信任凭证 22.7% vs 32.4%、试吃与退换保障 14.3% vs 27.5%、版本辨识与对比 25.9% vs 50.0%、价格活动与比价 38.5% vs 55.2%),均机器人发言条数 5.59→8.67。机器人确实"多说了很多、少交了很多给人工"。这个现象值不值钱,见第五章的反事实。

toptrees(最优桶 120 / 基础版 127)

场景基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)p
参数与信任凭证3122.6%2416.7%-5.90.587
选品适配与喂养2321.7%210.0%(0/21)-21.70.023
试吃与退换保障1241.7%1844.4%+2.80.880
其他无诉求1650.0%147.1%-42.90.011
找货与货源落空1233.3%1136.4%+3.00.879
物流订单会员1050.0%757.1%+7.10.772
版本辨识与对比633.3%1050.0%+16.70.515

整体 25.00%(30/120) vs 30.71%(39/127),Δ -5.71pp

判读:两个 p<0.05 的行分子分别是 0/21 和 1/14,在 11 次检验的多重比较下(Bonferroni 阈值 0.0045)都不成立。全店场景人数中位数 12,无法做场景归因。维持"不下结论";扩样不必等统一复跑,该店 08-01 至 08-04 已有四天数据可直接并入(第十章)。

结构 vs 能力(场景基 Kitagawa 分解)

店铺总Δ(pp)能力效应结构效应交互项
麦富迪+0.10+0.69-0.42-0.16
冠能-4.91-4.55-0.33-0.02
toptrees-5.71-7.68-0.22+2.19

三店的结构效应都在 ±0.5pp 内——买家来问什么,两桶几乎一样。所以差异全在"同一场景里答得怎么样"。这条很重要:它否掉了首版"最优桶把买家从高转化意图重分类到低转化意图(「选品推荐」档占比翻倍)"的辛普森式解释——那个位移是关键词标签自身漂移造成的假象,用原话口径重算后并不存在。

机制定位:转人工 × 纯机器人四象限与反事实

首版留了一个待验证假设:"最优桶少转人工 → 丢了人工兜底 → 所以掉转化"。把每桶拆成"转过人工"和"纯机器人走完"两段,直接量化它。

店铺人数转人工率转人工段人数转人工段转化率纯机器人段人数纯机器人段转化率答不上来占比机器人平均发言条数整体转化率
麦富迪基础版151939.2%59541.0%92438.5%13.5%5.3239.50%
麦富迪最优桶156840.4%63342.8%93537.4%13.8%6.3039.60%
冠能基础版33738.3%12944.2%20839.4%9.8%5.5941.25%
冠能最优桶37726.0%9838.8%27935.5%12.5%8.6736.34%
toptrees基础版12741.7%5334.0%7428.4%20.5%5.5230.71%
toptrees最优桶12034.2%4117.1%7929.1%21.7%6.0325.00%

反事实:把最优桶的转人工占比固定回基础版水平,两段转化率用它自己的。

店铺转人工率Δ实际转化率反事实转化率结构贡献(pp)段内能力(pp)交互(pp)总Δ(pp)
麦富迪+1.2pp39.60%39.54%+0.03+0.04+0.03+0.10
冠能-12.3pp36.34%36.74%-0.59-4.50+0.18-4.91
toptrees-7.6pp25.00%24.09%-0.42-6.62+1.33-5.71

分段显著性:

店铺分段基础版最优桶Δ(pp)zp
麦富迪转人工段41.0%(244/595)42.8%(271/633)+1.80.640.522
麦富迪纯机器人段38.5%(356/924)37.4%(350/935)-1.1-0.490.627
冠能转人工段44.2%(57/129)38.8%(38/98)-5.4-0.820.413
冠能纯机器人段39.4%(82/208)35.5%(99/279)-3.9-0.890.374
toptrees转人工段34.0%(18/53)17.1%(7/41)-16.9-1.840.066
toptrees纯机器人段28.4%(21/74)29.1%(23/79)+0.70.100.920

三条结论:

"少转人工"这个假设量化后不成立。 冠能转人工占比降了 12.3pp,但这只解释 -0.59pp(占 -4.91pp 的 12%);toptrees 降 7.6pp 只解释 -0.42pp。原因很直白:两段的转化率落差本来就不大(冠能基础版 44.2% vs 39.4%,只差 4.8pp),所以人群在两段之间怎么挪都挪不出几个百分点。转人工率是成本指标,不要当转化杠杆用。

冠能的 -4.50pp 是弥散的,指不到具体位置。 两段各降 4-5pp 但 p=0.413 / 0.374,场景层面也无一显著。在 98-279 人的样本量下,这个形态与"冷启动 + 单日效应"完全一致(回忆前提5:冠能 08-04 14:27 上线,负向全在 08-05)。建议按既定方案扩样复测,不在本窗口内做归因结论。

toptrees 的负向能干净地定位到"转人工之后"。 纯机器人段两桶几乎完全一样(28.4% → 29.1%,p=0.920),转人工段直接腰斩(34.0% → 17.1%,p=0.066)。机器人段无差异 + 人工段大幅退化,指向的是人工承接侧(排班/分组/话术),不是机器人版本。这条必须外部核实 08-04 toptrees 人工排班,本数据无法证伪。

再补一条反向证据:直连人工组在三店都是最低转化率(36.8% / 18.2% / 20.0%)。"人工兜底转化更好"这个直觉在三个店都不成立。

A/B/C 自动化分层与缺口(三店合并,4048 人)

把场景按"机器人能否标准化接管"重新归三层,看清哪里是最大的工程主战场。

场景阶段分层人数占比转化率机器人独立承接率转人工率答不上来占比机器人平均发言条数客单价
选品适配与喂养售前B 依赖SKU定位106926.4%36.7%73.3%26.7%6.9%7.10106元
参数与信任凭证售前B 依赖SKU定位71717.7%32.1%71.4%28.6%9.5%6.08172元
其他无诉求40710.1%38.3%53.3%46.7%18.9%5.33176元
试吃与退换保障售前A 直接自动化3318.2%47.7%67.1%32.9%17.8%5.94170元
版本辨识与对比售前B 依赖SKU定位3087.6%47.7%57.8%42.2%10.1%6.55133元
物流订单会员售中A 直接自动化2626.5%51.9%35.5%64.5%23.7%3.77155元
价格活动与比价售前A 直接自动化2546.3%46.5%55.1%44.9%15.4%5.94290元
找货与货源落空售前B 依赖SKU定位2486.1%33.9%45.2%54.8%21.4%5.42147元
症状驱动选品售前C 保人工·高专业2466.1%32.9%72.0%28.0%13.8%7.50143元
直接要人工812.0%28.4%7.4%92.6%18.5%2.94156元
品质异议与退换售后C 保人工631.6%17.5%15.9%84.1%60.3%3.7398元
营销卡片回流621.5%48.4%77.4%22.6%6.5%4.37210元
分层人数占比转化率转人工率答不上来占比
A 直接自动化(试吃 + 价格 + 物流订单)84720.9%48.6%46.3%18.9%
B 依赖SKU定位(选品 + 版本 + 参数 + 找货)234257.9%36.4%32.3%9.6%
C 保人工(症状驱动选品 + 品质异议)3097.6%29.8%39.4%23.3%
无诉求档55013.6%38.0%50.7%17.5%

三条读法:

A 层是最便宜的分,且已有验证。 20.9% 的人、转化率 48.6%(全场最高),转人工率却还有 46.3%——物流订单会员一个场景 64.5% 的人被转出去,而它只需要订单数据、不需要商品知识。麦富迪最优桶已经证明这条能跑通:物流订单会员 转人工 72.3%→57.4%、转化率 +11.6pp。这是可以立刻横向复制到另外两店的动作。

B 层是最大的工程主战场,也是最容易白忙的地方。 57.9% 的人 集中在这里,转化率只有 36.4%——但注意它的转人工率 32.3%、答不上来占比 9.6% 都是最低的,说明机器人在这里"接得住、答得出",问题是答完没换来成交。里面唯一的例外是 找货与货源落空:转化率 33.9%、答不上来占比 21.4%、转人工 54.8%,是 B 层里唯一真正的能力硬缺口(缺货判定 + 替代品推荐 + 兑换/下架规则),也正是麦富迪的最大失血口。B 层的其余部分(选品 / 版本 / 参数三类,51.8% 的人)需要的是商品结构化属性库 + SKU 定位把"答对"升级成"答准并收口"。

C 层量小但答不上来占比高,应该老实转人工。 品质异议与退换答不上来占比 60.3%、转化率 17.5%,是全场最差;症状驱动选品涉及处方粮/病症,专业风险高。合计只有 7.6% 的人,不值得为它投入自动化,值得的是"2 轮答不上来即转人工"的干净承接

Case 佐证(沿用抽样,结论按修正后场景重述)

66 通抽样(每店:基础版成交组 4 通、最优桶成交组 / 转人工组 / 未成交组各 6 通),四个可回溯的具体漏点(会话样本可逐条回溯原文):

漏点1 · 答完即邀评(toptrees 最典型,落在 选品适配与喂养/参数与信任凭证)。 最优桶未成交 6 通里 4 通最后一句是"如果对我的服务满意,在评价客服处帮忙点击下【很满意】"+满意度图片,而不是任何促单动作。会话样本 A:买家问配料表,机器人把鲜鸡肉 35%、鸡肉粉 20%、5 种益生菌、消化率 94.9% 讲得非常专业,答完直接邀评走人。会话样本 B:买家从"哪个适口性好"一路问到"老年猫 10 岁适合吗",9 轮全部答对且有反问,最后一句还是邀评。这正是 B 层"答得对但没收口"的标准样本。

漏点2 · 推荐不收敛(冠能,落在 选品与症状两类)。 会话样本 C / 会话样本 D 机器人最后停在"您可以对比下~""可以先拍~",没有收敛到唯一一款、没给"就选它"的理由。冠能未成交组 6/6 都把券/立减/金币算得很清楚,却仍不成交——只算钱不拍板不够

漏点3 · 复读机导致转人工(冠能)。 会话样本 E:买家明确纠正"给哺乳期母猫吃的,不是生的小猫",机器人把同一段幼猫粮答案又发了一遍,买家直接打"人工"。应在编排层加"买家纠正后禁止复用上一轮答案"的硬约束。

漏点4 · 否定式无兜底(对应 找货与货源落空 找货落空)。 toptrees 会话样本 F:买家问赠品,机器人答"暂无额外赠品活动…建议关注店铺活动",买家连打两次"人工"。冠能 会话样本 G:"抱歉亲,没找到小鸟玩具的链接呢"——直接落空。冠能 会话样本 H 更典型:机器人主动补了一句"如果过敏源不是该成分,效果会有限",把自己刚建立的信心又拆了。找货与货源落空答不上来占比 21.4%、转化率 33.9% 的数字,就是这些对话的统计投影。

三条已在最优桶验证过、可直接横向复制的正向剧本:麦富迪 会话样本 I 的「活动 + 赠品 + 15 天可退 + 运费险」组合收口(对应 试吃与退换保障 风险逆转);麦富迪 会话样本 J 的「立减 50 元→券后 272 元→再叠淘金币 3.59 元」算总账(对应 价格活动与比价);toptrees 会话样本 K 的「主粮 + 搭配主食罐/猫条 + 一起买 95 折」组合加购——这正是 toptrees 客单从 76 元翻到 148 元的机制来源。

一个必须承认的边界:转人工组里用户自己打"人工"的比例是 toptrees 6/6、冠能 4/6、麦富迪 3/6,全量口径下 直接要人工独立成档占 2.0% 人数。继续压转人工率的空间有限,别把它当 KPI 硬拧(第五章已证明它也换不来转化)。

机会点折算(场景基)

口径:以基础版同场景转化率为目标水位,算最优桶补齐差值可多产生的成交人数,按该店最优桶实际客单折算。只列 Δ 为负且两桶合计 ≥60 人的场景。仅供参考·不构成承诺值·不作考核依据。

麦富迪(最优桶客单 144 元 / 观测 2 天)

场景分层最优桶人数缺口(pp)可补成交人数折日均日均GMV机会
找货与货源落空B11012.313.56.8975 元
直接要人工3512.24.32.1308 元
版本辨识与对比B1271.92.51.2179 元
价格活动与比价A812.82.31.1162 元
症状驱动选品C971.71.60.8117 元
选品适配与喂养B4170.20.80.457 元

合计约 1,799 元/日(实验桶内),全店按实验桶占售前流量约一半放大 ×2 ≈ 3,600 元/日。其中 找货与货源落空 一个场景占 54%。

冠能(最优桶客单 265 元 / 观测 2 天)

场景分层最优桶人数缺口(pp)可补成交人数折日均日均GMV机会
症状驱动选品C408.53.41.7451 元
参数与信任凭证B752.01.50.8202 元
试吃与退换保障A421.90.80.4106 元

合计约 759 元/日(实验桶内),×2 ≈ 1,500 元/日

需要诚实标注的是:冠能整体 -4.91pp 对应约 18.5 个成交人,折日均约 2,450 元,但场景基只能归到 759 元——差额落在人数<60 的碎片场景里,无法定位。这本身就是第五章"弥散型负向"的另一种表述,也是不建议在本窗口做冠能归因结论的原因。

toptrees

无场景达到 60 人门槛(场景人数中位数 12),不折算

诊断结论与行动

分店结论

麦富迪:不是"负向",但也不是能直接放量的"正向",稳定形态是「笔数略降、篮子变大」。 锁定窗口内转化率 +0.10pp(转人工段 p=0.522、纯机器人段 p=0.627,两桶等价),单人产值 +10.5 元(+22.5%,p=0.033)。但把它自己的 08-01 至 08-05 序列拉出来(第十章),5 天里有 4 天转化率略负,全序列 -1.07pp(p=0.342),而单人产值优势从 +10.5 元缩到 +3.7 元(+9.8%)、客单优势 +13.1%。也就是说"转化率显著为正"从来没成立过,"GMV 显著为正"也只在盛典窗口成立。净值取决于考核转化率还是 GMV:考转化率就是持平偏负,考 GMV 就是小幅正。建议不要按这两天放量,以 5 天以上、且不含大促的窗口复核一次(现有数据已支持 08-01 至 08-05,缺的是非大促段)。场景层面的判断不受窗口影响:26% 的最大场景 选品适配与喂养 逐场景持平,物流订单会员实现"转人工 -14.9pp + 转化率 +11.6pp"双赢,唯一需要跟进的缺口是 找货与货源落空(-12.3pp,日均约 975 元机会)。

冠能:方向负但证据不足,且窗口被污染,暂缓放量、按计划扩样复测。 转化率 -4.91pp(p≈0.4)、单人产值 -20.3%(p=0.183)。08-04 14:27 才上线、负向全部落在 08-05;两段转化率各降 4-5pp 但均不显著,场景层面无一显著——形态与"冷启动 + 单日效应"一致。在扩样出结果前不要按"版本变差"处置。 可以并行做的是产品侧确定性动作:推荐收敛拍板(选品与症状两类)与买家纠正后禁止复读。

toptrees:锁定窗口内不下结论,但样本不用等统一复跑——08-01 至 08-04 已经有四天数据,现在就能扩。 锁定窗口只有 08-04 一天、120/127 人。机制定位是干净的:纯机器人段两桶完全一样(p=0.920),转人工段腰斩(34.0%→17.1%,p=0.066)——负向住在转人工之后,需外部核实当日人工排班/分组,不应记在机器人版本头上。四天序列(第十章)把两件事拉回地面:转化率全序列 -2.59pp(p=0.389)、四天里三天为负一天为正,属噪声量级;客单不是 76→148 元这种翻倍,四天口径是 90→116 元(+28.6%),08-04 的翻倍是单日大额订单造成的假象。唯一在四天里都稳定的信号是转人工率——最优桶每天都低约 7pp。

五个动作(按 ROI 与确定性排序)

1. A 层订单/物流自助,横向复制到冠能与 toptrees(确定性最高)。 麦富迪 物流订单会员 已验证:转人工 72.3%→57.4%、转化率 46.8%→58.4%。该场景只需订单数据(发货时效、快递公司、改地址、会员门槛),零商品知识依赖、零风险。三店合并 物流订单会员 仍有 64.5% 转人工率,这是最便宜的一块降本+提转化。

2. 建 找货与货源落空的兜底闭环(麦富迪最大失血口)。 现状:答不上来占比 21.4%、转化率 33.9%、转人工 54.8%,回答"没找到/已下架"就结束。动作:缺货/下架判定后必须给同系列替代品 + 到货登记 + 兑换规则说明,禁止以"抱歉没找到"收尾。日均机会约 975 元(麦富迪,实验桶内)。

3. 禁止售前未成交会话发满意度邀评。 toptrees 最优桶未成交 6 通中 4 通末尾是邀评。动作:把邀评触发条件限制为"已成交 / 已明确表示不买",或强制排到促单动作之后。佐证 会话样本 A、会话样本 B。

4. B 层答完必须收口(选品 / 版本 / 参数三类,占 51.7% 人数)。 这一层机器人接得住(转人工 32.3%、兜底 9.6% 都是最低),缺的是最后一句。动作:命中单属性/版本对比/适配提问并答完后,追加「紧迫 + 背书 + 低风险」并主动收口。可直接复用麦富迪 会话样本 I 的现成话术。要配的基建是商品结构化属性库 + SKU 定位——这是本层从"答对"到"答准并收口"的前置条件。

5. C 层老实转人工(症状驱动选品 + 品质异议,仅 7.6% 人数)。 品质异议与退换答不上来占比 60.3%、转化率 17.5%,症状驱动选品 涉处方粮/病症。动作:同一场景连续 2 轮答不上来即转人工并附承接话术。不要泛化到 A/B 层——第五章已证明转人工率既压不出转化,也不该当 KPI 拧。

复核安排(本版新增,替代原先"统一 8/13 复跑")

三店不该用同一个复核方案,因为它们缺的东西不一样。

toptrees 现在就能复核,不用等。 08-01 至 08-04 已经有 401/430 人,把窗口从"锁 08-04 至 08-05"改成"08-01 起至今"即可。判定门槛:转化率差要达到 ±5pp 才有意义(当前样本下 5pp 对应 p≈0.1),转人工段与纯机器人段必须分开出数——因为负向就住在转人工段。

冠能只能靠时间攒样本。 现有 379/340 人,要把 -5pp 打到 95% 显著需要约 1,200 人/组,按 08-05 的日流量(约 280/组)大约还需 4-5 天。同时必须把 08-04(半天曝光)从主口径剔除,或改用"上线后曝光时长对齐"的口径。它是三店里唯一转化率与客单同时偏负的店,优先级最高。

麦富迪要的不是更多样本,而是一个干净窗口。 它已有 3,637/3,532 人,样本足够;问题是 08-04 至 08-05 在盛典里。动作是取 8/10 之后的 5 个连续非大促日重跑同一套口径,主看两个指标:成交笔数差(现在是 1280 vs 1281)和单人产值差(现在盛典内 +10.5 元、5 天口径 +3.7 元)。如果非大促窗口里单人产值优势仍 ≥+3 元且转化率不掉超过 1pp,就可以放量;否则按考核指标取舍。

三店共用的两条口径纪律:转化率一律全渠道付款;分子 <20 的场景/分段不判显著,只列区间与 case。

自动复跑任务已按本节改写:时间从 8/13 移到 8/15(麦富迪 8/10-8/14 五个非大促日跑完的第一天,冠能届时也已攒够),任务内容同步换成全渠道付款口径 + 原话场景口径 + 转人工段/纯机器人段分开出数,并显式作废「高意向已定品」那一档意图与"少转人工丢兜底"的旧假设。toptrees 的四天扩样不依赖这个任务,可以立刻做。

仍需外部核实的假设(本数据无法证伪)

稳健性附注:把各店自己的 08-01 至 08-05 序列拉出来

前面九章都锁在 08-04 至 08-05。这一章问一个更基本的问题:那两天的读数,在各店自己的日序列里稳不稳? 答案是——方向稳,量级不稳,而且几个最抓眼的数字都是单日假象。

先说为什么必须做这件事。08-04 至 08-05 落在超级 88 年中盛典(8/4-8/9)里。麦富迪日转化率从 08-01 至 08-03 的 33-35% 跳到 08-04 至 08-05 的 38-40%,单人产值从 28-34 元跳到 45-47 元(基础版)——大促把绝对水位整体抬了一个台阶。两桶同等受影响,所以桶间比较不失效;但"+22.5% 的单人产值优势"这种量级,本身是在被放大的分母上算出来的。

(下表人数为 「人·天」口径,跨天买家重复计入,故与前面去重人数略有出入;桶内比较不受影响。转化率一律全渠道付款。)

麦富迪:5 天里 4 天转化率略负,GMV 优势缩水到 +9.8%

日期基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)基础版单人产值最优桶单人产值Δ单人产值最优桶机器人平均发言条数基础版机器人平均发言条数最优桶转人工率基础版转人工率
08-0165534.66%(227)67333.14%(223)-1.5234.1元34.4元+0.3元6.475.3139.5%39.8%
08-0266933.48%(224)69131.55%(218)-1.9328.1元31.8元+3.7元6.185.2342.1%43.2%
08-0367533.93%(229)67731.61%(214)-2.3232.3元24.4元-7.9元6.214.9942.4%43.0%
08-0477940.05%(312)81338.75%(315)-1.3145.1元51.7元+6.6元6.185.2840.0%41.7%
08-0575438.33%(289)78339.59%(310)+1.2647.4元60.8元+13.4元6.325.3140.2%35.8%

全序列合计:最优桶 35.19%(1280/3637) vs 基础版 36.27%(1281/3532),Δ -1.07pp(z=-0.95, p=0.342);单人产值 41.6 vs 37.9 元,Δ +3.7 元(+9.8%);客单 118 vs 104 元(+13.1%)。

读法:转化率的符号在 5 天里有 4 天是负的,只有 08-05 转正——而锁定窗口恰好包含了这唯一一个正日。把 5 天并起来 Δ 是 -1.07pp、p=0.342,仍然不显著,但方向从"+0.10pp 微正"翻成"-1.07pp 微负"。这说明锁定窗口的"两桶等价"结论是对的,"版本正向"是选窗选出来的。 GMV 侧同理:08-05 单日 +13.4 元把窗口内均值拉到 +10.5 元(p=0.033),5 天口径只剩 +3.7 元。成交笔数 1280 vs 1281——几乎一样多的单,最优桶多卖了 3.7 元 / 人,这才是这个版本的真实画像。

冠能:只有两天,且这两天符号相反

日期基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)基础版单人产值最优桶单人产值Δ单人产值最优桶机器人平均发言条数基础版机器人平均发言条数最优桶转人工率基础版转人工率
08-047335.62%(26)8939.33%(35)+3.71124.3元97.1元-27.2元9.165.0528.1%43.8%
08-0526743.07%(115)29035.52%(103)-7.55118.8元95.6元-23.2元8.495.6825.2%36.3%

全序列合计:最优桶 36.41%(138/379) vs 基础版 41.47%(141/340),Δ -5.06pp(z=-1.39, p=0.165);单人产值 96.0 vs 120.0 元,Δ -24.0 元(-20.0%);客单 264 vs 289 元(-8.9%)。

读法:这店没有序列可查——08-01 至 08-03 完全没有分桶记录,实验就是 08-04 下午才上线的。它的转化率差在两天里符号相反(+3.7 / -7.6),唯一在两天里同向的是 单人产值都负约 -25 元,且客单也是负的(-8.9%)。这一点与麦富迪、toptrees 相反,是三店里唯一"转化率和客单同时偏负"的店,值得在扩样时优先盯。但 379/340 人上的 -5pp 依然不显著,结论不变:扩样后再判

toptrees:有四天,客单"翻倍"是单日假象

日期基础版人数基础版转化率最优桶人数最优桶转化率Δ(pp)基础版单人产值最优桶单人产值Δ单人产值最优桶机器人平均发言条数基础版机器人平均发言条数最优桶转人工率基础版转人工率
08-018429.76%(25)9325.81%(24)-3.9628.0元31.9元+3.8元5.735.1228.0%35.7%
08-0210719.63%(21)10221.57%(22)+1.9424.3元20.9元-3.4元6.415.1227.5%35.5%
08-0311225.00%(28)8622.09%(19)-2.9120.4元17.5元-2.9元6.055.5432.6%34.8%
08-0412730.71%(39)12025.00%(30)-5.7123.5元37.0元+13.6元6.035.5234.2%41.7%

全序列合计:最优桶 23.69%(95/401) vs 基础版 26.28%(113/430),Δ -2.59pp(z=-0.86, p=0.389);单人产值 27.5 vs 23.8 元,Δ +3.8 元(+15.9%);客单 116 vs 90 元(+28.6%)。

读法两条。第一,锁定窗口那天(08-04)是四天里转化率最差的一天(-5.71pp),也是单人产值最好的一天(+13.6 元)——两个最抓眼的数字都出在同一天,典型的单日大额订单效应。四天并起来转化率 -2.59pp(p=0.389)、客单 +28.6%,量级都回到了噪声区。第二,"客单 76→148 元翻倍"这个说法必须撤掉,四天口径是 90→116 元。

三店唯一稳定的版本指纹:机器人平均发言条数与转人工率

跨 11 个店·天,两个信号在每一天、每一店都同向,从没翻转过:

也就是说,"多接一点、少转一点"这个产品意图是实现了的;没实现的是把这部分多接下来的会话转成订单——第五章的反事实分解已经量化过,少转人工只解释了负向的一小部分(冠能 -0.59pp / 总 -4.91pp)。多说话 ≠ 说到点上,这是三店合看后最稳的一句话。

这一章改变了什么

结论锁定窗口读数加上序列后的读数处置
麦富迪版本方向+0.10pp,GMV +22.5%(p=0.033)转化率 -1.07pp(4/5天为负),GMV +9.8%从"正向放量"回调为"笔数持平偏降、篮子变大",非大促窗口复核
toptrees 客单76→148 元(+94%)90→116 元(+28.6%)撤销"翻倍"表述
toptrees 样本只有 08-04,须等统一复跑08-01 至 08-04 已有 401/430 人可立即扩样,不必等
冠能窗口污染08-04 下午上线确认无 08-01 至 08-03 数据不变,扩样后再判
版本是否生效未单独验证机器人平均发言条数 11/11 店·天同向偏高新增:版本确实生效,问题在收口
本章仅做稳健性标注,不替换第二至第九章的窗口内读数。所有折算金额同样适用"仅供参考·不构成承诺值·不作考核依据"。

附:与首版的差异清单

首版修正版依据
转化率口径仅当日成交一路全渠道付款规范口径;麦富迪负向随之消失
麦富迪判读+0.59pp 持平+0.10pp,两段 p>0.5,等价分段检验
核心失血口「纯图 / 链接」档三店同向该标签 85-95% 误标,作废首句原文漏召检验
场景口径13 个关键词意图9 场景 + 3 无诉求档,残留 10.3%原话 MECE 重建
麦富迪最大缺口「纯图 / 链接」档 -7.2pp找货与货源落空 -12.3pp场景级下钻
冠能机制"少转人工"+两段同降"少转人工"仅解释 -0.59pp;负向弥散不可定位四象限反事实
toptrees 机制意图分解噪声,无定位纯机器人段 p=0.920 / 转人工段 p=0.066,定位在人工侧分段检验
窗口前提三店同窗口冠能 08-04 14:27 上线、toptrees 无 08-05按日期 × 桶 拆分
意图结构位移D_选品占比翻倍导致辛普森结构效应仅 ±0.5pp,位移是标签漂移假象场景基 Kitagawa
窗口代表性未提08-04 至 08-05 落在超级 88 盛典内,绝对水位被抬一档08-01 至 08-05 日序列
麦富迪处置正向、可放量回调为"笔数略降、篮子变大",非大促窗口复核后再定5 天序列转化率 -1.07pp(4/5 天为负)
toptrees 客单76→148 元(+94%)90→116 元(+28.6%),翻倍是单日假象四天序列
版本是否生效未验证11/11 店·天最优桶机器人平均发言条数更高,版本确实生效日序列交叉