客服机器人运营中台
机器人做出来只是开始。这一页要回答四个问题:它好不好用、哪里不好用、先改哪个、改完有没有用。 指标体系、badcase 归因、知识库排期、话术 A/B 和版本迭代都在这里, 最后用一次自助解决率从 61.8% 涨到 78.2% 来收尾。
自助解决率 vs 转人工率
两条线是互为镜像的同一件事,放在一起看是为了检查"转人工率降了,但用户是不是被硬拦住了"。
会话处理漏斗
漏斗看清"流量在哪一层被消耗"。
意图分布与解决率
按会话量排序,重点看"量大且解决率低"的象限。
结论:「机票改签」「航班延误」「机票退票」是量级大且解决率偏低的三类, 其中航班延误受外部信息依赖(航司实时状态)影响,短期内解决率天花板明显, 因此优先级放在改签与退票的规则知识补齐上。
转人工原因帕累托分析
9,832 通转人工会话逐条归因。前三项加起来占 65.6%,资源先砸这里,别平均用力。
怎么读这张图:横条的相对长度是量级,右侧百分比是累计占比。 累计到第三项已经 65.6%,意味着只要把「情绪升级」这一个 P0 项处理掉, 理论上就能释放约 1,573 通会话的人工压力——这就是我把它排在迭代第一位的依据。
每一条 badcase 都得有下一步动作
这一页里我觉得最重要的就是这块。分类只是手段,关键是每条 badcase 都能回答四个问题: 改什么、谁改、改了没有、改完验证了没有。
| 会话 ID | 用户原话 | 机器人表现 | 归因分类 | 影响会话 | 优先级 | 状态 |
|---|---|---|---|---|---|---|
S-0901-0427 | “我要退订,但是这个酒店我明天才入住” | 识别为「酒店订单查询」,只回显了订单信息,未触发取消政策 | 答非所问 | 1,240 | P0 | 已修复 |
S-0903-1188 | “我买的那个票能换到后面那趟吗” | 置信度 0.32,进入澄清话术,用户第 2 轮直接转人工 | 未识别 | 960 | P0 | 已修复 |
S-0912-2891 | “我要投诉你们客服态度” | 正确触发 R1 规则转人工,但转接时未携带上一轮会话上下文 | 情绪升级 | 260 | P0 | 已修复 |
S-0905-2201 | “你们这什么破系统,退款一个月了!” | 第 1 轮情绪分 3.5 已正确转人工,但话术直接讲流程,缺少共情 | 情绪升级 | 870 | P0 | 已修复 |
S-0906-0093 | “订单号 202609178866 我要退掉” | 识别为「酒店改期」,追问「请问改到哪一天」 | 答非所问 | 520 | P0 | 已修复 |
S-0907-3340 | “国际航班行李能带多少” | 命中 KB-105「国内航班免费行李额」,未区分国际航线 | 知识未覆盖 | 610 | P0 | 处理中 |
S-0910-0765 | “开发票要多久,报销着急” | 命中 KB-107,回答「24 小时内开具」,未提供加急通道 | 知识未覆盖 | 340 | P1 | 已修复 |
S-0904-0812 | “宠物能带进去不?金毛 30 斤” | 命中 KB-108,告知可携带 15kg 以下宠物,但未回答超重怎么办 | 知识未覆盖 | 430 | P1 | 已修复 |
S-0908-1156 | “帮我看看是不是延误了 mu5137” | 意图识别正确,但槽位 flightNo 未抽取到,反复追问航班号 | 系统报错 | 380 | P1 | 已修复 |
S-0909-4402 | “算了算了不用了” | 判为未识别,第 2 轮触发 R3 转人工,而用户实际已放弃咨询 | 未识别 | 290 | P2 | 待排期 |
S-0901-0427 P0 答非所问 影响 1,240 通 “我要退订,但是这个酒店我明天才入住”
「退订」是「取消」的高频近义词,但未收录进 hotel.cancel 关键词表,权重被 hotel.order.query 抢走
「退订/取消预订/不住了」补入 hotel.cancel 并提权至 4.5;新增该表达回归用例 8 条
S-0903-1188 P0 未识别 影响 960 通 “我买的那个票能换到后面那趟吗”
口语化表达「后面那趟」未覆盖,且未出现「改签」「换时间」等标准词
新增口语样本 12 条训练/规则补充:后面那趟、晚一班、顺延一班
S-0912-2891 P0 情绪升级 影响 260 通 “我要投诉你们客服态度”
转人工 payload 只带了当前轮意图,人工客服需要用户重述问题
转接载荷增加最近 5 轮对话 + 槽位快照 + 情绪分,人工侧首响即见完整上下文
上表展示全部 10 条,下方展开的是其中影响量级最高的 3 条完整归因链路(根因 → 动作)。
知识库健康度
写完不等于完事,知识库得一直养。
未覆盖问题 TOP · 待补知识排期
按影响会话量降序排期,而不是按提出时间。
话术 A/B 实验:转人工前置共情句
运营改话术最容易"凭感觉",所以我给每次话术调整都配一次对照实验。
“已为您转接人工客服,请稍候。”
“非常抱歉给您带来不便,已为您优先转接人工客服, 您的订单与聊天记录已同步,无需重复说明。”
| 指标 | 对照组 A(n=4,800) | 实验组 B(n=4,800) | 变化 |
|---|---|---|---|
| 转人工后满意度 CSAT | 4.21 | 4.58 | +0.37 |
| 转人工后二次进线率 | 18.4% | 12.6% | -5.8pp |
| 人工平均处理时长 | 412s | 356s | -56s |
| 高情绪会话占比 | 16.0% | 11.2% | -4.8pp |
实验结论:四项指标全部显著改善(双样本 t 检验,p < 0.05),且改善幅度最大的不是满意度本身, 而是人工平均处理时长(-56s)——说明"上下文透传"真正减少的是人工侧的重复沟通成本。 这条结论也直接推翻了团队此前"转人工话术不影响效率"的判断。
16.4pp 不是一次改出来的
每一步只改一件事,改完看数,数不对就回滚。下面 5 次迭代对应上面折线图里的 5 个台阶。
| 版本 | 上线日期 | 做了什么 | 自助解决率 | 提升 |
|---|---|---|---|---|
V1.0 | 08-01 | 基线版本:15 类意图 / 知识库 386 条 / 转人工策略 3 条 | 61.8% | — |
V1.2 | 08-09 | 补充「退订、取消预订、不住了」近义词与口语样本 | 65.4% | +3.6pp |
V1.5 | 08-18 | 新增「退款进度查询」独立意图 + KB-106 退款到账规则 | 70.1% | +4.7pp |
V1.8 | 08-26 | 转人工策略 3 条 → 5 条;情绪阈值由 4 分下调至 3 分 | 73.8% | +3.7pp |
V2.0 | 09-03 | 知识库国内/国际拆分,补 66 条高频缺口知识 | 76.4% | +2.6pp |
V2.1 | 09-10 | 转人工话术前置共情句 + 上下文透传(A/B 全量) | 78.2% | +1.8pp |
先说清楚怎么算,再谈提升了多少
指标最容易出的问题是口径对不上,同一件事三种算法,汇报时各说各话。 所以先把这四个定义钉死。
数据说明:本页所有数值为基于公开行业信息与真实客服运营方法论构建的模拟数据集, 用于完整演示"指标监控 → 归因 → 排期 → 实验 → 验证"的运营闭环,不代表携程官方经营数据。