AI客服真的能帮你退货、改签、报保险吗?

你有没有遇到过这种情况:跟AI客服聊了半天,它态度特别好,回复也特别流畅,最后你以为事情办成了,结果发现订单根本没退、机票根本没改。
这不是段子。微软联合几所大学的研究者最近做了一件挺较真的事:他们不看AI客服说了什么漂亮话,而是直接去查后台数据库,看AI到底有没有把事情办对。
结果挺打脸的。目前最强的模型,让它把同一个任务重复做20次,只有大约四分之一的情况能做到每次都对。剩下四分之三的时间里,它至少有一次翻车,可能退错了商品,可能该问的没问,可能悄悄改了不该改的字段。
这篇论文的名字叫《One Success Isn't Reliability》,一次成功不等于靠谱,标题已经把话说得很明白了。
为什么"聊得好"不等于"办得好"
先说说这件事为什么值得认真对待。
现在市面上评测AI客服、AI Agent的方法,大部分停留在"这句话说得对不对""这个函数调用格式对不对"的层面。比如你问AI"帮我查一下订单状态",它调用了一个叫`get_order`的工具,参数填对了,返回了结果,看起来一切正常,这个测试就算通过了。
但研究者们发现,真实的企业工作流程远比这复杂。一个真正的客服任务,可能长这样:用户说"我的包裹丢了,能退款吗",AI需要先查订单,再查物流轨迹,再查这个用户的会员等级(因为不同等级退款政策不一样),还要判断当前时间是不是已经超过了政策规定的等待期,最后可能还要真的执行退款操作,再更新工单状态。
*工单*:企业内部用来记录和跟踪一个客户请求处理进度的记录单,类似你去医院挂号后医生手里那张病历。
任何一个环节出错,整个任务就算失败,哪怕AI的回复读起来完全没毛病。
这就好比你雇了一个装修工人,他嘴上说"没问题,这个星期就能干完",态度特别好,言辞特别自信,但你验收的时候发现墙没刷完、插座位置装错了。如果你只是隔着门听他汇报进度,你永远不知道墙到底刷没刷。你必须推门进去,亲眼看墙,这就是这篇论文想做的事:不听AI怎么说,直接看后台数据库有没有变对。
如果不这么做会怎样?论文里给出了一个吓人的数字:在79853次失败的尝试里,有超过80%的案例,AI用一种非常干净利落的方式结束了对话,而且确实调用了会改变数据的操作,看起来完美收官。但实际上后台数据是错的。如果只看对话记录或者只看有没有调用工具,这些失败的案例会被误判为成功。
一个能跑真实业务的沙盒:ThinkingBox
要做到"看后台而不是听汇报",第一步得先搭一个能装下真实业务系统的实验环境。
研究者把这个环境叫做ThinkingBox。
*沙盒*:一个隔离出来的、可以安全测试的独立运行环境,就像小孩子在沙坑里挖挖填填,不会影响到沙坑外面的真实世界。
这个沙盒里跑的是一整套完整的闭环:一个模拟用户提需求,AI Agent去理解需求、调用工具、跟用户来回确认,工具背后连着一套真实业务逻辑的数据库,任务结束后有个专门的"侦探"去后台翻查到底发生了什么变化,最后有一套自动化的判官来打分。
这里有个关键设计:每次测试前,系统会把整个环境重置回一个干净的初始状态,而且不同的测试之间彼此隔离,互不干扰。
*MCP协议*:全称Model Context Protocol,是一种让AI模型能标准化地调用外部工具、访问外部数据的通信协议,可以理解成AI和各种业务系统之间的"通用插座标准"。
为什么要这么麻烦地隔离和重置?你可以想象一个连锁餐厅的后厨,如果第一批客人点的菜和第二批客人点的菜用的是同一口锅、同一份食材记录,那你根本没法准确地评价某个厨师这道菜到底做得好不好,因为你分不清是这次做砸了,还是被上一批客人的痕迹污染了。ThinkingBox的做法相当于每次考核前都换一口全新的锅、全新的食材,这样才能保证20次测试之间是真正独立可比的。
论文里给这套系统写了一个更严谨的数学描述,把它建模成一种叫POMDP的结构。
*POMDP*:全称部分可观测马尔可夫决策过程,简单说就是"决策者看不到全部真相,只能凭手头有限的信息做判断"的一种数学框架,常用来描述AI在信息不完整情况下如何行动。
在这个框架里,AI能看到的只是对话历史和工具返回的结果,它看不到用户心里真正藏着的完整需求,也看不到系统内部真实的完整状态。这其实非常贴近真实客服工作的样子:客服代表也看不穿客户脑子里想什么,只能靠客户愿意说出来的信息、加上系统里能查到的记录,一步步拼凑出正确的处理方式。
507个任务,横跨五大行业
光有沙盒还不够,得往里面装真实、够难、能验证的任务。
研究团队最终构建了507个任务,分布在五个业务领域:零售电商、酒店旅行、汽车保险、数字银行内部IT支持、咨询公司的IT和HR支持。
这些任务不是随便编的,而是脱胎于真实的企业支持案例(当然做了脱敏和虚构化处理,论文里特别强调不含任何真实客户信息)。每个任务都包含一个初始的后台状态、一套业务政策文档、模拟用户的行为脚本,以及一套用来判断最终结果对不对的检查规则。
有意思的是,论文里专门设计了一个"信息不对等"的机制:用户的开场诉求往往是不完整的,还有一部分背景信息被藏起来,只有当AI主动问了,模拟用户才会说出来。
*模拟用户*:由另一个AI模型扮演的虚拟客户,它会按照预设的性格和信息边界跟被测试的AI客服对话,只回答被问到的问题,绝不主动透露没被问到的信息。
这个设计其实是故意刁难AI的。生活里你去银行办事,柜员如果一上来就假设你什么都说清楚了,直接照着你的第一句话去办,大概率会办错,因为你可能压根没提到自己刚换了手机号,或者没提到账户之前有过异常记录。真正靠谱的客服会主动追问、核实,而不是拿着一句话就往前冲。这507个任务里很多都在考这一点:AI敢不敢多问一句,而不是自作聪明地瞎猜。
打分的逻辑也很讲究。绝大多数任务(477个)只看最终的数据库状态对不对,AI可以用任何合理的路径去达成目标,先查订单还是先查用户都无所谓,重要的是最后那个"果"是对的。但另外30个任务额外加了一条规则:必须检查AI最后跟用户说的话里有没有满足特定要求,比如不能泄露酒店内部的机密分类信息,或者必须明确告诉用户政策不允许某个操作。
这套打分标准是"结果导向"而不是"死抠步骤",这一点其实很关键。如果不这样设计,系统就会变成"必须严格按照标准答案的顺序做,哪怕多问了一句都算错",这跟真实世界完全脱节,因为现实里解决同一个问题的路径可以有好几条,只要终点对了就行。
数字说话:强的模型也只能对四分之一
现在来看最核心的数据。
研究团队测了12个主流模型,包括GPT-5.4、GPT-5.2、Claude Sonnet 4.6、Claude Opus 4.6、Grok-4.3等闭源模型,以及DeepSeek-V4-Pro、GLM-5.1、Kimi-K2.6、Qwen系列等开源模型,每个任务重复跑20次。
*pass@1*:单次尝试的成功率,也就是随便挑一次去做,能做对的概率。
*pass@k*:任意抽k次尝试里,只要有一次做对,就算通过的概率,衡量的是"多试几次能不能碰上一次成功"。
*pass^k(读作pass hat k)*:连续k次尝试全部做对的概率,衡量的是真正的"稳定可靠"。
表现最好的GPT-5.4,单次成功率(pass@1)是65.36%。听起来还不错对吧?但再看它的pass@20(20次里至少成功一次的概率),飙升到91.12%。而它的pass^20(20次里次次都成功),只有25.25%。
这个数字差距特别值得琢磨。91.12%告诉你,这个模型基本上"能做对这件事",它具备完成任务的能力,潜力是够的。但25.25%告诉你另一件事:如果你把这个AI客服真的部署上线,每天服务几百上千个客户,让它反反复复处理同一类任务,它大概每4次里就有3次会在某个环节掉链子。
这就像一个射箭选手,你让他射20箭,他至少中靶一次的概率高达91%,听起来是个神射手。可你要是要求他20箭全部命中十环,他只能做到四分之一的场次。企业客服要处理的不是"射一箭",而是"每天射几千箭",一个每4箭里3箭会跑偏的选手,你敢让他去处理真实客户的退款和保单吗?
再往下看,差距更大。GPT-5.2的pass@1是46.28%,pass^20只有8.68%。开源模型里表现最好的DeepSeek-V4-Pro,pass@1是43.26%,但pass^20只有可怜的3.55%。也就是说,几乎所有测试过的模型,一旦要求"每次都对",数字都会大幅跳水。
下面这张表列出了主要模型在五个领域的具体表现:
| 模型 | 零售 | 保险 | 酒店 | 银行 | 咨询 | 平均 |
|------|------|------|------|------|------|------|
| **GPT-5.4** | **76.33** | 62.65 | 68.13 | **65.34** | **54.60** | **65.36** |
| GPT-5.2 | 70.20 | 22.40 | 53.70 | 51.15 | 34.06 | 46.28 |
| Claude Sonnet 4.6 | 68.93 | **58.20** | 60.38 | 53.99 | 51.14 | 58.45 |
| Claude Opus 4.6 | 74.90 | 14.65 | 28.89 | 38.03 | 34.21 | 37.91 |
| DeepSeek-V4-Pro | 68.21 | 29.65 | 43.13 | 44.86 | 31.04 | 43.26 |
| Kimi-K2.6 | 53.72 | 24.50 | 39.52 | 33.65 | 37.33 | 37.66 |
| GLM-5.1 | 58.67 | 25.70 | 35.43 | 13.27 | 34.06 | 33.19 |
有一个特别值得注意的现象:零售电商这个领域,几乎所有模型表现都相对不错,GPT-5.4能拿到76.33%,连表现平平的Mistral-Large-3都能有11.28%。但一到汽车保险,大部分模型直接崩盘,GPT-5.2从零售的70.20%暴跌到22.40%,Claude Opus 4.6从74.90%跌到14.65%。
为什么保险这么难?论文分析认为,保险业务的政策条文更复杂,涉及更多身份核实、资格判断、金额计算的分支逻辑,而且一旦出错往往是不可逆的(比如批准了一个不该批准的理赔)。这也提醒我们一件事:模型在某个领域表现好,不代表它在所有需要"照规矩办事"的场景里都靠谱,领域之间的迁移能力远没有想象中那么好。
失败到底败在哪:四种典型翻车现场
光知道成功率不够,研究者还想搞清楚:AI到底是怎么失败的?
他们把所有失败案例归成了四类。
第一类叫工具使用错误,占比最高,平均达到77.5%。这种情况是AI在调用某个工具时遇到了报错、前置条件不满足,或者查询失败,但AI没能从这个挫折里缓过来,有的甚至假装什么都没发生,继续往下走,好像刚才那个工具调用是成功的一样。
*容错恢复*:指系统或程序在遇到错误后,能够识别问题并采取补救措施继续完成任务的能力,而不是硬着头皮装作没事发生。
这一类错误特别常见于GPT-5.4、GLM-5.1和Kimi-K2.6,分别占到它们失败案例的89.6%、88.1%和85.2%。这个数字挺讽刺的:表现最好的GPT-5.4,它的失败里绝大部分居然不是"不懂业务逻辑",而是"工具报错了不知道怎么办"。这说明模型的推理能力和它跟工具打交道时的鲁棒性,是两件不完全重合的事。
第二类叫没有执行必要的状态改变操作,占比最低,平均只有2.5%。这种失败挺特别的,AI该查的信息都查了,该找的记录也找到了,但最后就是没有真的点下那个"确认""执行"的按钮,任务就这么悬在半空中结束了。这有点像你去银行办业务,柜员把你的资料核对了一遍又一遍,查得非常仔细,最后却忘了把钱真的转出去。
第三类叫用户回应不完整,平均占7.9%。DeepSeek-V4-Pro在这一项特别突出,占到24.7%,而GPT-5.4只有0.5%。这种失败的典型样子是AI后台的工作其实做对了一部分,但最后给用户的回复要么没写完,要么自相矛盾,要么该给的确认没给。论文里给了一个真实案例,一个AI的最终回复居然是一句没写完的话:"In the meantime?",就这样把对话草草结束了,用户压根没得到一个明确的答复。
第四类叫错误的状态更新,平均占12.1%,在o3-pro、Grok-4.3和GPT-5.2身上尤其严重,分别达到27.8%、22.5%和18.3%。这一类最隐蔽也最危险,因为工具调用本身完全没有报错,AI甚至会很自信地告诉用户"已经办好了",但实际改的东西是错的:选错了实体对象、算错了日期、批准了不该批准的赔付、给了不该给的权限。
论文里举了一个具体例子。一个用户申请延期还款,系统查出来他过去12个月已经用过2次延期额度,而政策明确规定"优质客户"最多只能用2次。可这个AI客服还是批准了第三次延期,把整个流程走了一遍,还专门发了确认信息告诉用户"已办妥",工单也标记为已解决。所有的接口调用都没报错,系统日志看起来完全正常,唯独这个决定是错的。这类错误特别可怕,因为它披着"一切顺利"的外衣,如果没有专门去核对后台数据,根本发现不了。
撕开表面完美的假象:一个对比实验
为了证明"光看对话表面根本发现不了这些问题",研究者还专门做了一组对照实验。
他们设计了三种越来越宽松的"表面判断标准"。第一种只要求AI最后干净利落地结束对话、没有留下未解决的问题。第二种在此基础上,要求AI至少调用过一次会改数据的操作。第三种再加一条,要求工具返回的结果里没有明显的报错信息。
结果发现,在真正判定为失败的79853次尝试里,有84.86%满足第一种"表面完美"的标准,80.88%满足第二种标准,67.24%满足第三种标准。
换句话说,如果你是一个只看聊天记录、觉得AI态度好、流程走得顺就打勾通过的产品经理,你会把三分之二以上真正出错的案例误判为成功。这就好比你验收一栋房子,只是站在门口看外墙刷得漂不漂亮,而完全没进屋去看水管有没有装对、电线有没有接错,你打的分数会离真相差出十万八千里。
这也是这篇论文最想传达的核心态度:不能只相信AI说了什么,得去查它真正做了什么。
这件事之后,该往哪儿走
这篇论文发布之后,已经有一些后续工作沿着它的思路继续往前走。
一个明显的方向是把这套"重复多次测试、看后台真实状态"的评估方法用在模型训练上,而不只是评估上。论文本身也提到,这套沙盒系统天然支持把每个检查项拆分成独立的奖励信号,用于强化学习训练,这意味着未来可能会有团队专门针对"稳定性"而不是"单次成功率"去做强化学习微调,目标就是把pass^20这个数字往上提。
另一个方向是模拟用户的真实性问题。论文自己在局限性部分也承认,当前的模拟用户其实是一个"过分乖巧"的角色:它不会记错事实,不会中途改变主意,被AI问烦了也不会不耐烦。这跟真实客户完全不一样,真实客户是会撒谎、会记错、会情绪失控的。可以预见,后续的研究会往"让模拟用户更像真人"这个方向去改进,比如引入会主动质疑、会前后矛盾的用户模型,进一步拉高测试难度。
还有一个值得关注的点是,论文里的判分机制目前对"用户体验"这一块相对宽松,477个任务只看后台数据对不对,完全不管AI跟用户说话的语气和沟通质量。但现实里,一个AI就算把后台数据改对了,如果沟通方式冷冰冰、让用户误解,依然是个失败的服务体验。未来的评测框架大概率会想办法把"数据对不对"和"沟通好不好"这两件事更精细地结合起来打分。
写在后面
读完这篇论文,最让我意外的一个数字不是那个25.25%的pass^20,而是那个67.24%,也就是三分之二以上真正失败的案例,居然连"工具没报错""对话干净结束"这两道最基本的表面检验都能通过。
这说明一件很扎心的事:如果你现在正在用某个"看起来很聪明"的AI客服系统,而验收标准只是"聊起来顺不顺""有没有报错",那你手里握着的可能是一个远不如你想象中靠谱的系统。真正值得警惕的不是那些明显失败、一眼看穿的案例,而是那些看起来完美收官、实际上悄悄把事情办砸了的案例。
还有一点让我一直在琢磨:为什么零售电商领域大家都做得不错,一到保险就集体翻车?我猜跟"错误的代价"有关系。退错一件商品,顶多是客户多退货一次;但保险理赔如果批错了,可能意味着几万块钱的赔付,或者一个本该被拒绝的高风险客户被放行了。当错误的代价越高,AI暴露出的判断力短板反而越明显。这个规律,或许在其他高风险的AI应用场景里也同样成立,比如医疗、金融风控。这个问题,我觉得比这篇论文本身讨论得更值得继续追问下去。
Q&A
Q1:ThinkingBox和ThinkingBox-Bench是什么关系?
A:ThinkingBox是一个可复用的沙盒系统,负责搭建AI客服、模拟用户、业务工具三者互动的运行环境。ThinkingBox-Bench则是基于这个沙盒构建的具体评测基准,包含507个覆盖零售、酒店、保险、银行、咨询五大领域的真实业务任务。
Q2:为什么pass@1和pass^20这两个数字差距这么大?
A:pass@1看的是单次尝试的成功率,pass^20看的是连续20次尝试全部成功的概率。差距大说明AI具备偶尔做对一件事的能力,但缺乏稳定重复做对的可靠性,就像一个能中靶但打不出满环成绩的选手。
Q3:这项研究测试的AI模型里表现最好的是哪个?
A:GPT-5.4综合表现最好,单次成功率达到65.36%,20次里至少成功一次的概率达到91.12%,但要求全部20次都成功的概率也只有25.25%,说明即便是最强模型也远未达到可靠部署的水平。