当AI助手学会"闭嘴":为什么让模型陪你做饭比让它看视频难一百倍

你有没有遇到过这样的场景。
你在厨房里拿着手机对着咖啡机问助手:"下一步该做什么?"它回答了。可你按照它说的做了之后,视频里发生的事情就再也不是原来那个样子了。下一次你再问,它面对的已经是一个被自己上一句话改变过的世界。
这听起来好像没什么大不了,但如果你是研究者,想要评测这个AI助手到底聪不聪明,你会立刻撞上一个死胡同:你没法提前准备好"标准答案视频",因为标准答案本身取决于AI说了什么。
这就是南京大学等机构联合发布的OmniAssistBench要解决的核心难题。这篇论文没有满足于"再做一个视频理解测试集",而是直接对准了一个更麻烦的问题:怎么公平地考核一个会说话、会互动、会持续影响用户行动的AI助手。
一杯咖啡引发的评测危机
传统的视频理解测试是这么玩的:给模型一段视频,问它"这人接下来要干什么",模型答完,视频内容不会因为它的回答而改变一丝一毫。这就像看录像回放考试,无论你答得对不对,录像该怎么播还怎么播。
但一个真正的助手模型不是这样工作的。
论文里举了个特别直观的例子:用户问"怎么做拿铁",模型可能回答"先做浓缩咖啡",也可能回答"先弄牛奶"。这两个答案在现实中都说得通,两条路都能通向同一杯拿铁。问题是,测试视频只能录下一种做法的后续画面。如果模型选了另一条路,接下来该给它看什么视频?
如果不解决这个分岔路问题会怎样。答案是整个评测体系会失效,你精心准备的十段视频,可能只对应模型十种可能回答里的一种,剩下九种回答根本没有对应的"后续画面"去验证对错。这就好比你想测试一个人认路的能力,可考试路线图只画了一条从家到公司的路,而这个人明明可以走三条不同的巷子到达同一个地点,你却因为他没走你画的那条路就判他错。
研究团队想出的解法挺巧妙,他们不再让模型自由选择路径,而是先从视频里反推出一份"标准流程",逼着模型必须沿着这条唯一路径走。
先验知识(Prior Knowledge):从视频内容中提炼出的固定操作路径或背景信息,比如"这段视频里冲咖啡是先萃取浓缩液再加牛奶",用来锁定模型必须遵循的唯一正确答案,避免因为存在多种可行方案而导致评判混乱。
有了这份先验知识,哪怕现实中"先加牛奶"也是对的,测试里也只认"先做浓缩"这一条路。这不是说模型必须按某种教条行事,而是给评测本身找到了一个可验证的锚点。
这个锚点找到之后,团队还要做一件极其耗人力的事:反向切割互联网上现成的视频,把一段连续的做菜、维修、聊天视频,按照设计好的问答节点切成一段段片段,在每段结尾插入模拟用户提问的语音,活生生把一个"静态视频"改造成一个"多轮对话记录"。这个过程耗费了超过1000个专家工时,团队自己在论文里也承认这是个笨办法,但目前没有更聪明的替代方案,因为自动化流水线抓不住那些视频里细枝末节的信息,也没法保证编造出来的用户目标符合视频逻辑。
两层能力金字塔:从"看懂"到"会帮"
搞定了数据构造的哲学难题后,团队要回答第二个问题:一个合格的助手,到底需要具备哪些能力?
OmniAssistBench把能力拆成两层,基础层和进阶层。
基础层测的是"感知",也就是模型有没有把视频里的信息看清楚、听明白。这一层包含社交感知、时序感知、指代感知、非语音提示跟随四大类,往下细分成十几个小任务。
其中最扎心的一个发现是关于手势的。
社交感知(Social Perception):判断视频中人物身份、谁在跟谁说话、说话人情绪状态等社会关系类信息的能力。
时序感知(Temporal Perception):模型需要记住视频里非主线、不起眼的细节,并按时间顺序把它们串联起来,比如"某人说那句话时,背景里走过的人穿的什么颜色衣服"。
指代感知(Referential Perception):用户可能不会直说"那个红色的杯子",而是说"我刚才放在桌角的那个",模型要能在多个相似物体里精准锁定用户真正指的那一个。
非语音提示跟随(Non-audio Prompt Following):用户可能用手势或写字来表达指令,而不是开口说话。
进阶层测的是"决策",模型是不是知道什么时候该说话、该说什么、该怎么根据当下具体环境调整建议。这一层包含情境感知回应、主动式回应、流程追踪三大类。
情境感知回应这个任务特别有意思。论文里给了个例子:用户在下载FFmpeg软件,问"我该怎么下载"。如果模型只是甩出一份"Windows怎么装、Linux怎么装、Mac怎么装"的通用教程,看起来面面俱到,其实一点用没有,用户根本用不上另外两条。而如果模型注意到屏幕上有Windows 11的开始菜单图标,直接说"你用的是Windows系统,点这个蓝色按钮下载",这才是真正帮到人的回答。
这就好比你去药店买感冒药,药师如果给你念一遍说明书上所有禁忌人群,而不问你具体是发烧还是流鼻涕就直接推荐,那这药师等于什么都没说。如果不做情境判断,模型给出的建议就是一份放之四海而皆可、放之四海也皆无用的万能模板,信息量为零。
主动式回应这个任务更考验人性,准确说是考验"机性"。它测的是模型能不能忍住不说话,等到真正该出声的那一刻才开口。
论文里的例子是"下一辆出租车来了告诉我车牌号"。用户说完这句话之后,视频还在继续播放各种画面,模型必须自己判断"现在该不该说话",而不是每一帧都跳出来叨叨。这就好比你让朋友帮你盯着门外,看到快递员来了叫你一声。一个称职的朋友会安静地看手机,直到快递员真的出现才开口。而一个不称职的"助手"会每隔十秒就说一句"还没来""还没来""还没来",或者更糟,看到隔壁邻居走过就大喊"来了!"
如果模型学不会这种"延迟响应"的能力会怎样。论文的实验结果给出了答案:模型经常被视频里无关的背景说话声干扰,误以为那是新的用户指令,结果彻底忘了最初的任务。这不是小毛病,这是当前模型普遍存在的一个结构性缺陷。
代理身份(Addressee Identification):判断说话人当前是在对谁讲话的能力,视频里往往同时存在好几个人,模型得分辨清楚这句话到底冲着谁说的。
情境感知回应(Context-aware Response):不满足于给出笼统正确的答案,而是结合用户所处的具体环境给出可以直接执行的建议。
除了这两层任务体系,团队还专门跑去实拍了三个"真实世界案例",因为现实生活远比切割好的测试片段复杂得多。这三个案例分别叫会议模拟、盲人辅助、手工艺流程追踪,每个案例平均长达15轮交互,时长从几分钟到二十分钟不等。
盲人辅助这个案例特别打动人。志愿者假装是视力障碍者,要求模型帮忙完成三件事:找到桌上一件粉色外套、根据手绘地图导航到另一个房间的某张桌子、提醒他朋友什么时候到。中途用户走错方向朝一个黑色包走去,模型得及时纠正路线。这不是简单的"看图说话",而是要求模型持续跟踪用户的实时状态,随时调整指导策略。
模型考试成绩单:谁在裸泳
说了这么多任务设计,最后当然要看模型考得怎么样。
结果是,目前最强的商业模型Gemini-3-Pro,拿到66.4分,满分100分。开源模型里表现最好的Qwen3-Omni-Instruct拿到51.2分。
这两个数字放在一起看很扎心。66.4分意味着什么?按照论文的评分标准,60分是"给出至少部分有意义回答"的及格线,40分意味着"理解了指令但给不出正确答案",20分及以下代表"根本没理解用户在说什么"。也就是说,即便是目前最顶尖的模型,平均水平也只是勉强踩在及格线上方一点点。这跟我们平时用ChatGPT聊天时那种"无所不知"的印象完全是两个概念。
具体拆开看,问题主要出在四个地方。
第一是手势指令跟不上。 不管是开源还是闭源模型,看到视频里有人做手势表达含义,普遍抓瞎。团队分析原因可能有两方面,手势这种视觉信号本身就模糊,很容易和角色随意的肢体动作或者背景杂讯混在一起认错;另外训练数据里手势指令样本本来就少,模型压根没见过多少这类例子。
第二是长期记忆撑不住。 论文里给了个具体数字,MiniCPM-o-2.6在32k上下文窗口下,以每秒1帧的采样率大概能记住380秒的视频,超过这个长度模型就开始说胡话。而Qwen系列因为给每一帧编码的信息量更大,有效记忆时长反而更短,只有大约80秒。这些容量对于动辄十几分钟、涉及多轮交互的真实场景来说,完全不够用。
上下文窗口(Context Window):模型一次能够"记住"并处理的信息总量上限,超过这个上限,早期的对话内容就会被遗忘或截断。
这就好比让你去参加一场需要记住二十分钟前对话内容的谈判,但你的脑子只能存住前八十秒说的话,八十秒之后前面说的全部自动清空。如果没有专门的长期记忆机制来解决这个瓶颈,模型在长视频、多轮任务面前必然掉链子,这不是训练数据够不够多的问题,而是架构层面的硬限制。
第三是不会"憋住不说"。 前面提到的主动式响应问题在实验里得到了印证。当没有新的用户提问时,模型很容易被视频里其他人的说话声带跑,误把背景对话当成新指令来回应,结果把用户最初交代的任务忘得一干二净。
第四是多任务追踪能力弱。 论文设计了一个多任务追踪测试,给模型一份"待办清单",比如要同时准备四杯咖啡,每杯的名字都不一样,让模型汇报每杯咖啡现在进展到哪一步了。结果发现,除了Gemini-3-Pro之外,大多数模型能描述当前画面在发生什么,却对不上号,说不清这个动作到底属于清单里哪一项任务。这说明模型很可能只是在简单地根据关键词做信息过滤,而不是真正按照预设的任务清单在脑子里维护一份进度表。
三个真实案例的成绩差距更能说明问题。闭源模型在这三个案例上平均51.2分,开源模型只有34.8分,差了整整16分。就连表现最好的Gemini-3-Pro,在手工艺流程追踪任务里,一旦小物件被移出摄像头视野再重新出现,也会跟不上状态变化。多数模型在盲人辅助案例里理解不了手绘地图和真实环境之间的对应关系,在会议模拟案例里经常答非所问,给不出用户真正想问的那个发言人的名字。
拿掉一层皮之后会怎样
为了搞清楚音频和视频这两种输入到底谁更重要,团队做了个挺直接的实验:把测试样本里的音频拿掉,或者把视频画面拿掉,看模型表现怎么变化。
结果基本符合预期,拿掉任何一种模态,分数都会掉。但拿掉音频造成的下降比拿掉视频更明显,说明语音里携带的信息通常更关键。
不过实验里冒出一个反直觉的现象。在主动式响应这个任务上,去掉音频反而让所有测试模型的表现变得更好。
这个结果乍一看很奇怪,少了信息不应该表现更差吗?细想一下就明白了。主动式响应任务的设计是用户只在第一轮说一句话交代任务,后面几轮不再出声,模型要靠自己判断该不该开口。原本视频里带有完整音轨的情况下,模型容易把背景里其他人的说话声错认成新的用户指令,结果被带偏,忘了最初那句交代。把音频拿掉之后,这种干扰源没了,模型反而能老老实实守住最初的任务不跑偏。
这个发现挺有意思的地方在于,它揭示了一个模型的通病:它们倾向于对"听到的任何一句人话"都做出反应,而不是真正理解"这句话是不是冲我说的、是不是我该回应的"。这跟人类完全不同,一个正常人在等快递的时候,听到隔壁邻居和家人聊天,绝对不会插嘴回答邻居的问题。模型目前还没学会这种"选择性倾听"的本领。
另一个有意思的细节出现在Gemini-3-Pro身上。在情境感知回应任务里,这个模型用纯音频输入反而得分更高。原因不是理解力变强了,而是格式问题:有视频输入的时候,模型习惯输出"时间戳加线索描述"这种偏工程化的格式,被评分规则判定为不够像自然对话;没有视频、只有音频时,模型说话方式变得更口语化,反而更符合评分标准里"贴近真人说话"的要求。这个小插曲提醒我们,有时候模型表现的差异,未必是理解能力的差异,可能只是输出习惯的差异。
裁判也会分裂吗
评测用开放式问答而不是选择题,这本身就带来一个新麻烦:谁来给这些开放式回答打分?团队用大语言模型当裁判,但不同的裁判模型会不会给出差异很大的分数?
团队找了三个裁判模型(GPT-5、GLM-5、DeepSeek-v3.2),让它们用同一套评分标准给四个候选模型的回答打分,然后计算裁判两两之间打分结果的相关系数。结果所有相关系数都在0.75以上,说明不同裁判模型的判断高度一致,不管换哪个裁判,谁强谁弱的排名结论基本不变。这算是给整套评测方法上了一道保险,证明打分结果不是某个特定裁判模型的偏好在作怪,而是真实反映了候选模型的水平差异。
多轮对话是不是天生更难
还有一个问题团队也没放过:多轮交互测试是不是比单轮测试天然更难,因为前面轮次答错了,后面轮次会跟着错,形成连锁反应?
为了验证这一点,团队设计了个"教师强制"实验。做法是在测试第N轮的时候,把前面N-1轮里模型自己给出的回答全部替换成标准答案,这样就切断了错误累积的路径,理论上应该能让后面轮次的成绩更干净地反映模型在当前这一轮的真实水平。
结果却出人意料:哪怕给了正确的历史对话记录,成绩提升并不明显。团队分析后发现,模型很快就学会模仿标准答案的简洁风格,回答变得更短了,但依然没能把这份"正确记忆"真正用来分析当前视频画面。换句话说,问题不在于"记错了前面说的话",而在于模型压根没学会怎么把历史信息和当下的视觉输入结合起来。这个发现比表面看起来更值得琢磨,它意味着长上下文记忆能力的欠缺,不只是"记不住"这么简单,更深层的问题是"记住了也不知道怎么用"。
写在后面
读完这篇论文,最让我停下来想了很久的是那个"主动式响应"实验里的反直觉结果:去掉音频反而让模型表现更好。这个细节比论文正文里罗列的一堆百分之几十几的分数更有冲击力,因为它说明了一件事,给模型喂更多信息,不一定就等于给它更多帮助。有时候噪声本身就是干扰,多出来的那部分声音信号,反而在教模型学会"分心"。
这让我联想到人类专注力研究里一个类似的现象:嘈杂环境下,人的注意力资源是被分散消耗的,不是被"增强"的。AI助手在这一点上,可能比我们想象中更像人,它也需要学会主动过滤掉那些技术上存在、但语义上无关的信息。
另一个让我印象深刻的地方是,这篇论文没有满足于告诉我们"模型不够聪明",而是花了极大的力气去精确定位"模型不聪明在哪个具体环节"。手势跟不上、记忆撑不住、不会憋话、多任务混淆,这四个诊断结果分得非常清楚,每一个背后都对应着一个具体的、可能可以针对性解决的技术方向。这比笼统地说"通用能力还不够"要有用得多,就像医生给病人开出四项具体的化验单,而不是只说一句"你身体不太好"。
真正的助手,是那种知道什么时候该闭嘴的助手。这句话说出来简单,但要让机器做到,可能比让它多说对一句话难得多。
Q&A
Q1:OmniAssistBench是什么?
A:OmniAssistBench是由南京大学等机构联合推出的评测基准,专门用来考核全模态大模型作为实时视频助手的表现,重点测试模型在多轮持续互动中理解用户目标、给出正确指导的能力,而不是传统的静态视频问答。
Q2:目前最强的AI模型在OmniAssistBench上表现如何?
A:商业模型Gemini-3-Pro得分66.4分(满分100分),开源模型中表现最好的是Qwen3-Omni-Instruct,得分51.2分,说明当前主流模型距离成为可靠助手还有很大差距。
Q3:AI助手在实际测试中主要暴露了哪些短板?
A:主要有四方面问题:跟不上手势等非语音指令、长视频场景下记忆容量不够、不会判断何时该主动开口回应、以及在多任务并行时容易把不同任务的信息搞混。