CVPR'26 运动图灵测试:首个人形机器人运动评估基准
CVPR'26 录用首个人形机器人运动图灵测试(Motion Turing Test)基准。
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
我们总在科技展、短视频里惊叹机器人跳舞、跑酷、打拳的 “人形化突破”,可实验室的冰冷数据却狠狠戳破了这个视觉骗局。那些看似惊艳的动作,不过是代码堆砌的精准,从未触碰到 “人类运动” 的核心。这不科学,对吧?
你以为机器人缺的是更精密的关节、更流畅的算法,可论文里的实验把所有外在变量都抹除了 —— 用 SMPL-X 模型扒掉人类和机器人的 “外表皮”,去掉金属外壳、皮肤五官,只留下纯粹的骨骼运动轨迹。

在这个极致公平的 “动作裸考” 里,机器人的真实水平暴露无遗:走路、站立这类平缓动作,得分勉强够到人类的一半多;而跳跃、拳击这类动态动作,机器人得分连人类的三成都不到,拳击的分差更是达到 2.53,跳跃的分差直接突破 3.23。

读到图5的评分分布时,我们对 “人形化” 的理解,感觉从一开始就错了。我们总在追求机器人 “长得像人、做得像人”,却忽略了:人类的动作,从来不是精准的坐标轨迹,而是带着生命温度的动态平衡。
从图灵测试到运动图灵测试:我们到底在考机器人什么?
图灵测试的核心是“无法区分”,而这篇论文把这个逻辑落到了人形机器人的运动上,提出了运动图灵测试(Motion Turing Test)——如果人类评估者仅通过运动的运动学信息,无法区分一段动作来自人类还是人形机器人,那这个机器人的运动就算通过了测试。

这个设计最戳我的点,是它做了一个“去表象”的关键操作:把所有人类和机器人的视频,都转换成了SMPL-X模型的姿态序列。简单说,就是去掉了机器人的金属外壳、人类的外貌衣着,只留下纯粹的“骨骼运动轨迹”。就像我们看一个人模仿机器人,不会因为他穿了机器人的道具服就觉得“像”,真正让我们判断的,是他动作的僵硬感、节奏感、肢体协调性——这正是论文抓住的核心:运动的本质,从来不是外观,而是连续的、有逻辑的肢体运动本身。
这让我想到了哲学里的“本质与表象”之争,赫拉克利特说“人不能两次踏进同一条河流”,放在运动里同样成立:人类的动作从来不是孤立的“姿势拼接”,而是有时间延续、空间协调的整体,机器人的运动之所以“假”,往往不是某个姿势不对,而是打破了这份连续性。而运动图灵测试的价值,就是把评估的焦点从“机器人长得像人”拉回了“机器人动得像人”——这才是人形机器人落地的核心,毕竟我们需要的是能和人类自然互动的机器人,而非一个精致的“人形摆件”。

研究者为了这个测试,打造了HHMotion数据集,1000个运动序列、15类动作、11个人形机器人模型、10个人类受试者,还有30位标注者耗时超500小时的0-5分类人度打分。这份数据集的特别之处在于,它是首个为运动类人度打分的数据集,在此之前,所有的运动数据集要么只关注人类,要么只关注机器人,从未做过如此直接的“人机对比”。

1000个动作序列里的真相:机器人的“动作偏科”太严重了
看完数据集的打分分析,我最大的感受是:人形机器人的运动能力,活脱脱一个“严重偏科的学生”——静态、慢节奏的动作能考个“及格分”,动态、高频率的动作直接“挂科”。

研究者统计了人类和真实机器人在15类动作中的类人度分差,最悬殊的三个动作是跳跃(分差3.23)、拳击(2.53)、跑步(2.26);而差距最小的是舞蹈(1.21)、行走(1.31)、站立(1.83)。更有意思的是,仿真环境里的机器人动作,类人度明显比现实中的机器人高——这说明机器人的硬件物理限制,依然是运动类人度的最大瓶颈。
为什么动态动作成了机器人的“死穴”?答案藏在人类运动的本质里。人类的跳跃、拳击这类动作,需要高频的肢体协调、快速的关节切换,还有身体本能的平衡控制:跳跃时的蹬地、腾空、落地,拳击时的出拳、收拳、身体重心跟随,每一个环节都不是单独的动作,而是全身的联动,且充满了细微的、自然的调整。而机器人的动态动作,往往是“机械的精准复刻”,缺乏这份细微的调整,动作僵硬、节奏断裂,哪怕姿势上和人类相差无几,人类的大脑也能瞬间捕捉到这份“不自然”。
这背后其实是心理学里的“生物运动知觉”——人类的大脑进化出了对同类运动的高度敏感,哪怕是在黑暗中看到几个光点组成的人体运动轨迹,我们也能立刻判断出这是人类,以及他在做什么动作。这份敏感,让我们对机器人的“不自然”动作格外挑剔,也让动态动作的类人度提升,成了人形机器人的最大挑战。
研究者还做了一个很有意思的实验:让人类刻意模仿机器人的运动模式。结果发现,这类刻意模仿的动作,类人度打分和机器人的动作打分出现了重叠——这说明当人类放弃了自然的运动节奏,刻意变得“机械”时,运动的“人机边界”就模糊了。这也印证了一个观点:机器人的类人度,从来不是“姿势和人类一样”,而是“运动的节奏、协调和人类一样自然”。
大模型的败北与小网络的胜利:专业的事,终究要交给专业的模型
这篇论文最颠覆我固有认知的部分,是多模态大模型的“滑铁卢”和小众专用网络的“大获全胜”。
在此之前,我和很多人一样,觉得多模态大模型是“万能解”,能处理图文、能做推理、能理解视频,评估机器人的动作类人度应该不在话下。但论文的实验结果给了一记现实的耳光:无论是Gemini 2.5 Pro还是Qwen3-vl-plus,哪怕研究者为它们设计了5种不同的提示策略——从直接评估到上下文引导,再到姿势感知的思维链推理,它们的表现都惨不忍睹:Gemini的平均绝对误差(MAE)最低1.26,Qwen更是达到了1.77,而PTR-Net的MAE只有0.58。

为什么大模型会栽在这个看似简单的任务上?核心原因在于大模型的核心能力是“语义理解”,而非“细粒度的运动特征捕捉”。多模态大模型看视频,关注的是“画面里是什么动作”,而不是“这个动作的关节运动是否流畅、重心是否稳定、节奏是否自然”;而机器人运动类人度的评估,恰恰需要捕捉这些细粒度的、连续的运动特征——这是大模型的短板,却是PTR-Net的长板。

PTR-Net的设计其实并不复杂,就是三个核心模块的组合:双向LSTM时间编码器,捕捉运动的长时时间依赖;时空图卷积(ST-GCN),把人体骨骼当成一个图,提取关节之间的空间协调特征;还有注意力池化,聚焦运动中最关键的片段,最后通过一个回归头输出0-5的类人度分数。研究者把类人度评估做成了一个定量回归任务,让模型精准学习人类标注的打分规律,而不是简单的“人机二分类”——这个设计,恰恰切中了类人度评估的核心:它不是非黑即白的判断,而是程度的衡量。
这个结果也给了行业一个重要的启示:大模型的“通用能力”并不能替代专业模型的“专精能力”。就像一个全能的学霸,能考好语文数学英语,但在钢琴考级、体育专项上,未必比得上专精的特长生。人工智能的发展,从来不是“大模型通吃一切”,而是“通用大模型+专用小模型”的协同——大模型负责全局的语义理解和决策,专用小模型负责细分领域的细粒度任务,这才是更高效的技术路径。
在读这部分实验结果时,还忍不住感慨:研究者没有盲目跟风做大模型,而是沉下心来针对具体问题设计专用模型,这份理性,在当下的AI研究中格外珍贵。
运动图灵测试的背后:人形机器人的类人,是神似而非形似
这篇论文的价值,远不止提出了一个测试框架、打造了一个数据集、设计了一个专用模型,更重要的是,它让我们重新思考:人形机器人的“类人”,到底是什么?

在机器人研究的早期,我们总执着于“形似”——让机器人有人类的外形、有和人类一样的关节数量、能复刻人类的单个姿势。但运动图灵测试告诉我们,“形似”只是基础,“神似”才是关键。人类的运动,从来不是“预设的程序指令”,而是身体、大脑、环境相互作用的结果:我们走路时会根据路面情况调整步幅,伸手时会根据物体位置调整角度,这份适应性和自然性,是机器人目前最缺乏的。

就像中国书法里的“形似与神似”,王羲之写字,从来不是简单的笔画复刻,而是“意在笔先”,笔画的轻重、缓急、连断,都藏着书写者的意图和情绪。机器人的运动,现在就停留在“描红”的阶段,能把笔画描得一模一样,却没有笔画背后的“意”——没有运动的意图,没有身体的本能反馈,没有对环境的适应性,这样的动作,再精准也只是“机械的复刻”,永远少了一份人类的“自然”。

研究者在论文中还提到,PTR-Net不仅能评估运动的类人度,还能作为强化学习的奖励模型,优化机器人的运动生成——这让运动图灵测试从一个“评估工具”,变成了一个“优化标尺”。未来的人形机器人运动生成,会以人类的自然运动为目标,通过PTR-Net的打分,不断调整运动参数,让机器人的动作从“形似”向“神似”靠近。
不止是技术,更是对“人类本质”的一次追问
合上书稿,我突然觉得,这场为机器人设计的运动图灵测试,本质上是人类对自身的一次追问:我们的身体,为什么能做出如此自然、协调、适应性的动作?

我们从小就会走路、跑步、跳跃,从来不用刻意思考“该怎么动关节、该怎么调整重心”,这份与生俱来的能力,在我们看来稀松平常,却是目前最先进的人形机器人也难以复刻的。人类的运动,是亿万年进化的结果,是大脑、神经系统、肌肉骨骼的完美协同,是身体对环境的本能感知和反馈——这份能力,是真正的“人类智能”,比我们的逻辑推理、语言理解更基础,也更珍贵。
人形机器人的发展,看似是技术的迭代,实则是人类对自身的不断解构和理解。我们想让机器人动得像人,就必须先搞清楚:人类到底是怎么动的?我们的大脑是怎么控制身体的?我们的身体是怎么适应环境的?每一次机器人运动类人度的提升,都是我们对自身运动本质的一次更深的理解。

而运动图灵测试,就是这份理解的“标尺”。它告诉我们,人形机器人的未来,不是追求“更像人”的外形,而是追求“更自然”的运动;不是复刻人类的动作,而是理解人类运动的本质。当有一天,机器人的运动能通过运动图灵测试,人类评估者无法区分人机运动时,我们收获的,不仅是一个更智能的机器人,更是对自身的一次全新认知。
AI的发展,终究是为了让我们更了解自己。这,或许就是所有人工智能研究的终极意义。
参考资料
• 标题:迈向运动图灵测试:评估人形机器人的类人度(Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots)
• 作者:Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, JunshengZhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang
• 单位:厦门大学;OPPO研究院;上海科技大学
• 链接:https://arxiv.org/pdf/2603.06181
