无人机会飞,但它知道自己什么时候该停下来吗?

想象一下这个场景:你派了一架无人机去找一辆白色轿车,它顺利地飞过去了,摄像头里那辆车越来越大、越来越清晰,眼看就要到跟前了。结果呢,它突然一头撞了上去,或者更诡异的是,它明明已经贴着车门悬停了,却死活不肯告诉你"我到了",就那么杵在那儿,直到系统超时报废这次任务。

这不是段子,这是韩国NAVER Cloud团队在最新研究里实打实测出来的现象。而且更让人意外的是,出问题的往往不是那些又贵又强的顶级AI模型,反而是一些体积小巧、本该更"实在"的开源小模型。这篇论文的名字叫《DroneCATS》,光看名字你可能猜不出它在讲什么,其实它是Commanding(指挥)、Approaching(接近)、Tracking(追踪)、Searching(搜索)四个词的缩写,凑成了一只"猫"。研究团队用这只"猫"当尺子,量出了一个所有人都没太在意的问题:让大语言模型直接开无人机,到底行不行?

先搞清楚,这件事到底难在哪

多模态大语言模型

:简称MLLM,就是那些既能看图又能读文字、还能对话的AI模型,比如GPT-5、Gemini这些都属于这一类。

这些年MLLM在"看懂"图片和视频这件事上已经练得很强了,给它一张照片,它能告诉你照片里有什么、发生了什么。但"看懂"和"行动"完全是两码事。你让它看一段视频描述剧情,它说错了大不了重新组织语言;但你让它开无人机,它选错一个方向,无人机就真的飞歪了,而且下一步的判断还得建立在这个歪了的画面基础上,错误会像滚雪球一样越滚越大。这就是所谓的具身智能问题:感知之外,还得会做决定,而且做完决定要为这个决定的后果负责。

在这篇论文出现之前,业内已经有几套用AI开无人机的系统了,但研究团队发现了一个耐人寻味的共同点:这些系统都在悄悄"收权"。

比如TypeFly这套系统,让语言模型当规划者,具体的目标识别交给外部的检测器去干;PIVOT这个方案更进一步,直接把控制简化成"从图上画好的几个候选点里选一个",跟做选择题差不多;See, Point, Fly(简称SPF)把无人机的操控简化成"在图上点一个点";到了Fly0这套系统,AI模型干脆只负责语义理解,飞行轨迹全部交给激光雷达规划器;OnFly更绝,专门加了一个"验证员",AI模型给出的每一个动作都要先经过审核才能送到马达那里执行。

这些系统各自都说自己效果不错,但研究团队敏锐地察觉到一个悖论:如果你不断从模型手里拿走决策权,那你测出来的"模型能力",其实早就不是模型的真实能力了。就好比你想知道一个刚拿到驾照的新手司机开车水平如何,结果你在旁边装了个方向盘锁死装置,新手只能负责踩油门,方向全靠你控制,那你测出来的能开多快多稳,其实测的是那个锁死装置有多好用,跟新手本身的驾驶技术关系不大。

Fly0这篇论文自己也无意中验证了这个悖论:当它把模型的职责压缩到只剩"语义定位"这一件事时,测试结果显示GPT-5、Gemini 3 Pro、Claude 3.7 Sonnet、Qwen2.5-VL-32B这几个天差地别的模型,成功率居然全都挤在70.4%到71.5%这一小段区间里,甚至一个只有3B参数的小模型,跟最强的模型也就差不到6个百分点。

这个结果乍一看挺唬人的,"哇,模型大小根本不重要"。但研究团队反过来一想:如果剩下要做的事情本来就简单到所有模型都能干好,那这个测试当然测不出差距。真正决定生死的能力,恰恰是被这些系统提前"外包"出去、没有被测到的那部分。

DroneCATS-Agent:把决定权还给模型

基于这个洞察,研究团队做了一件挺"反潮流"的事:他们没有继续给模型减负,反而给模型加了三项新权力。

整套系统叫DroneCATS-Agent,核心设计是一个只有四个动作的指令集,而且这四个动作全部写在给模型的文字提示里,不需要额外训练模型、也不需要写死的函数调用接口。这意味着理论上任何一个能读懂文字提示的AI模型,插进这套系统里就能直接开无人机,不需要为它单独做适配。

这四个动作分别是go(朝一个点飞过去)、rotate(原地转向,用来搜索画面外的目标)、think(暂停悬停,花一步时间专门思考)、finished(宣布自己已经到达目标)。

前三个动作里,go这个动作继承自SPF那篇论文的思路:模型在画面上点一个像素点,再给一个大概的距离估计,系统会把这个"点+距离"的组合换算成三维空间里的一个位移指令,交给无人机去执行。这里有个细节值得说一下,模型给出的这个"距离"其实是它自己凭视觉经验估的,无人机身上并没有装真正的激光测距仪去核实这个数字对不对,所以论文里把这个深度值定性为"步长建议"而不是"精确的物理测量"。

rotate这个动作解决了一个此前系统完全没考虑过的问题:如果目标压根不在画面里,模型怎么点它?答案是先转个身找。没有这个动作,"目标不在初始画面里"这整整一半的任务类型根本无从下手,你连目标在哪个方向都不知道,谈何靠近它。

think这个动作是给模型的"暂停键"。这里有个很实际的考量:无人机在天上飞的时候,模型如果一边思考一边继续往前冲,很危险,世界还在变化,但token还在一个字一个字往外蹦。所以系统默认关闭深度思考模式,只有当模型上一步选择了think,系统才会为下一次调用打开更长的推理预算。换句话说,模型不是"现在想一想再决定",而是"申请下一步给我更多脑力"。

最关键的是第四个动作,finished。以前那些系统里,"无人机是不是到了"这件事从来不是模型说了算的,系统会预先设定一个距离阈值,只要无人机进入这个范围,程序自动判定任务完成,模型自己压根看不到这个阈值。而在DroneCATS-Agent里,finished只是模型提交的一个声明,系统会记下这个声明,但不会立刻停止飞行,而是让飞行继续,事后再由一个独立的"裁判"去核实:你说到了,是不是真的到了?

这个设计背后有一层更深的用意。研究团队认为,真正的自主性,不是"你告诉我一个门槛,我判断自己有没有过线",而是"我自己得知道我什么时候完成了任务,并且我能说出来"。这听起来有点抽象,换个说法就清楚了:如果一架无人机连自己有没有完成任务都说不明白,那它就没法向别人汇报"我搞定了",而一个连汇报都做不到的执行者,是没法被交办任务、组成团队的。这也是论文后面测试"指挥多架无人机"这个场景的理论基础,一个指挥官要调度四架无人机,每架无人机得自己判断并汇报"我找到目标了",指挥官才能知道任务有没有完成。

这套动作体系之下,再往下走的每一步都是固定的、不涉及模型判断的机械流程:一个基于几何规则的控制器把模型选中的像素点和深度值转换成具体的速度指令,飞控系统的标准控制回路再把这个速度指令转成螺旋桨的实际转速。研究团队把这一层比作机械臂领域的"逆运动学求解器":模型负责做任务层面的判断,剩下所有的几何计算和硬件执行都是固定不变的,跟机械臂领域"上层做决策、下层管执行"的分工模式如出一辙。

一把尺子量到底:DroneCATS基准怎么测

有了这套能自主决策的无人机系统,接下来的问题是怎么设计一套公平的考试,让不同的模型放到同一套标准下比较。

研究团队设计了两个维度的变化轴。第一个轴是任务类型,由两个二元变量交叉组成:目标是不是会动、目标在初始画面里是不是看得见。四种组合对应四种任务:目标静止且可见时是"接近"(Approaching);目标静止但一开始看不见,需要先搜索再接近,叫"搜索"(Searching);目标移动但一开始可见,需要边追边跟,叫"追踪"(Tracking);目标又会动又看不见,先搜索再追踪,叫"搜索并追踪"(Search-and-Track)。

第二个轴是组织形式,一台无人机单打独斗,还是一个AI大脑同时指挥四台无人机组成编队,后者叫"指挥"(Commanding)。

判断成功与否的标准只有一条,全场统一:只要在无人机说"我到了"的这些声明里,有任意一次是在目标真实可见、且距离目标中心不超过5米的情况下发出的,这次任务就算成功。这个标准背后藏着几个很讲究的细节。

首先,飞过目标附近不算数。研究团队统计发现,在所有从未宣布到达的失败任务里,有61次(占337次的比例不小)其实无人机的轨迹确实进入过5米范围,但因为模型没有开口宣布,这些全部算失败。如果换成"只要进过这个范围就算成功"这种更宽松的标准,182次成功会直接虚高三分之一。这就好比考试规定必须交卷才算数,你脑子里想出了正确答案但没写在卷子上,老师是不会给分的。

其次,系统会记录整个任务过程中所有的宣布声明,而不是只看最后一次。这么做是为了避免冤枉两种情况:一种是无人机明明已经进入5米范围,但那一瞬间目标恰好被遮挡没被检测到;另一种是无人机说完"到了"之后又飘了几秒才真正进入范围。这两种情况如果只看某一个时间点的状态,都容易被误判。

谁来考试:四种能力,九个模型

研究团队请来了九位"选手"参加这场考试,涵盖了从顶级商用模型到边缘小模型的整个光谱。

frontier模型

:指目前技术最前沿、能力最强的一类大模型,通常参数规模巨大、需要通过云端API调用。

选手阵容里,frontier这一档有四位:GPT-5、Claude Opus 5、Gemini 3.7 Flash,还有一个专门针对具身智能场景优化过的Gemini Robotics-ER 2。开源阵营则是Qwen3.5家族,从27B一路缩到2B,形成一条参数量的阶梯,专门用来观察"模型变小之后,能力是怎么垮掉的"。最后还有一个叫Cosmos3-Edge的2B模型,它是专门为"物理世界的AI推理"打造的,算是选手里唯一一个带着"具身智能专精"标签出场的小个子。

考试场地设在AirSim这个基于虚幻引擎搭建的无人机仿真平台上,一共准备了两张地图:一个居民区、一个大学校园,外加两张用于"指挥编队"任务的地图。单机任务总共80个场景(每种任务类型20个,两张地图各10个),编队任务再加20个场景,全部加起来一共100个考题。

考试结果:谁在飞,谁在装到了

先说最基本的结论:最简单的那道题,居然没人能满分通过。

在"目标一开始就看得见,只管飞过去"这个理论上最简单的任务类型里,表现最好的模型(Gemini 3.7 Flash)也只拿到了65%的成功率,也就是20次里成功13次。而一旦把目标从初始画面里藏起来,让无人机得先自己转身找,所有模型的成绩都跌破了40%。

更有意思的是模型排名在不同任务之间完全对不上号。GPT-5在"接近静止目标"这项上跟Gemini 3.7 Flash只差一个场景(60%对65%),差距很小;可一旦目标动起来,GPT-5的"追踪"成功率骤降到只有15%,而Gemini 3.7 Flash却能达到80%。这说明"会飞到一个静止的点"和"能一直咬住一个移动的点",完全是两种不同的能力,不能互相代表。

专门为具身场景优化过的Gemini Robotics-ER 2,四项任务平均成绩是47.5%,反而不如它那个通用款的兄弟Gemini 3.7 Flash(57.5%)。而Qwen开源家族随参数量下降呈现出一条清晰的下滑曲线:27B拿到33.8%,9B降到21.3%,4B只剩12.5%,2B干脆是0%。

0%听起来很惨,但真正让研究团队愣住的,是接下来这组数据。

会飞,但不会说"我到了"

论文用一张图把"接近"这项任务拆成了三层:无人机有多少次真的飞进了5米范围之内、模型有多少次宣布了"到达"、这两者同时满足的比例有多高。

对frontier模型来说,这三个数字基本上是同步涨跌的,这是符合直觉的模式:如果导航能力是瓶颈,那飞得进去的次数和最终成功的次数应该差不多。比如GPT-5飞进5米范围的次数占65%,最终转化成成功的是60%,两者相差不大。

但小模型的表现完全不是这么回事。Qwen3.5-9B是这里最扎眼的案例:它飞进5米范围内的比例高达90%,比场上任何一个frontier模型都高,可最终只有35%转化成了成功。它宣布到达时,平均只走完了从起点到目标全程距离的63%,也就是说,路还剩三分之一没走完,它就已经开口说"我到了"。

Qwen3.5-2B走的是另一个极端。它宣布到达时的位置,平均是起点到目标距离的1.28倍,这个数字意味着什么?意味着它有时候压根就没往目标方向前进,甚至可能是往反方向飘了一点,然后就说"到了"。这个模型全场颗粒无收,一次成功都没有。

Cosmos3-Edge这个专门针对具身智能优化的2B模型情况又不一样:它确实会飞,能进入5米范围的比例达到25%,路程平均走完了一半,但整个测试过程中,它一次"finished"都没有说过。它像一个永远不肯举手交卷的学生,哪怕已经写完了答案。

图9里有个具体的例子特别能说明问题:同样一段从16.1米外出发去接近目标的路程,Gemini 3.7 Flash飞到还剩2.8米的时候宣布到达,随后稳稳悬停;Qwen3.5-2B走的路线几乎一模一样,甚至一度比对方更靠近目标(只剩2.53米),结果它一句"到了"都没说,就那么带着无人机一直悬在原地耗到了系统强制超时。

这两台无人机走的路径几乎重叠,飞行能力看不出明显差距,唯一的区别是一个懂得在恰当的时候开口,另一个不懂。

这就是这篇论文最核心的发现:不是模型不会飞,是模型不懂什么时候该说"我到了"这句话。

研究团队把这个现象叫做协议遵守问题,而不是导航问题。之前那些把终止判断外包给系统阈值的方案,恰恰把这个真正的能力短板给掩盖掉了,你永远看不出一个模型是不是"心里没数",因为系统压根不给它开口的机会。

这里有个很生活化的类比:想象你雇了两个送快递的人,一个每次到了地址门口都会打电话给你确认"包裹已送达",另一个技术上也确实能准确找到每一户地址,但他从来不打这通确认电话,有时候是懒得打,有时候是明明还没走到楼下就打了。如果你的考核标准只看"有没有走到正确的楼栋",两个人看起来差不多;但如果你的考核标准是"客户有没有真的收到货、有没有被准确告知",那第二个人的问题就会彻底暴露出来。DroneCATS的评分机制做的正是后一件事,它逼着"什么时候该说完成"这件事必须由AI自己扛起来,而不是让系统替它兜底。

指挥四架无人机:分工还是抱团

单机测试之外,论文还设计了一个更硬核的场景:让同一个AI大脑,一次性同时指挥四架无人机。

考题的设计很巧妙:场景里放置了好几个长得几乎一模一样的目标物,比如居民区地图上放了好几辆同款车,只有车牌号不同;Blocks地图上放了好几块牌子,只有上面写的字不同。这些细节只有靠近了才能看清楚,光靠一开始的远景根本分不出谁是谁。指令里明确点名要找哪一个(比如"找车牌号是4017的蓝色轿车"),但没有一架无人机能仅凭起始位置就判断出哪辆车是目标。

这时候,"编队"存在的意义就体现出来了:四架无人机如果能分头去查看不同的候选目标,效率显然比一架无人机一个个排查要高得多。这个设定测的其实是一种更高层的协作智慧,你能不能在一次回复里,针对四张不同的画面,给出四个不同的、各自合理的指令。

结果再一次颠覆了单机测试建立起来的印象。GPT-5在单机接近任务里表现还算不错(60%),但一到指挥四机的场景,成功率骤降到20%;Claude Opus 5单机能拿35%,编队任务里直接归零。反倒是Gemini 3.7 Flash,从单机的65%逆势涨到了编队任务的80%。

小模型在这个场景里暴露出了一种此前完全没见过的新型错误:直接把同一句话复制粘贴四遍。研究团队统计发现,Qwen3.5-9B在需要给四架无人机各自下达"飞行"指令的时候,有70%的情况是给四架无人机发出完全相同的像素坐标和相同的距离数值,同一个答案,硬塞进四张完全不同的画面里。Qwen3.5-27B也有58%的比例犯同样的错误。

论文里附了一张具体的对比图:同一个场景,Gemini 3.7 Flash给四架无人机分别指向了四辆不同的候选车,77秒之后成功锁定正确目标;而Qwen3.5-27B给四架无人机全都发出了一模一样的坐标(448, 357)、一样的12米距离,结果三架无人机全都挤在了同一辆错误的车旁边,整场任务里模型发出了114次"到达"声明,全部因为距离不达标被驳回。

这个失误特别值得琢磨。这四张画面里,同一个坐标点在有的视角里对应着一辆远处的车,在另一个视角里却对应着一堵房子的墙。模型显然没有真正意识到"这是四个不同的视角",它更像是把这四张图糊在一起当成了同一张图来处理,然后随便挑了个看起来还行的点,套用到所有画面上。

这就好比让四个侦探同时去四个不同的现场找线索,结果有个侦探直接把同一份报告复印了四份交上去,内容一个字都没改,可四个现场根本不是一回事。指挥编队考验的不是"能不能看懂一张图",而是"能不能同时把握住四张图各自独立的信息,并且不把它们混为一谈"。而这恰恰是那些小模型翻车的地方。

深思模式管不管用:一个尚无定论的问题

论文里还专门做了一次关于think动作的分析,结果挺出人意料的。研究团队原本设想,给模型一个"专门停下来想一想"的机会,应该能帮它在迷茫的时候做出更好的判断。

实际测下来,这个功能整体上没能带来明显提升。统计显示,think之后紧跟的三步,每一步只比不用think时多推进了0.03米,几乎可以忽略不计;用think去打破"原地打转"这种卡壳状态的成功率是1/230,反而比什么都不做、直接执行普通动作的成功率(103/8401)还要低;目标不在画面里的时候,用了think之后三步内重新找到目标的比例是13.5%,跟不用think的13.4%基本没差别。

更耐人寻味的是,在服务这些模型的时候,深度推理功能其实是默认关闭的,即便模型选择了think,746次真正触发了深度推理的回复里,也只有3次真的写出了什么像样的推理文字,大部分时候,模型给出的回复就是干巴巴的一行代码:{"action":"think"}。这意味着think这个动作买到的,可能根本不是"更深的思考",而只是"一次不受约束的转身",或者对Gemini这种模型来说,是一个"非零的思考预算"而已,实际有没有用上,另说。

论文里举了两个对比鲜明的案例:一次是Qwen3.5-9B,先前迷失方向、逐渐飘到15米外,用了一次think之后重新读懂了场景、转身找回目标,最终飞到只剩2米,这次think确实救了场。另一次是Qwen3.5-4B,被要求跟着一辆四驱车,连续用了五次think,其中四次给出的回复都是那句光秃秃的{"action":"think"},第五次转了个90度的身,结果转完之后瞄准的是6.6米开外的一棵树,再也没有宣布到达。

研究团队没有把这个结果包装成一个明确的正面或负面结论,而是坦诚地留了一个开放问题:面对一个物理世界里、每一秒钟世界都在继续变化的具身智能体,深度思考到底应该长什么样?这个问题目前的静态问答领域已经研究了很多,但搬到"边想边动"的场景里,答案还远没有清楚。

写在后面

读完这篇论文,最让我意外的不是哪个模型分数高,而是这种"能力被系统悄悄拿走却没人察觉"的现象本身。

之前那些无人机AI系统的论文,读起来都挺让人信服的:成功率从26.4%提到67.8%,数字漂亮,逻辑自洽。但DroneCATS这篇论文提醒我们一件容易被忽略的事:一个系统测出来的高分,可能测的是系统设计得好,而不是被测的那个AI模型有多聪明。这跟"考试出得太简单,所有学生都考满分"是同一种陷阱,你以为在选拔人才,其实只是在验证考卷本身没有区分度。

论文里那个"飞到目标旁边却死活不说到了"的Cosmos3-Edge-2B让我印象很深。它明明具备一定的物理世界推理专长,却在最基础的"完成任务后开口汇报"这件事上完全卡壳。这提醒我,一个AI系统"专精某个领域"和"能不能把这个专精用在正确的时刻表达出来",是两件独立的事,前者强不代表后者也强。

论文最后提出的下一步方向也挺实在:如果真正卡住模型的是这套动作协议本身,而不是导航能力,那或许该考虑把这套动作空间从"写在提示词里"变成"训练进模型权重里",用这些同样的场景收集数据、专门训练。这个思路听起来简单,但值得追问的是:如果训练出来的模型依然在类似场景下"忘记宣布完成",那说明这个问题可能不是训练数据不够,而是更底层的、关于"如何让模型对自身状态保持持续追踪"的难题。

一架无人机能不能准确飞到目标旁边,这件事我们已经解决得差不多了。但一架无人机能不能诚实、准确、及时地告诉你"我做完了",这件事,现在看来,比想象中难得多。

Q&A

Q1:DroneCATS是什么?

A:DroneCATS是NAVER Cloud团队提出的一套无人机AI基准测试,全称对应指挥(Commanding)、接近(Approaching)、追踪(Tracking)、搜索(Searching)四项能力,用于评测多模态大语言模型直接控制无人机的真实表现。

Q2:为什么小型开源模型反而比顶级模型更容易失败?

A:测试发现,小模型(如Qwen3.5-2B)往往能成功飞到目标附近,但常常在该宣布"到达"的时候不说,或者过早、错误地宣布到达,问题出在协议遵守能力上,而不是飞行导航能力上。

Q3:DroneCATS-Agent和以往的无人机AI系统有什么不同?

A:以往系统通常把"何时到达"这类关键决策外包给系统预设的距离阈值,模型看不到这个阈值;DroneCATS-Agent把搜索、深思、宣布到达这三项决策全部交还给模型自己完成,且全部通过文字提示实现,不需要额外训练。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询