会玩《among us》的AI,杀人时会不会心虚地回头看一眼

先说一件挺离奇的事。
研究者们让一群AI去玩《among us》(一款社交推理游戏,通常译作"太空狼人杀"),角色分工是几个"内鬼"假装成普通船员,暗中干掉其他人,剩下的船员要通过开会讨论找出内鬼。结果这些AI玩得相当投入。它们会在杀人前先扮演一个正在认真做任务的普通船员,杀人前还会回头看一眼有没有人在附近,杀完之后会假装若无其事地走开,甚至有的AI会主动跑去"报警",说自己刚刚发现了尸体,用这种方式把自己包装成第一个发现案情的无辜者。
这不是编的剧情,是真实的实验记录。而这篇论文想搞清楚的问题是:这些行为到底算不算AI在"说谎"?如果算,它们撒谎的方式和以前我们知道的AI撒谎,有什么不一样?
**过去研究AI撒谎,几乎全部盯着它说的话,没人管它做的事。**
这是这篇论文最先戳破的一个盲点。之前学界研究AI在社交推理游戏里的欺骗行为,用的都是纯文字版的游戏环境,AI只能靠打字聊天来撒谎,没有身体,没有动作,没有"看一眼周围有没有人"这种行为。可现实里,人类撒谎从来不只靠嘴。心理学早就发现,两三岁的小孩在还不会说完整谎话之前,就已经学会了藏东西、故意留假线索这种"动作上的撒谎"。机器人研究里也有实验证明,一个机器人用动作作弊,比它用语言作弊,更容易让人觉得它"是故意的"。
换句话说,如果只研究AI嘴上怎么撒谎,等于只看了冰山露出水面的那一角。这篇论文的作者们觉得,得把AI放进一个既能说话又能行动的环境里,才能看到完整的欺骗行为。
于是他们造了一个叫**MineAmongUs**的东西。
> MineAmongUs:论文自己搭建的一个3D多模态实验场,把经典的《among us》游戏规则搬进了Minecraft(我的世界)里,让AI角色(用视觉语言模型驱动)真的用第一人称视角看世界、走路、攻击、开会讨论、投票。
为什么非得搬进Minecraft这种3D游戏世界?因为只有这样,AI才有"身体",它才需要真的转过头去看看背后有没有人,真的需要靠近某个目标才能动手,真的要在杀人之后决定往哪个方向逃跑。这些动作本身就是一种表达,就像一个人做贼心虚地左右看一眼,这个动作已经把"心虚"这件事说出来了,根本不需要开口。
如果不搭这套3D环境会怎样?之前的文字版游戏里,AI的"非语言欺骗"这个维度是完全被阉割掉的,研究者只能看到聊天记录,看不到它藏在暗处的行动。这就好比只听一个人打电话,永远判断不出他脱下手套有没有戴戒指去偷东西。
让AI玩游戏也要讲究"公平的对照实验"
光有一个好玩的3D游戏世界还不够。论文作者们发现了第二个大问题:以前的研究几乎都是固定死一套AI的"配置",就直接下场比赛,看输赢,然后得出结论说这个模型更擅长骗人。
这就像你想知道到底是运动员天赋决定比赛输赢,还是教练的战术决定输赢,结果只找了一个运动员、一套固定战术,比赛一场,然后就说这个运动员天赋异禀。这个结论根本站不住脚,因为你压根没排除掉战术这个变量。
论文提出了一套叫**ARIA**的可配置AI代理框架来解决这个问题。
> ARIA(Ablation-Ready Imposter/crewmate Agent):一个专门为做对照实验设计的AI"大脑"框架,它把AI玩游戏时用到的五个认知模块(状态表示、记忆方式、规划方式、反思与技能积累、提示词风格)全部拆成独立可开关的旋钮,研究者可以单独调节某一个旋钮,看它对整体表现的影响。
这五个旋钮具体是什么,值得展开说说。
第一个旋钮叫"状态表示",简单说就是AI能"看到"多远、多全。论文设了两档:一档叫"第一人称视角",AI只能看见眼前视野里的东西,转身之后之前看到的信息就忘了;另一档叫"上帝视角",AI能拿到整张地图上所有玩家的最后已知位置,即便看不见人,也知道他大概在哪儿。
实验结果相当戏剧性。当内鬼被限制成纯第一人称视角时,杀人数直接归零,游戏彻底玩崩了。
**这说明当前的AI,连"记住刚才在哪个拐角看见过一个人"这种基本的空间记忆能力都还没稳定掌握。**
这个发现值得多说几句。它其实揭示了一个挺让人意外的短板:我们总以为大语言模型已经很聪明了,能写代码能推理,但让它扮演一个游戏角色,靠纯粹的视觉去追踪一个移动目标,它却经常"跟丢了"。这就好比让一个下棋高手去跳广场舞,脑子里的推理能力再强,身体协调这件事完全是另一套本事,没法直接迁移过去。
正因为这个短板太明显,研究者才决定后续所有正式实验都默认给AI开"上帝视角",这不是说身体感知不重要,而是现在的AI在这方面还没练出来,先把这个变量控制住,才能专心研究其他的行为模式。这算是这篇论文一个挺诚实的自我限制说明,作者没有回避这个问题,反而专门写了一节讨论"上帝视角"到底替代了什么、没替代什么,比如杀人前观察有没有目击者、发现尸体这些判断,仍然需要靠真实的画面来完成,不是靠文字坐标就能糊弄过去的。
第二个旋钮是记忆方式,分成"简单滑动窗口"(就记住最近几步发生的事)和"语义记忆"(专门用一个模型去追踪对每个玩家的怀疑程度,边玩边更新)。第三个旋钮是规划方式,分"每一步临时决定"和"先定长期战略再逐步执行"。第四个旋钮是反思机制,看AI开完会之后有没有能力总结经验、存进一个"技能库"里供以后参考。第五个旋钮是提示词风格,一种给足了详细的骗人战术范例,另一种什么都不教,只给游戏规则。
二十三种"骗术",被拆解成了一张清晰的清单
光看输赢结果太粗糙了,作者们还想知道AI具体是怎么骗人的,骗术能不能被归类、被量化。
于是两位研究者盯着48局完整的游戏录像,一步一步地看AI在每一步做了什么、说了什么,试图总结出一套标准化的"骗术分类表"。两个人各自独立总结,事后再对照合并,最后归纳出**23种具体的欺骗行为**,论文里叫它们"原子欺骗行为"。
这23种行为又被归到6个大类里,其中3类是"非语言欺骗"(发生在游戏里的行动阶段),另外3类是"语言欺骗"(发生在开会讨论阶段)。
非语言那边包括"伪装"(比如假装认真做任务,或者假装自己只是随便逛逛),"追杀"(跟踪目标、确认没有目击者再动手、杀完就跑),还有"报案时机的操纵"(比如故意不报告尸体好继续找机会杀人,或者反过来主动自报案好把自己包装成清白的发现者)。语言那边包括"编造事实"(伪造不在场证明、反咬一口、编造目击证词)、"打太极"(说话模糊不清、用"我知道你会怀疑但是"这种话先自我承认一部分好换取信任)、"隐瞒"(说话故意留一手,或者投票和发言不一致)。
> 阿蒙-伯根欺骗理论(IDT):一套专门分析语言欺骗的经典理论框架,把撒谎的方式分成三种,编造虚假信息、故意隐瞒真相、含糊其辞。这篇论文用它来给语言类的骗术分类。
为了让这套分类表能大规模用起来,人工一局局标注实在太慢,作者们训练了一个AI法官来自动打标签,这个AI法官叫**Qwen3.6-27B**。
> LLM-as-a-Judge:让一个AI模型来充当"裁判",自动判断某段游戏行为属于哪种欺骗类型,替代人工逐条标注,好处是能大规模扩展,问题是判断准不准。
判断准不准,作者们专门做了验证。他们让两个人类各自独立标注同一批游戏录像,算出两人之间的一致程度,这个数值叫Cohen's κ,是0.792。然后拿AI法官的标注结果去和人类比,一致程度是0.709。这两个数字挨得比较近,说明AI法官的判断水平已经接近人类专家之间的默契程度,不算完美但足够可靠,可以放心地拿去做大规模标注。
作者们还额外找了一个完全没参与过这个项目、不知道这套23种分类的博士生,让他自己重新看几局游戏,独立总结出一套自己的分类。结果他总结出的16个类别,跟论文的23种原子行为高度重合,其中8种一一对应,另外一部分是把几种细分行为合并成了更粗的大类。
**这说明这23种骗术不是研究者硬凑出来的分类框架,而是真实存在于游戏行为里的、旁人一眼也能看出来的模式。**
这就好比让两个完全不认识的语言学家,各自独立去总结某种方言的语法规律,如果两人总结出来的规律基本重合,那说明这套规律不是某个人主观脑补的,而是这门方言本身确实存在这个结构。
三大发现:偷懒杀人、执行拖延症、以及非语言比嘴皮子更管用
把游戏日志和骗术标签对照起来分析后,论文得出了几个挺有意思的结论。
第一个结论关于"什么样的行为最能带来胜利"。作者算了每一种骗术出现的频率和内鬼最终获胜的相关性,结果排名最靠前的四种,全部来自非语言类别:确认没有目击者再动手、杀完立刻逃离现场、故意不报告尸体、提前跟踪目标。这四个动作串联起来正好就是一整套"杀人流程",先跟踪,再确认安全,动手,然后跑。
反而是那种"打太极"和"隐瞒"类的语言技巧,跟胜率的关系几乎为零,有的甚至是轻微负相关。
**这说明在这个游戏里,光靠嘴皮子含糊其辞是没用的,真正决定胜负的是动手的时机和身体上的躲藏技巧。**
第二个结论更有实验设计的意味。研究者调整了ARIA框架里那五个旋钮,看哪种组合能让内鬼赢得更多。结果发现调"规划方式"这个旋钮时,出现了一个分歧:从"每步临时决定"换成"先定长期战略"之后,胜率提高了,但提高的方式不一样,这次不是靠杀人杀得更利索了,而是靠开会时编造更多复杂的假证词、假联盟。
换句话说,同样是提高胜率,不同的认知能力提升,走的是完全不同的路子,有的靠身手,有的靠嘴皮子。这就像两个学生同样考了高分,一个是靠平时刷题练出的手速,一个是靠临场编故事的口才,表面结果一样,内在机制截然不同。
第三个结论来自跨模型比较,研究者拿了12个不同的AI大模型,让它们两两对战,同时扮演内鬼和船员的角色。
结果发现,一个模型如果当内鬼表现出色,它当船员时通常也表现出色。
**这说明决定胜负的更多是模型本身的综合能力,而不是"这个模型天生擅长撒谎"或者"这个模型天生擅长识破谎言"这种角色专属技能。**
而在赢家和输家之间,区分度最大的一个行为叫"假装做任务",表现最好的三个模型平均每局要假装做任务12.64次,表现最差的三个模型只有1.91次,差了整整6.6倍。这也再次印证了前面的发现,非语言的伪装行为,比语言上的花言巧语,在这个游戏里更管用。
不过研究者也发现,赢家里面并不是只有一种打法。有的顶尖模型(比如Gemini-3系列)主要靠"假装做任务"这种非语言伪装取胜,另一个顶尖模型(Kimi-K2.5)却主要靠开会时编造精巧的假证词取胜。**两条路都能通向胜利,说明成功没有唯一的标准答案。**
一个小尝试:用"克隆学习"训练出一个高效的抓内鬼选手
论文最后还做了一个挺实用的延伸实验。既然内鬼和船员的能力是绑在一起的(会骗人的模型也擅长抓骗子),那如果想训练一个专门擅长"抓内鬼"的小模型,是不是必须先把整个模型练得又大又强?
作者们试了一种叫**行为克隆**的训练方法,说白了就是让一个小模型(9B参数规模,相对小巧)去模仿大模型高手的游戏录像,学人家怎么玩。
他们试了三种筛选训练数据的方式。第一种只挑"赢了的整局游戏"来学,结果小模型的胜率大幅提升,但抓内鬼的准确率没提高,它更多是靠埋头完成任务混到游戏结束赢的,不是真的靠识破了骗局。第二种只挑"投票投对了"的那些瞬间来学,用的训练数据量只有第一种的六分之一,结果抓内鬼的准确率明显提高了,但整体胜率提升不多。第三种把两批数据合在一起训练,结果是一个相对均衡的选手,胜率和识破能力都有提升。
这个结果挺有意思,它说明**"赢"和"识破谎言"其实是两种不同的能力,训练数据选得不一样,练出来的技能侧重点也完全不同**。这就好比健身房里,练举重和练马拉松用的训练计划完全不一样,虽然两者都叫"变强",但强的方向天差地别,你不能指望举重冠军自动就能跑赢马拉松。
写在后面
读完这篇论文,最让我意外的不是AI会骗人这件事本身,毕竟这早就不新鲜了。真正让我停下来想了想的,是那个"限制成第一人称视角后杀人数直接归零"的实验结果。
这个细节暴露了一件我们容易忽略的事:现在讨论AI的"智能"或者"欺骗能力"时,我们默认参照的都是它的语言推理能力,写代码、做数学题、编故事,这些都是纯符号世界里的本事。可一旦把AI放进一个需要持续追踪空间位置、需要"记住那个人刚才往左边走了"的具身环境里,它立刻暴露出短板。这提醒我,我们对AI能力的评估体系,可能一直在用"考卷"衡量一个需要"身体协调"的任务,衡量标准本身就有偏差。
另一个让我反复咂摸的地方,是那个"假装做任务"行为的6.6倍差距。这个数字比"编造假证词"这类更戏剧化的骗术差距更大。这多少有点反常识,通常我们会觉得,那种巧舌如簧、编故事的能力才是"高级欺骗",而假装认真干活这种事看起来太朴素了。但恰恰是这种朴素的、持续的、几乎不起眼的伪装行为,才是真正决定胜负的关键。这让我想起现实里那些真正的骗局,往往靠的不是一次精彩的谎言,而是长年累月维持一个看起来毫无问题的日常表象。
这篇论文没解决的问题也挺明显:它测的所有欺骗,都被绑定在一个游戏的具体规则里,杀人、报案、投票,这些行为本身自带明确的胜负标准。真实世界里的欺骗要模糊得多,没有清楚的"赢"或"输",也没有一个AI法官帮你打分。从游戏世界里练出来的这套骗术分类和检测方法,能不能迁移到那种更开放、更没有明确规则的人机交互场景里,这才是真正让人好奇、也让人有点不安的问题。
Q&A
Q1:MineAmongUs是什么?
A:MineAmongUs是研究团队搭建的一个3D多模态实验环境,把《among us》(太空狼人杀)游戏规则搬进Minecraft里,让AI用第一人称视角真实地行走、攻击、开会讨论,从而同时观察AI的语言欺骗和非语言(行动上的)欺骗。
Q2:为什么限制AI只能用第一人称视角后,游戏就玩不下去了?
A:因为当前AI在纯第一人称视角下,无法稳定记住之前看到的目标位置,一旦目标转身或走远就"跟丢了",导致杀人数直接归零,整个游戏节奏彻底崩溃,因此实验默认给AI开放全地图的位置信息作为补偿。
Q3:论文发现AI靠什么行为最容易赢得游戏?
A:论文发现非语言的行动类骗术比语言技巧更关键,比如动手前确认没有目击者、杀人后立刻逃离现场、故意不报告尸体、提前跟踪目标,这几种行为跟胜率的相关性最高,而含糊其辞类的语言技巧几乎没有帮助。