晓|谷歌DeepMind CEO访谈:AI颠覆游戏世界,迎接AGI黄金时代!
你有没有想过,未来我们玩游戏,不再需要游戏公司耗费数年、投入数亿资金去精心打造一个庞大世界?不再需要学习复杂的编程语言或设计软件,只需要像聊天一样,描述你想要的一切,一个栩栩如生的互动世界就瞬间呈现在你眼前?
坦白说,当我第一次看到Google DeepMind的最新成果——Genie世界模型的演示视频时,我几乎以为自己在看未来的科幻片,那种震撼感,是纯粹的,甚至是有点儿“不讲道理”的。这个模型就像一位拥有“读心术”的魔法师,你随口说一句“我想要一个身穿宇航服的人在海边冲浪”,它就能立刻为你生成一个可以互动的3D环境。这里最让我惊讶的是,这可不是播放一段预先录制好的视频,而是它在实时地、动态地创造着你眼前的每一个像素,并且还能让你用键盘操纵其中的角色,自由探索。
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
今天我们对Google DeepMind CEO Demis Hassabis的最新访谈《AI, Creativity, and a Golden Age of Science》进行解读,并带你一探Google DeepMind的Genie世界模型究竟有多神奇,它到底是如何做到这一切的,以及它将如何颠覆我们对虚拟世界的认知,并为通用人工智能 (AGI) 这一宏伟目标,打开一扇全新的大门。
到底发生了什么?传统游戏的“幕后”困境
在深入Genie的魔法之前,我们先来看看传统3D游戏和虚拟世界的构建方式。这就像是拍电影:首先,你需要一群经验丰富的美术师和设计师,他们会精心雕刻每一个道具、每一栋建筑,甚至每一片树叶——也就是我们常说的“建模”。接着,另一批工程师会为这些模型添加材质、光照,并手动编写各种物理规则:比如水花如何溅起,石头怎样落下,光线如何反射。整个过程非常耗时耗力,就像建造一个精密的机械钟表,每一个齿轮、每一根发条都得严丝合缝。Unity或Unreal这样的3D渲染引擎,就是帮助我们把这些“零件”组装起来,并最终呈现给玩家的“工厂”。

这个过程,虽然能创造出令人惊叹的虚拟世界,但它有两个显而易见的局限:
• “所见即所得,但所造即所限”: 你看到的一切都是提前设计好的。如果你想在游戏中看到一个“穿着鸡形服装的人骑着水上摩托”,除非开发者提前做好了这个模型并写好了相关代码,否则你是看不到的。这大大限制了玩家的自由度和世界的无限可能。
• 巨大的开发成本和时间: 每一个细节都需要人类的智慧和劳动去打磨。我记得当年编写图形引擎时,光是让水面反射看起来自然一点,就能让人抓狂好几天。这让“每个人都能创造自己的游戏”成了一个遥远的梦想。
Genie的“读心术”:从视频中看懂世界
那么,Genie是如何跳出这个“传统框架”的呢?它的核心秘密在于一种被称为世界模型的技术,以及它惊人的反向工程能力。

我们可以把Genie想象成一个超级爱看视频的“好奇宝宝”。它被喂养了数百万乃至数十亿计的视频数据,包括YouTube上的各种生活片段、游戏录像等等。这个“宝宝”并没有去学习任何物理定律的公式(比如F=ma,或者光线折射公式),也没有人告诉它“这是一个正方体”、“这是水”这些概念。它只是通过海量的观察,自己“悟”出了一套“直觉物理”。
是不是听起来有点抽象?别急,打个比方:
想象一下,你有一个从来没学过物理的机器人朋友。你给它看了一百万遍篮球在地上弹跳、水泼出去溅开、小猫追逐毛线球的视频。它可能无法写出精确的物理方程,但它会“直觉地”知道:球撞到地面会弹起来,泼水会散开,毛线球滚到桌边会掉下去。这种“直觉”,就是Genie从海量视频中“反向工程”出来的世界运行规律。

这个设计巧妙之处在于,它不需要像我们人类的工程师那样,预先定义好每一个物体的形状(多边形)、材质以及它们之间复杂的物理交互规则。它就像一个天才画家,不是通过学习绘画的每一条笔触或色彩理论,而是通过观察无数幅画作,最终能够“凭感觉”画出任何符合真实世界的场景。
实时世界的“神笔马良”:Genie的创新魔法
明白了Genie“看懂世界”的秘密,它的创新魔法就呼之欲出了:

1. 传统游戏世界就像一个已经搭建好的巨大舞台剧,所有布景、道具都已就位。而Genie,则像一个拥有“神笔马良”的即兴表演者。它没有预设的舞台,只有一片空白的画布。当你说出“在一个被画满涂鸦的房间里走动”时,Genie才开始动笔。你往前走,它就实时为你“画”出你从未探索过的墙壁、家具;你回头看,它又能精准地把之前你画下的涂鸦呈现在你面前。

这里的“实时”和“空白画布”是关键。所有你看到的像素,都是Genie即时生成的,它们在你看到它们之前根本不存在。这与传统3D渲染引擎通过预先建模和物理引擎来计算和显示画面截然不同。Genie直接从你输入的文本提示中理解你的意图,然后根据它“悟”出来的物理规律,直接生成视觉画面。它甚至可以让你输入“一只穿着鸡形服装的人”或“一艘水上摩托”,然后实时将它们加入到场景中,并让它们根据它“理解”的物理规则进行互动。这不禁让我想起我当年为游戏设计AI,光是让NPC(非玩家角色)的路径规划不撞墙,就得耗费大量精力,更别说这种天马行空的实时生成了!
2. Genie不仅能生成,还能确保你所探索的世界是自洽且连贯的。比如,你在房间里画了一幅画,然后转身,再回过头来,那幅画依然在那里。你在沙滩上控制一只狗奔跑,沙子的质感和狗的动作都会显得真实。这种连贯性,正是它通过“反向工程”得来的“直觉物理”在起作用。它虽然没有明确的物理公式,但它“知道”物体应该如何运动,光线应该如何反射,以及不同材质(比如水、沙子、布料)的“行为”特征。这种能力,正是它超越了仅仅生成静态图片,而能创造互动世界的关键。

不止是游戏:迈向真实世界的“通用大脑”
你可能要问了,这种创造虚拟世界的能力,除了让我们玩更酷的游戏,还有什么用呢?Demis Hassabis这位图灵奖得主、DeepMind的CEO,他创办DeepMind的初衷,就是用AI加速科学发现,造福人类健康。在他看来,Genie这样的世界模型,绝不仅仅是为了娱乐,它承载着DeepMind一个更宏大的愿景——构建通用人工智能 (AGI)。

1. Demis认为,要让AI真正具备通用智能,能够像人类一样理解和与世界互动,它就不能只停留在抽象的语言和数学世界里。它必须理解我们身处的物理世界,理解世界的动态和物理规律。Genie正是DeepMind实现这一目标的重要一步。如果我们能让AI系统生成一个符合物理规律的世界,那么就说明这个系统真正理解了这些规律。这种对物理世界的深层理解,对于未来的AGI系统至关重要。
2. 想象一下,一个能够“看见”并“理解”物理世界的机器人。今天,已经有了类似Gemini Live这样的技术,你可以举起手机对准周围环境,AI就能理解你所处的物理上下文。而将Genie这样的世界模型与机器人技术结合,前景将更加广阔:
• 智能家居助手: 未来的智能眼镜助手,不再只是回答你的问题,它能理解你厨房台面上的各种物品,知道哪个是黄色的碗,哪个是红色的盘子,并能帮你规划下一步的动作。
• 具身智能机器人: DeepMind已经开发出Gemini机器人模型,能够让机械手通过自然语言指令(比如“把黄色物体放进红色桶里”)来操纵现实世界中的物体,并将其转化为实际的物理动作。这种结合了真实世界理解的多模态模型,将是未来机器人与人类交互的核心。
• 机器人“操作系统”: Demis甚至设想,未来可能会出现一个类似于“安卓”系统的通用机器人操作系统层,让各种各样的机器人设备能够共享一套智能大脑,从而引发机器人产业的爆炸式增长。虽然目前工业机器人可能更倾向于为特定任务优化形态,但对于个人用途和日常世界交互的机器人,人形形态可能反而更有优势,因为它能更好地适应我们为人类设计的物理世界(比如楼梯、门把手)。
挑战与展望:通往AGI的“最后一公里”
当然,Genie世界模型虽然令人惊叹,但它仍处于早期阶段。目前的模型能够生成一到两分钟连贯的互动体验。Demis Hassabis也坦诚,我们离真正的AGI还有“最后一公里”,他预计可能还需要5到10年才能实现。

这一“最后一公里”需要我们克服以下几个关键挑战:
• 真正的创造力: 现在的AI还不能像人类科学家一样,提出全新的猜想或理论,或者发明像围棋那样优美精妙的游戏。它还缺乏那种“直觉的飞跃”,那种从不同领域发现关联的创造性思维。
• 一致性与可靠性: 尽管AI在某些任务上表现出博士级别的能力,但它仍然会在一些基础问题上犯错,比如简单的数学计算或计数。真正的AGI系统应该具备全面的、持续可靠的能力。
• 持续学习能力: AI系统需要具备像人类一样,能够在线学习新知识,并实时调整自身行为的能力。这就像我们不能指望一个孩子通过看几千部影片就永远不用再学习一样。
不过,DeepMind在这些方面也在不断探索,比如AlphaGo通过自我对弈学习新策略(著名的“第37步”),以及他们正在研发的Nano Banana图像生成器,以其卓越的一致性和指令遵循能力,极大地开放了创造力,让普通人也能轻松创作出专业级的图像。这让我看到,AI正在从“模仿”走向“创造”,从“执行”走向“理解”。
结语:未来的“黄金时代”
在我看来,Genie世界模型不仅是一项令人兴奋的技术突破,更是DeepMind乃至整个AI领域迈向理解和构建真实世界智能的关键一步。它让我们看到,AI不再只是冰冷的计算机器,它正在学会像我们一样“看”世界,“理解”世界,并最终“创造”世界。

Demis Hassabis预测,如果未来10年我们能实现全面的AGI,那么这将开启一个科学的“黄金时代”,一场新的“文艺复兴”。AI将在能源、人类健康、新材料等各个领域带来巨大的变革,其所创造的价值将远远超过它自身所需的能耗。
想象一下,一个由AI驱动的未来,我们将不再被技术门槛所限制,每个人都可以成为创作者、梦想家。也许有一天,你只需要动动嘴,就能创造出自己的专属世界,甚至在其中体验属于自己的故事。
对此,你有什么期待或看法吗?你最想让AI为你创造一个怎样的世界呢?欢迎在评论区分享你的奇思妙想!
参考资料
• 标题: Google DeepMind CEO Demis Hassabis on AI, Creativity, and a Golden Age of Science | All-In Summit
• 作者: Demis Hassabis (Google DeepMind CEO)
