谷歌王炸!Gemini 3.1 Pro 干翻 GPT/Claude,一句话生成应用
谁能想到,一个只涨了0.1的版本号,能让整个AI圈集体失眠?
2月20日凌晨,谷歌DeepMind突然甩出“核弹级”更新——Gemini 3.1 Pro横空出世。ARC-AGI-2测试77.1%的逆天成绩,直接把刚登顶的Claude 4.6、GPT-5.2按在地上摩擦,推理性能比上一代翻了两倍还多。
我们解读最新技术,文末有相关信息。


作者:张长旺,图源:旺知识
更炸的是,清华物理系特奖得主、从Anthropic转投谷歌的姚顺宇亲自站台,直言“Gemini不仅是优秀模型,更好的还在势不可挡地赶来”。

而OpenAI联创Karpathy更是看完直接宣判:“应用商店的时代,该结束了”。

这个看似“小更”的模型,到底藏着多少改变行业的狠活?它又会如何改写AI战局的格局?
🚨 0.1版本的逆天逆袭:全榜单屠榜,推理能力翻倍封神
在AI圈,0.1的版本更新向来意味着“小修小补”,但Gemini 3.1 Pro直接打破了这个惯例——它用一组组“碾压级”数据,证明了什么叫“史诗级飞跃”。

作为AI界公认的“抽象推理终极考试”,ARC-AGI-2测试是衡量模型核心智能的黄金标准。Gemini 3.1 Pro一举拿下77.1%的验证分数,不仅是上一代3 Pro(31.1%)的两倍多,更把Claude Opus 4.6(68.8%)、GPT-5.2(52.9%)远远甩在身后,直接登顶榜首。

更恐怖的是,它的“屠榜”覆盖了全领域:
• 科学知识GPQA Diamond测试94.3%,接近满分,远超同类模型;
• 竞争性编程LiveCodeBench Pro拿下2887 Elo积分,断层领先GPT-5.2的2393;
• 长上下文处理直接拉满,独家支持100万Token(1M)的终极测试,拿下26.3%的成绩,而GPT-5.2、Claude 4.6直接显示“不支持”;
• 幻觉率大幅下降,在AA-Omniscience评估中表现亮眼,可靠性再上一个台阶。
第三方机构Artificial Analysis给出了更实在的评价:Gemini 3.1 Pro在智能指数中领先Claude Opus 4.6足足4分,而运行成本却不到后者的一半。“能打又省钱”的组合,让它直接成为企业和开发者的首选。

🛠️ 不止跑分炸裂:一句话造应用,落地能力封神
如果说跑分是“纸上谈兵”,那Gemini 3.1 Pro的落地能力,才真正让人看到了“杀手级AI”的模样——它把复杂的专业工作流,变成了“一句话的事”。
1. SVG动画生成:3分钟搓出专业级动态效果
只需一句文本提示,它就能生成可无缝嵌入网页的SVG动画。网友让它做“幽灵猎人走过闹鬼房子的循环动画”,3分钟就交出了11秒的成品;AI大牛Simon Willison测试“鹈鹕骑自行车”,5分钟就得到了线条清晰、动作连贯的动画,相比上一代3 Pro的效果,简直是“降维打击”。更绝的是,这些纯代码构建的动画无限放大不失真,文件体积还比传统视频小得多。

2. 复杂系统整合:零代码搭建专业仪表盘
它能轻松打破复杂API与人性化设计的壁垒。比如直接接入公开遥测数据流,搭建出实时追踪国际空间站轨道的航天仪表盘;
谷歌DeepMind首席科学家Jeff Dean更是转发它模拟城市规划,一键生成包含地形、道路、交通线路的完整城市鸟瞰图,交互界面直接成型。

3. 创意编程:从文学氛围到3D交互全拿捏
• 给《呼啸山庄》设计现代个人网站,它不只是复述情节,而是精准捕捉原著压抑深沉的基调,设计出贴合主人公气质的极简界面;
界面,可谓是完美拿捏了主角的灵魂底色。
• 编写3D椋鸟群飞代码,不仅能生成视觉效果,还支持手势追踪操控鸟群,搭配随鸟群动态变化的生成式配乐,沉浸式体验拉满;
• 开发教育应用更是不在话下,网友让它做“斑点计数算法教学工具”,一个提示就搞定,明暗效果模拟逼真到让人惊叹。

网友实测后直言:“Gemini根本没在胡闹,一句话就能搞定别人几天的工作量,其他模型可以直接over了”。
💰 能打又省钱:成本不到Claude一半,帕累托前沿被粉碎
Gemini 3.1 Pro最狠的地方,在于它不仅性能强,还把“性价比”卷到了新高度。
它的定价和上一代3 Pro保持一致:提示词≤20万Token时,输入2美元/百万Token,输出12美元/百万Token;超过20万Token则输入4美元、输出18美元。而对比Claude Opus系列,它的运行成本不到后者的一半,却在核心能力上实现了反超。

从ARC-AGI-2测试的成本来看,Gemini 3.1 Pro每完成一次任务仅需0.96美元(约6.63元人民币),而定位更高的Gemini 3 Deep Think价格是它的10倍,性能却只领先几个百分点。正如网友Sidra Miconi所说:“不到1美元拿下77%的成绩,彻底打破了传统的成本-智能曲线,帕累托前沿被直接粉碎”。
对于企业和开发者来说,这意味着“用更少的钱,办更牛的事”,大大降低了AI落地的门槛。
🚀 清华姚顺宇站台:谷歌亮出底牌,AI战局彻底变天
Gemini 3.1 Pro的发布,不仅是一次模型更新,更是谷歌向整个AI行业亮出的“肌肉”——硅谷的战局,已经悄然改写。
此前,OpenAI、Anthropic、谷歌三足鼎立,但如今格局已然生变。随着Gemini 3.1 Pro的横空出世,谷歌DeepMind直接与Anthropic进入“硬碰硬”阶段,而曾经风头无两的OpenAI,似乎正逐渐失去主战场的主动权。
作为参与研发的核心成员之一,姚顺宇的表态更让行业沸腾:“更好的模型正以不可阻挡的方式到来”。这背后,是谷歌“硬件算力与算法深度耦合”的研发逻辑,也是它在AGI赛道上的底气。

更耐人寻味的是OpenAI联创Karpathy的反应。他用Gemini类模型花1小时做出了专属的心肺训练仪表盘,感慨道:“300行代码的工具,没必要做成App上架应用商店,LLM几秒就能生成”。在他看来,应用商店的模式已经过时,未来是“AI原生传感器+执行器+LLM编排”的时代——而Gemini 3.1 Pro,正是这个时代的先行者。

💡 行业启示:小版本大飞跃,AI竞争进入“深水区”
Gemini 3.1 Pro的横空出世,给整个AI行业敲响了警钟:竞争已经从“单纯堆参数、拼跑分”,进入了“性能、效率、落地能力”三位一体的深水区。
• 迭代速度成为关键:谷歌在3 Pro还处于预览阶段时就推出3.1 Pro,这种“肌肉秀”式的更新节奏,让对手难以追赶;
• 性价比决定普及度:打破成本-智能曲线,让AI技术真正走进更多企业和个人,才是制胜关键;
• 落地能力定义价值:从“能回答问题”到“能完成完整工作流”,AI正在从“辅助工具”变成“生产力核心”。
正如谷歌DeepMind所传递的:在通往AGI的道路上,只有真正实现“硬件+算法”深度耦合,才能拿稳下半场的入场券。而Gemini 3.1 Pro的发布,只是这场AI竞赛的一个“中场信号”。

姚顺宇口中“更好的模型”会带来什么惊喜?应用商店时代落幕之后,我们的生活又会被AI如何重塑?欢迎在评论区聊聊你的看法~ 也别忘了点赞转发,一起见证AI行业的历史性时刻!
