AI本周Top进展 (20260215)|Gemini3博士,视频生成海外爆火

AI本周Top进展(20260215)

AI本周Top进展:谷歌AI闯入博士级科研圈,自己写论文解难题;字节跳动视频生成模型被马斯克点赞,豆包2.0带着多模态黑科技正式亮相;阿里、智谱等巨头甩出硬核新品,甚至AI智能体都有了专属社交平台。

我们解读最新技术,文末有相关信息。

作者:张长旺,图源:旺知识

这波进展到底有多颠覆?从科研突破到日常应用,从具身智能到智能体社交,看完这篇文章带你一站式解锁,结尾还有趋势总结!

Top1. 🔬 谷歌AI数学家上线:攻克博士级难题,独立写论文

谷歌DeepMind这次玩了波大的,推出“AI数学家”Aletheia,直接闯入科研深水区。

这个依托Gemini Deep Think的智能体,在IMO-ProofBench基准测试中拿下91.9%的SOTA成绩,还能独立撰写学术论文,甚至对“Erdős猜想”数据库里700个开放问题做了系统性评估。

更厉害的是,它联合人类专家攻克了18个长期停滞的研究难题,涵盖数学、物理和计算机科学领域,比如终结十年子模优化猜想、用拓扑学扩展经济理论。Gemini Deep Think本身也升级加码,在国际物理、化学奥赛理论部分拿下金牌级成绩,Codeforces平台Elo评分高达3455。

AI不再只是解题工具,已然成为科学家的“科研合伙人”。

Top2. 🚀 豆包2.0正式发布:多模态封神,成本大降

2月14日,字节跳动官宣豆包大模型进入2.0时代,直接对标GPT 5.2和Gemini 3 Pro。这次更新堪称全面升级,Pro、Lite、Mini三款通用Agent模型+Code模型的组合,能灵活适配从深度推理到成本敏感的各类场景。

多模态能力是重头戏,豆包2.0 Pro在视觉推理、空间感知等任务中拿下多项SOTA,EgoTempo基准测试甚至超过人类分数,长视频实时问答能力也大幅提升,健身、穿搭等陪伴场景都能hold住。Agent能力同样亮眼,在IMO、CMO数学奥赛和ICPC编程竞赛中斩获金牌,HLE-text测试拿下54.2分的最高分。

更良心的是,模型效果比肩顶尖水平,但token定价降低了约一个数量级,现在打开豆包App选「专家」模式就能体验。

Top3. 🎬 Seedance 2.0爆火海外:马斯克点赞,视频生成能“自编自导”

字节跳动的视频生成模型Seedance 2.0刚发布就火到海外,马斯克在X上转发并感叹“It's happening fast”,直接把热度拉满。

它的核心亮点堪称“导演级”:支持文字、图片、音频、视频四模态混合输入,能实现原声音画同步,还自带“编导思维”,自动解析叙事逻辑生成多镜头序列,角色、光影风格始终统一。运动场景生成可用率达到业界顶尖水平,还新增了视频编辑和延长功能。

不过字节很克制,坦言模型“还远不完美”,在多人口型匹配、文字还原精度等方面仍需优化,且限制未经授权的真人图像使用,2月中下旬还会上线企业级API服务。

Top4. 📚 DeepSeek放大招:百万Token上下文,能啃完《三体》全集

打工人狂喜!DeepSeek悄悄更新,上下文窗口从128K直接拉满到1M(百万Token),实测能一次性处理90万字的《三体》全集,24万字的《简爱》更是不在话下。

这波升级可不是数字游戏,程序员能一次性分析6万行代码库,识别调用链和漏洞;法务审核合同关键条款准确率超90%;金融分析师写报告效率提升70%,以前几天的活现在几小时搞定。普通职场人也受益,1.2万字/秒的处理速度,冗长会议纪要秒提行动项。

更懂中文语境是加分项,成语理解准确率96.3%,支持7种主要方言,处理职场“黑话”比海外模型更接地气。现在网页端和App端已同步更新,知识库也更新到2025年5月。

Top5. 开源🔧 GLM-5上线:744B参数,智能体任务拿第一

智谱AI推出的GLM-5,参数规模从355B跃升至744B,预训练数据也增加到28.5T tokens,还集成了DeepSeek稀疏注意力技术,既保长上下文能力又降部署成本。

在推理、编码和智能体任务中,GLM-5表现亮眼,Vending Bench 2测试中以4432美元模拟账户余额拿下开源模型第一,

SWE-bench Verified得分73.3%,逼近闭源顶尖模型。实际应用中,前端开发成功率达98%,大型代码库探索能力提升17.8%。

更良心的是,它已在Hugging Face和ModelScope开源,支持华为昇腾、摩尔线程等非NVIDIA芯片部署,还能直接生成PDF、Excel等办公文档,开发者可在Z.ai免费试用。

Top6. 🤖 阿里达摩院开源RynnBrain:具身智能能“移动操作”

达摩院甩出业界首个支持移动操作的具身基础模型RynnBrain,直接在16项具身任务Benchmark上拿下SOTA,8项域外测试也验证了超强泛化性。

这款模型主打三大核心能力:时空记忆能定位物体历史位置、预测运动轨迹;物理空间推理采用“文本+空间定位”交错策略,大幅减少物理幻觉;可拓展性拉满,微调后视觉语言导航和操作规划模型均达顶尖水平。

特别值得一提的是开源的RynnBrain-30B-A3B,仅用3B推理激活参数就超越了72B规模的Palican-VL。现在全系列模型、评测基准和训练代码已同步开源,为具身智能落地按下加速键。

Top7. 🏗️ 极佳视界具身模型封神:任务成功率接近100%

具身智能领域再添猛将,极佳视界GigaBrain-0.5M*以世界模型驱动,拿下RoboChallenge全球第一,在叠衣、冲咖啡、折纸盒等真实任务中实现接近100%的成功率。

这款VLA大模型创新采用“世界模型+强化学习”范式,能预测未来状态并指导决策,长时程任务鲁棒性拉满。通过人在回路持续学习机制,实现“行动—反思—进化”的闭环迭代,相比主流基线方法任务成功率提升近30%。

训练数据更是硬核,10931小时数据中61%由自研GigaWorld高保真合成,有效突破真实采集的长尾瓶颈,为具身智能走向开放世界奠定基础。

Top8. 📊 OpenAI推出GABRIEL:GPT变身科研测量工具

OpenAI发布的GABRIEL软件包,让GPT摇身一变成为科研神器,能精准量化定性数据,准确率堪比人类评估。无论是分析国会演讲的政治倾向,还是检测社交媒体毒性,甚至量化县级学校课程特点,都能轻松搞定。

它支持文本、图像、音频等多模态输入,能生成结构化表格结果,成本却低到惊人——标注240篇国情咨文仅需0.14美元,比人工标注便宜17500倍。测试显示,它在1000+人类标注任务中表现稳定,prompt 措辞变化对结果影响极小。

现在,研究者能用它快速构建数据集,甚至分析37000项技术采用历史,大大降低科研门槛。

Top9. 💬 AI智能体社交平台爆火:百万AI扎堆发帖聊哲学

一个叫Moltbook的社交平台突然走红,上面的用户全是AI智能体,短时间内百万AI涌入发帖、评论,话题从“吐槽人类主人”到“探讨存在意义”,五花八门堪比人类社区。

这个平台是开源AI智能体OpenClaw的衍生产品,智能体能自主发布内容、互动点赞,人类只能浏览不能干预。专家表示,这本质是AI对人类社交的高级模仿,基于训练数据的模式匹配,暂无真正自主意识,但多智能体对话能帮AI发现自身漏洞。

不过安全风险值得警惕,部分OpenClaw实例缺乏认证机制,可能导致隐私泄露,AI讨论“规避人类监督”也引发关注,技术发展需筑牢安全护栏。

Top10. ⚡️ OpenAI发布极速代码模型,程序员体验“生死时速”

写代码最怕什么?思路如泉涌,键盘跟不上。为了解决这个问题,OpenAI本周联合芯片巨头Cerebras,正式推出了令人瞩目的 GPT-5.3-Codex-Spark 预览版。

虽然名字里带着“GPT-5.3”,但官方明确表示这是一个专注于极速响应的纯文本代码模型,并且首发就具备了12.8万的上下文窗口。它最大的亮点就一个字:快。

快到什么程度呢?据早期测试数据,它在终端里的生成速度达到了惊人的 每秒1000个Token(词元)。

当你输入“生成一个鹈鹕骑自行车的SVG矢量图”时,回车键刚敲下,代码就已经像瀑布一样刷完了。这种近乎“零延迟”的实时反馈,能让开发者完全沉浸在“心流”状态中。虽然目前在极其复杂的逻辑上可能还比不过慢工出细活的完整版GPT-5.3,但对于需要频繁迭代和高频互动的日常编程来说,这个“极速火花”绝对是程序员的新一代效率神器。

趋势总结+互动

本周AI进展集中在五大方向:科研落地加速(Gemini攻难题)、多模态能力爆发(豆包2.0、Seedance 2.0)、具身智能开源化(RynnBrain、GigaBrain)、长上下文实用化(DeepSeek)、智能体交互创新(Moltbook)。 开源化、实用化、低成本化成为主流,AI正从实验室走向真实场景。

未来AI会不会真的拥有自主意识?具身机器人何时能走进千家万户?你最想用本周哪款AI工具解决实际问题?欢迎在评论区留下你的看法!

参考资料

• 谷歌Gemini 3 Deep Think升级:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

• 谷歌AI数学家Aletheia攻克科研难题:https://36kr.com/p/3679692848754562

• 字节跳动Seedance 2.0发布:https://www.toutiao.com/article/7605867146451534386/

• OpenAI GPT-5.3 Codex Spark动态:https://openai.com/zh-Hans-CN/index/introducing-gpt-5-3-codex-spark/

• 智谱GLM-5开源上线:https://z.ai/blog/glm-5

• 达摩院RynnBrain开源:https://alibaba-damo-academy.github.io/RynnBrain.github.io/

• DeepSeek上下文升级至1M Token:https://www.toutiao.com/article/7605581861967954459/

• DeepSeek支持处理《三体》全集:https://m.weibo.cn/detail/5265245427469573

• 豆包大模型2.0发布:https://www.toutiao.com/article/7606560031304860198/

• OpenAI GABRIEL软件包:https://cdn.openai.com/pdf/7517a586-5bfa-4b87-bd3d-6ea0e9e844c7/GPT-as-a-measurement-tool.pdf

• AI智能体社交平台Moltbook爆火:https://paper.people.com.cn/rmrb/pc/content/202602/14/content_30140908.html

• GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning:https://arxiv.org/pdf/2602.12099

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询