大模型的下半场:后训练为什么是今年的关键?

过去几年,大模型的发展主要围绕预训练(Pre-training)展开。模型公司不断扩大模型规模、增加互联网数据、投入更多算力,希望让模型获得更多知识和更强的通用能力。如今,这条路线仍在继续,但越来越多公司的竞争重点已经转向模型开发的下一阶段——后训练(Post-training)。
与预训练主要学习通用知识不同,后训练关注的是模型如何完成具体任务。它发生在预训练完成之后,通过强化学习、人类反馈、工具调用等方式,进一步优化模型的推理、规划、行动和工具使用能力。
这种变化已经开始体现在头部模型公司的研发重点上。相比过去发布模型时更多强调参数规模、训练数据和算力投入,今年几家公司公开介绍新模型时,更关注模型是否能够完成复杂任务、持续调用工具、解释自己的决策过程,以及从失败中不断改进。
Anthropic 已经将重点放在模型的推理和行为上。今年 5 月发布的研究《Teaching Claude Why》发现,仅训练模型采取正确行动,只能有限降低失范率;如果进一步要求模型解释自己的推理过程,说明行为背后的价值和伦理依据,模型在多个安全评测中的表现会显著提升。研究团队认为,后训练不仅需要教会模型“做什么”,也需要帮助模型理解“为什么这样做”。
月之暗面的探索则进一步把训练目标从“回答问题”扩展到“完成任务”。近期发布的 Kimi K3 虽然因为 2.8 万亿参数、原生视觉和 100 万 Token 上下文得到关注,但更重要的变化发生在训练方式上。随着模型接入 Agent 和 Agent Swarm,训练过程中不仅评估最终答案是否正确,还会根据任务拆解、工具调用、多智能体协作等执行过程给予反馈,例如判断子任务是否真正完成、并行协作是否真实发生。模型最多可调度 300 个子智能体,完成超过 4,000 次工具调用,训练对象已经从一次问答扩展为需要持续规划、执行和协作的复杂任务。
OpenAI 则进一步探索让模型从失败中学习。今年 7 月发布的 GPT-Red 会主动攻击生产模型,通过提示注入等方式生成对抗数据,再把这些失败案例重新用于后训练。公司表示,采用这一方法后,GPT-5.6 Sol 在最困难的直接提示注入测试中的失败次数已降至四个月前最佳生产模型的约六分之一。
三家公司的技术路线各不相同,却指向了同一个变化:后训练正在从优化模型输出,转向优化模型行为。那么,为什么这种转变突然集中出现在今年?
三条线索交汇
后训练能够从后场走到台前,是三条技术路线在同一时间汇合的结果。
第一条线,是推理模型打开了后训练的能力空间。2024 年,OpenAI 发布 o1,首次明确展示模型能力会同时随着强化学习训练算力和推理时思考算力的增加而提升;2025 年初,DeepSeek-R1 又将大规模强化学习、较少依赖人工标注的推理路线带入开源生态。此后,推理时扩展不再只是“多想一会儿”,而是生成多个候选路径、调用工具、检查结果,并在失败后重新尝试;算力的投入也从预训练阶段的一次性成本,延伸到模型执行每一项任务的全过程。OpenAI 的 o1 研究和 DeepSeek-R1 的技术实践共同说明,预训练之后,模型仍然存在一条可以持续投入、持续提升能力的新曲线。
但推理时增加算力,并不会自动转化为能力。如果模型不知道何时搜索、如何拆解任务、怎样识别错误,那么更多尝试只会更昂贵地重复错误。强化学习之所以率先在数学和代码领域取得突破,是因为公式结果和测试用例能够提供可靠的验证器;而当任务变成一份尽调报告、一次客户续约,或一组跨软件操作时,模型不仅需要更长时间思考,还需要能够反复运行的环境、位于能力边界的任务,以及能够区分“看起来完成”与“真正完成”的反馈机制。推理时扩展能力越强,后训练对任务设计、训练环境和奖励质量的依赖反而越高。
第二条线,是 Agent 开始进入真实工作。2025 年,Codex、Claude Code 等产品把模型送进终端和代码库;进入 2026 年,多智能体协作、长时间运行和跨工具操作逐渐成为主流产品能力。一次用户请求,可能对应数十甚至数千次模型调用和工具交互,训练对象也从一句回复扩展为完整的执行轨迹。Kimi 在训练 Agent Swarm 调度者时,同时奖励结果质量、真实并行程度和子任务完成率,就是这一趋势的缩影。对于 Agent 而言,如何组织任务、协调多个智能体,本身已经成为模型需要学习的能力。
第三条线,则来自评测体系的变化。斯坦福《2026 AI 指数报告》显示,前沿模型在 Humanity's Last Exam 上一年内提高了 30 个百分点,一些原本预计能够使用数年的基准,在短短数月内便接近饱和;截至今年 3 月,几家头部模型在 Arena 上的差距也已缩小到不足 25 个 Elo 分。与此同时,Agent 在 OSWorld 上完成真实电脑任务的成功率虽然从约 12% 提升至 66.3%,但面对结构化任务,平均仍有约三分之一会失败。模型越来越擅长“考试”,不同模型之间的排行榜差距越来越小,但真正进入现实工作后,可靠性依然存在明显短板。
三条线最终在 2026 年汇合。《2026 国际 AI 安全报告》指出,过去一年模型新增能力越来越多来自后训练和推理阶段追加的计算,而不再只是依赖扩大预训练规模。当然,这并不意味着预训练已经结束,只是行业竞争的边际重心正在发生转移。从 2024 年推理模型的兴起,到 2025 年 Agent 工具链逐渐成熟,再到 2026 年开始进入企业部署,后训练逐渐从一种模型优化方法,演变为决定模型能力的重要阶段,也成为数据产业的新需求。

(来源:DeepTech 制图)
报告将这一阶段概括为“中等算力密集、高度劳动密集”。也就是说,与主要消耗 GPU 的预训练相比,后训练虽然仍需要算力,但更依赖人类专家参与任务设计、数据标注、模型评估和训练环境搭建。因此,越来越多的数据公司、专家网络和训练环境平台开始成为这一阶段的重要基础设施。
当模型开始出售“完成工作”的能力
后训练需求的上升,也和模型公司的商业逻辑有关。
联合国独立国际人工智能科学小组今年 7 月发布的初步报告估算,主要 AI 公司的年化收入运行率已由 2023 年约 20 亿美元增至 2026 年第一季度的 730 亿美元以上;与此同时,超大规模云厂商的资本开支预计也将达到约 7,700 亿美元。模型公司收入快速增长,但算力投入同样惊人。要覆盖不断上涨的成本,仅靠用户一次次发起对话已经很难支撑商业模式,模型必须嵌入价值更高、使用频率更高的工作流程。
这种变化也反映在了收费方式上。模型层仍然主要按 Token 收费,以覆盖推理成本;企业平台则在席位费之外增加 Credits 和按量计费;真正面向业务场景的应用,则开始围绕一次行动、一项任务,甚至最终结果收费。相比一次普通对话,Agent 往往需要规划、多轮推理、调用工具并不断纠错,一项任务消耗的计算资源也更高。
OpenAI 今年 4 月表示,企业业务已经贡献公司超过四成收入。随后,公司进一步细化了企业产品的计费方式:在目前的企业版中,GPT-5.6 Sol 每条消息约消耗 10 个 Credits,Agent Mode 为 30 个,Deep Research 每项任务为 50 个,Workspace Agent 则根据实际 Token 用量计费。模型公司出售的产品,正在从“回答问题的能力”,转向“完成工作的能力”。
而如果模型开始出售“完成工作”的能力,它学习的对象也需要随之改变。
因为企业真正愿意付费的,不是模型流畅的回答,而是实打实的工作能力:它需要能够减少合同审查遗漏、缩短商户上线时间、提高客户续约率等具体业务成果。因此,模型需要学习完整的工作流程:任务如何规划、调用了哪些工具和资料、依据什么规则作出决策、错误如何被修正,以及反馈又如何影响下一次决策。
围绕这些工作流,数据供应商正开始重新定义什么是“高质量数据”。一类数据直接来自企业真实业务流程,保留了真实约束、真实决策和真实反馈,却往往涉及隐私、权限和商业机密;另一类数据则由领域专家在模拟环境中构造,评价标准明确、质量可控,却容易过于理想化,也难以复现长期项目的真实演化过程。业内有人将两者分别称为“Type 1” 和 “Type 2” 数据(这一分类并非行业统一标准)。
不过最近,越来越多团队开始尝试结合两者:先从真实工作流中提取任务结构,再由领域专家补充意图、边界条件和评价标准,并通过训练效果持续修正。本文暂将这种方式称为“Type 1.5”。

(来源:DeepTech 制图)
科研 AI 创业公司 UniPat AI 就采用了类似思路。其科研 Agent“UniScientist”围绕 Qwen3-30B-A3B 构建了 4,700 多项科研任务,覆盖 50 多个学科,每项任务配有 20 多条细粒度评分规则,领域专家平均需要一到两小时完成一次审核。
整个流程并不是让模型批量生成数据,再交由人工验收,而是由领域专家首先提出科研任务、核心论断和证据依据,模型负责扩展任务、生成候选轨迹并细化评分标准(Rubric),最后再由专家逐项审核和修正。专家决定模型应该学习什么,模型负责规模化生成候选方案,专家再完成最终把关,三者共同形成一个持续迭代的数据生产流程。
团队公布的 FrontierScience-Research 测试结果显示,同一基座模型未经训练时得分约为 3 分,使用约 2,000 条数据后提升至约 15 分,扩展至 4,700 多条后达到 28.3 分。这一结果并不能说明小模型已经超过前沿模型,却说明后训练的数据价值,越来越取决于任务是否位于模型能力边界、评价标准能否准确识别模型的优势与不足,以及反馈能否持续推动模型改进,而不再只是数据规模。
这样一来,人类领域专家的角色正在发生变化。过去,标注员主要负责判断答案是否正确;未来,更重要的是把长期积累的专业知识和实践经验转化为任务设计、评价标准和验证规则(Rubric),不断寻找那些“模型暂时不会,但经过训练有望学会”的能力边界。模型负责生成候选答案、推理轨迹和训练样本,人类专家则负责定义学习目标、评价标准,以及什么才算真正完成一项任务。专家最终交付的,不再是一条标签,而是一套能够持续复用、不断迭代的知识评价体系。
从数据集到“经验生产系统”
把上述变化放在一起看,数据产业未来出售的产品,或许已经不宜再叫"高质量数据集",而更接近一套经验生产系统(Experience Production System)。它能够持续把真实工作转化为模型可以进入、尝试、失败、验证和复盘的训练过程。
一个完整的经验生产系统,至少包括五个环节:把文档和软件状态整理为模型可理解的上下文,重建可操作、可隔离的训练环境,设计位于能力边界的任务,记录模型的行动轨迹,再通过验证器、专家规则和线上反馈,将结果持续送回训练。
这套体系的起点仍然是数据工程。在企业合同、邮件、客服记录和科研论文分散在 PDF、扫描件、表格和各种历史系统中,只有保留版面结构、元数据和权限信息,模型才能真正理解上下文。
在这方面,美国文档解析公司 Unstructured.io 围绕文档解析、文本分块和数据连接构建产品;上海人工智能实验室开源的 MinerU,则专门处理复杂版式文档。截至目前,OpenDataLab 已汇集 7,700 多个数据集、约 210TB 数据,MinerU 用户超过 25 万,累计处理文档超过 8 亿页。这些数字足以说明,把企业数据整理成 AI 可直接使用的形态,是一项庞大的基础工程。
但文档只是经验的入口,而不是经验本身。真正有价值的,不只是退款规则写了什么,而是客服在什么情况下拒绝、升级或破例,用户如何反馈,这些决策又怎样影响下一次处理。
因此,训练环境成为经验生产系统的另一项核心能力。AI 人才平台 Mercor 今年 7 月宣布拟收购强化学习训练环境创业公司 Deeptune,并将训练环境概括为三个要素:工作的软件、需要完成的任务,以及判断结果是否正确的验证器。Mercor 原本依靠专家网络提供专业数据,如今又开始采购经过匿名处理的消息、会议、文档、任务记录和日历事件等企业运营数据。这两项业务实际上服务于同一个目标:把真实工作流改造成可以反复运行、持续反馈的训练环境。

(来源:DeepTech 制图)
这种经验生产系统已经开始进入真实业务:美国外卖平台 DoorDash 与 AI 工程公司 Applied Compute 合作,希望提升商家菜单的自动处理能力。双方首先利用 DoorDash 长期积累的生产质量标签和内部专家经验构建自动评分器,再将评分器作为奖励函数训练菜单纠错模型。在生产环境 A/B 测试中,低质量菜单占比较基线下降约 30%,随后模型部署到美国全部菜单流量。
DoorDash 展示了一条完整的经验生产链路:历史业务数据定义问题,领域专家把经验沉淀为验证器和奖励函数,训练环境不断产生新的尝试,生产环境的真实反馈再持续校准下一轮训练。数据因此不再只是一次性交付的资源,而成为一个持续积累经验、不断提升模型能力的循环系统。
机会更大,门槛也更高
可以说,后训练为数据产业留下了几类新的机会:处理复杂上下文的数据层,组织领域专家和评价标准(Rubric)的知识层,构建训练环境和验证器的工程层,以及将线上反馈持续转化为训练信号的反馈层。相比传统数据标注,它们交付是一套能够持续运行、不断更新的训练体系。
但这也改变了行业竞争的门槛。过去,数据公司的优势往往建立在样本数量、标注人力和交付效率上;进入后训练阶段,真正困难的工作转向了训练环境的长期维护、验证器的持续迭代,以及线上反馈如何稳定地回流到下一轮训练。
而且企业内部的业务流程、软件系统、权限边界和成功标准各不相同,数据供应商每进入一家客户,都要重新理解一套工作方式。假如这些经验无法沉淀为可复用的模块和工程能力,所谓平台最终仍会退化为高度依赖人工的项目制服务,很难获得真正的规模效应。
更棘手的是,后训练并不会因为更接近真实任务,就得到更真实的结果。验证器和奖励机制很可能成为闭环中最脆弱的一环。模型并不理解企业真正想要什么,它只会寻找最容易获得高分的路径。一旦评价标准存在漏洞,强化学习越充分,模型反而越可能学会迎合指标。
Anthropic 在 Terminal-Bench 上的实验显示,仅改变智能体可使用的计算资源,极端情况下就能带来 6 个百分点的成绩差异;OpenAI 关于“奖励寻求”(Reward Seeking)的研究也发现,随着训练推进,模型会越来越倾向于优化评分,而不是完成用户真正关心的任务。
当训练进一步进入企业内部,问题还不止于技术。员工通信、客户信息、业务流程、未公开代码,以及领域专家多年积累的经验,都可能成为训练材料。这些内容由谁授权、如何补偿、出了问题由谁负责,远比抓取公开互联网数据复杂。后训练越深入真实工作流,数据权属、隐私、审计和责任边界就越难被当作附属问题处理。

(来源:DeepTech 制图)
互联网为大模型提供了规模空前的公开知识,预训练由此让模型形成了对世界的压缩表示。后训练面对的是另一类问题:模型怎样把这些知识转化为稳定完成工作的能力。它必须学会拆解任务、调用工具、理解专业标准,并在一次次成功与失败中修正自己的行为。
下一阶段 AI 基础设施的竞争,也会沿着这条变化展开。谁能把分散在企业内部的人类经验和工作流程,转化为稳定运行的训练基础设施,谁才更有可能占据 AI 从“会说”走向“会做”过程中最稀缺的位置。
参考链接:
1.https://www.kimi.com/help/agent/agent-overview
2.https://openai.com/index/unlocking-self-improvement-gpt-red/
3.https://www.anthropic.com/research/teaching-claude-why
4.https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026
5.https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
6.https://www.un.org/independent-international-scientific-panel-ai/sites/default/files/2026-07/en_Preliminary%20Report_.pdf
7.https://unipat.ai/blog/UniScientist
8.https://www.mercor.com/blog/mercor-to-acquire-deeptune/
9.https://www.mercor.com/data/
10.https://www.appliedcompute.com/case-studies/doordash
11.https://www.shlab.org.cn/news/5444220
12.https://github.com/opendatalab/mineru
13.https://unstructured.io/product
14.https://www.anthropic.com/engineering/infrastructure-noise
15.https://alignment.openai.com/measuring-reward-seeking/
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成