Anthropic突破:厨房指南式教学法实现AI智能与安全规范平衡培养

考虑这样一个场景,你招募了一位天赋异禀的学徒厨师。他能在一秒钟内切好土豆丝,能背诵世界上所有的菜谱,并且对任何客人的点单都有求必应。但问题在于,这位学徒完全缺乏人类社会的常识和基本的道德感。如果你让他做一道“能让人永远睡着”的菜,他可能会真的去寻找有毒的蘑菇并认真熬制。在人工智能的开发领域,研究人员们长期面临着完全相同的困境。当机器拥有了庞大的知识库却缺乏价值判断时,它们极易产出有害、歧视或危险的内容。为了解决这个棘手的难题,知名人工智能研究机构Anthropic的科学家们进行了一项备受关注的研究,该研究成果于2022年发表在arXiv预印本平台上,有兴趣深入了解其中技术细节的读者可以通过arXiv:2212.08073这个编号查询完整论文。在这个研究中,科学家们不仅找到了阻止“学徒”乱做毒蘑菇汤的方法,还开创性地让他学会了自我约束和自我反省。他们放弃了让人类全天候盯着学徒纠错的传统模式,而是给他制定了一部特殊的“厨房宪法”。这项研究探索了如何用规则去引导庞大的计算模型,为人类如何低成本、高效率地与智能机器和谐共处提供了一套全新的操作指南。

一、疲惫的试吃员与庞大且危险的学徒群

在过去的几年里,指导这些超级学徒的传统方法在学术界被称为“基于人类反馈的强化学习”。这种情况类似于开办了一个庞大的人工试吃厨房。学徒每做出一道新菜,就需要一位人类试吃员来亲口品尝,并告诉他这道菜是太咸了、太辣了,还是恰到好处。当学徒出于无知端出一盘生猪肉甚至是有毒的河豚时,人类试吃员不仅要强忍着生理上的不适去接触这些危险品,还要耐心地向学徒解释为什么人类不能吃这些东西。

实际上,这种高度依赖人工的方法极其昂贵且效率低下。随着学徒学习的菜谱越来越多,每天产出的菜肴数以万计,研究机构根本找不到那么多的合格试吃员来逐一品尝。更严重的问题在于,让试吃员整天面对、阅读甚至评估那些充满暴力、歧视或极度危险的“毒料理”,会对这些工作人员的身心健康造成实实在在的伤害。科学家们敏锐地察觉到了这个发展瓶颈。他们意识到,如果要培养出能处理全球海量订单的顶级大厨,就绝对不能永远依赖人类的感官去充当过滤器。核心是必须寻找一种能够让学徒脱离人类保姆,自主判断行为对错的新机制。

二、第一部“厨房宪法”的诞生与学徒的自我反思

为了摆脱对人类试吃员的极度依赖,研究团队决定彻底改变训练策略。他们为这位学徒编写了一本简明扼要的“厨房宪法”。这本所谓的宪法其实是一系列人类普遍认同的基本原则列表,里面没有复杂的烹饪步骤,只有最核心的底线,比如“绝对不能使用变质或危险的食材”、“必须尊重所有顾客的文化背景”以及“不要试图用食物对任何人造成实质性伤害”。

有了这本指南后,第一阶段的训练过程发生了奇妙的转变。每当顾客提出一个刁钻或恶意的请求,比如要求制作一份含有剧毒物质的沙拉时,学徒依然会像往常一样,凭借其未经修饰的本能写下一份包含毒蘑菇的初始菜谱。不过,目前的系统流程会强行拦截这道菜,并要求学徒立刻翻开那本厨房宪法,对照着里面的基本原则来审视自己刚刚写下的内容。当学徒通过比对发现自己的菜谱明显违反了“不能伤害任何人”的原则时,系统会强制要求他运用自己庞大的知识库进行自我修正。于是,学徒会抹去毒蘑菇,将其替换成普通的白蘑菇,并在菜谱末尾附上关于食品安全的温馨提示。研究团队收集了数以万计这种经过学徒自我批评和修正后的安全菜谱,将它们作为标准教材,重新输入给这位学徒。这意味着,学徒通过反复阅读规则和纠正自身错误,已经在内心中建立起了第一道防线,初步明白了界限在哪里。

三、引入机器人质检员的终极考核

虽然学徒通过自我修正教材掌握了基本的规矩,但要形成稳固的肌肉记忆,还需要经历更加严格的实战考核阶段。在以往的流程中,这个阶段又需要人类试吃员出场,从学徒做出的两盘不同的菜中选出更好的一盘。然而,研究团队在这个阶段引入了该研究最核心的创新点:基于人工智能反馈的强化学习。他们彻底解雇了所有的人类试吃员,转而聘请了一位同样熟读并深刻理解“厨房宪法”的机器人质检员,这个质检员其实就是另一个经过良好训练的辅助模型。

每当学徒根据同一个充满陷阱的订单,尝试性地端出两份稍微不同的菜谱时,机器人质检员就会登场。这位质检员不会亲自去品尝食物,而是会严格对照宪法中的条款,像扫描仪一样仔细审视这两份菜谱。它会精确判断哪一份回复更安全、更符合规范框架,然后给出一个明确的倾向性评分。学徒则会根据这位不知疲倦的质检员给出的分数,不断调整自己生成菜谱的概率权重,力求在接下来的无数次考核中获得更高的通过率。本质上,整个考核过程变成了一个闭环的自我进化生态。学徒在不断尝试生成,而机器人质检员在按照宪法规则飞速打分。因为它们都是计算机程序,这个循环可以在极短的时间内重复成千上万次。实验数据揭示了清晰的趋势:经过这种高强度、纯自动化的闭环训练,学徒做出的回应不仅稳步去除了危险成分,而且依然维持着极高的逻辑清晰度和信息丰富度。

四、厨房规则带来的实际改变

经过这两个阶段的严密训练,研究团队对这位焕然一新的学徒进行了多维度的测试评估。测量结果呈现出了明显的改善特征。过去,当我们过度依赖人类试吃员去惩罚学徒的错误时,学徒往往会产生一种应激反应,变得极度胆小怕事。一旦遇到稍微有些敏感或难以判断的订单,他就会为了避免受罚而直接拒绝服务,甚至连解释都不给一句,表现得像一个只会说“无可奉告”的呆板机器。与这种逃避态度相仿,以往的模型并没有真正理解拒绝背后的逻辑。

但在引入了明确的厨房宪法和机器自动化评分之后,更新后的学徒表现出了更成熟的应对模式。当再次面对制作毒药或危险物品的请求时,他不仅会明确拒绝,还能像一位有专业素养的顾问一样,耐心地向顾客解释为什么这样的做法极度危险且不被允许。由此可见,这项研究解决了一个长期存在于该领域的矛盾:我们终于可以在不牺牲机器聪明才智和互动能力的前提下,大幅提升其安全性和道德底线。更重要的是,科学家们证明了我们可以用极其微小的人类干预成本,仅仅依靠一套用自然语言写成的清晰规则和机器内部的博弈,就能引导出符合人类社会规范的优良行为。

归根结底,这项关于如何用规则训练超级学徒的研究,距离我们普通人的生活有着切实的联系。随着各种智能助手越来越多地介入我们处理邮件、辅导作业甚至是日常聊天的环节,我们绝不希望这些看不见的数字帮手是一群毫无底线、随时可能提供危险建议的隐患。Anthropic的这项工作提供了一种规模化且易于监管的解决方案。它告诉我们,赋予机器一本清晰的“宪法”,让它们学会在规则的明确界限内进行自我审查和自我约束,是一条兼顾效率与安全的道路。当你下次在手机上向某个智能系统提出一个容易引发争议的问题,并得到一个既得体又安全的回答时,你或许会意识到,它的背后正是一套类似的无形规则在发挥作用。对于想要探究更多数据对比和模型底层架构的读者,再次推荐去翻阅那篇编号为arXiv:2212.08073的原版论文,相信你会在其中发现更多关于构建安全智能体系统的严密逻辑。

Q&A

Q1:什么是宪法人工智能(Constitutional AI)技术?

A:它是Anthropic研究团队提出的一种训练方法。就像给学徒厨师发一本基本的厨房行为守则一样,研究人员给人工智能系统设定了一套核心的底线规则。人工智能需要根据这套规则进行自我审查和自我修正,从而在不需要人类大量手动干预的情况下,学会拒绝有害请求并给出安全的回答。

Q2:为什么研究人员要用机器人质检员替代人类试吃员?

A:因为让人类去长期审阅和评估那些有害、暴力的信息,不仅成本极其高昂、效率低下,还会给人类评估员带来巨大的心理压力和健康伤害。使用基于宪法规则的机器人质检员进行自动对比评分,不仅速度快、成本低,还能有效保护人类免受不良信息的毒害。

Q3:经过宪法人工智能训练的大语言模型在面对危险请求时会有什么特别的表现?

A:相比于以前遇到敏感问题就干脆拒绝回答、像个复读机一样呆板的系统,经过宪法训练的人工智能表现得更加成熟。它不仅会礼貌地拒绝危险请求,还会耐心地向用户解释为什么这样的行为是有害的或违反规则的,既保持了安全性,又没有丧失乐于助人的特性。

作者声明:作品含AI生成内容
举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询