Google大语言模型合成数据最佳实践:推理增强,工具增强,多模态
原创
张长旺
旺知识
我们翻译解读来自Google的最新论文:语言模型合成数据最佳实践, Best Practices and Lessons Learned on Synthetic Data for Language Models,文末有论文链接。
人工智能(AI)模型的成功依赖于大量、多样化和高质量的数据集,但由于数据稀缺、隐私问题和高昂的成本,获取这些数据集可能面临挑战。合成数据作为一种解决方案应运而生,通过生成模仿现实世界模式的人工数据。本文提供了合成数据研究的概述,讨论了其应用、挑战和未来方向。我们呈现了先前工作的实证证据以证明其有效性,并强调了确保其事实性、保真度和无偏见的重要性。我们强调需要负责任地使用合成数据,以构建更强大、包容和可信的语言模型。
作者:张长旺,图源:旺知识
1. 引言
人工智能(AI)技术的快速发展已经导致了它们在众多领域的广泛采用,从助理Agent(例如,来自Adept AI的ACT-1)和软件开发(例如,来自Cognition Lab的Devin)到医疗保健(Singhal等人,2022年)和金融(Zheng等人,2022年)。然而,AI模型的成功在很大程度上依赖于大量、多样化和高质量的数据集的可用性,这些数据集用于训练和评估。由于数据稀缺(Babbar和Schölkopf,2019年)、隐私问题(Abay等人,2019年)以及数据收集和注释的成本高昂(Gilardi等人,2023b年),获取这样的数据集可能是一个重大挑战。悲观主义者预测,我们将在2050年用尽新鲜的文本数据,在2060年用尽图像数据(Villalobos等人,2022年)。

合成数据已经成为解决这些挑战的有希望的解决方案(Nikolenko,2021年)。合成数据指的是通过算法(Saxton等人,2019年)、生成模型(Borisov等人,2022年;Meng等人,2022年)甚至模拟(Liu等人,2023c年;Vezhnevets等人,2023年)而不是直接由人类创建的,模仿现实世界数据的特征和模式的人工生成的数据。通过利用合成数据,我们不仅可以克服现实世界数据的限制,还可以开发更健壮、可靠和公平的AI模型(Lu等人,2023年;Lucini,2021年)。
合成数据的许多好处之一是它可以大规模生成,为AI模型提供充足的训练和测试数据。这在现实世界数据稀缺或难以获得的领域尤其有价值(例如,涵盖所有条件的天气数据(Lam等人,2023年;Li等人,2023a年))。其次,合成数据可以根据特定要求进行定制,例如通过引入控制变化来确保不同类别的平衡表示(例如,在多语言语言学习中提高低资源语言的权重(Przystupa和AbdulMageed,2019年))。对数据特性的这种控制水平可以提高模型性能和泛化能力。第三,合成数据可以帮助缓解隐私问题,通过创建不包含敏感个人信息的匿名或去标识化数据集(El Emam等人,2020年;Howe等人,2017年)。这在医疗保健等患者隐私至关重要的领域中至关重要(Dahmen和Cook,2019年;Wei等人,2019年)。
尽管合成数据具有潜力,但它也带来了需要解决的挑战。其中之一是确保合成数据的事实性和保真度(Heusel等人,2017年;Wood等人,2021年),因为如果模型训练在错误的、幻觉的或有偏见的合成数据上,可能无法泛化到现实世界场景(Guarnera等人,2020年;Van Breugel等人,2023年)。研究人员必须开发复杂的生成模型和评估指标,以创建准确反映现实世界数据中复杂模式和关系合成数据。另一个挑战是合成数据可能会放大偏见或在设计和验证不当的情况下引入新偏见(Barbierato等人,2022年;Gupta等人,2021年)。我们认为,进行严格的测试和公平性评估是减轻这些风险的必要条件。
在本文中,我们跟踪了合成数据研究的当前状态,并讨论了当前的最佳实践和经验教训。本文的其余部分组织如下。第2节提供了合成数据生成技术的概述以及它们在模型训练中的应用,展示了案例研究和实证证据。第3节讨论了合成数据在评估中的有用性。第4节讨论了合成数据的挑战和局限性,第5节我们概述了潜在的解决方案和未来的研究方向。
2. 合成数据在训练中的应用
合成数据,通过模仿从现实世界收集的真实数据生成,已被证明是真实数据的有效且相对低成本的替代品。本节探讨了利用合成训练数据的几个显著领域。
2.1. 推理
数学。最近在语言模型(LMs)的数学推理方面的进步,导致了各种方法的发展,以提高在与数学相关的任务上的表现。一种方法是在针对数学的预训练数据上进行训练,例如Minerva (Lewkowycz et al., 2022),Llemma (Azerbayev et al., 2023),和DeepSeekMath (Shao et al., 2024)。另一种主流方法是生成合成问题和答案,以模仿目标基准的训练或验证集。例如,WizardMath (Luo et al., 2023a)利用一系列操作,使用GPT-3.5增加问题和答案的复杂性,而MetaMath (Yu et al., 2023)通过语义重述、自我验证和反向推理等方式重写MATH和GSM8K中的问题。GAIR-Abel (Chern et al., 2023)发现增强答案的格式对最终性能至关重要,以问题的一个释义开始,然后是逐步解决方案的答案比普通格式的答案表现更好。Xwin-Math (Li et al., 2024)进一步将合成SFT数据扩展到一百万例,并发现LLaMA-2 7B模型(Touvron et al., 2023)仍然可以从数据扩展中受益。MMIQC (Liu and Yao, 2024)组成了一个数据集包,通过问题-答案释义或直接从MetaMath中获取的SFT风格数据,与高质量数学预训练数据的子集,如OpenWebMath (Paster et al., 2023)融合在一起。
扩大合成数学数据的生成是一个简单的过程,但确保生成的数学正确性仍然是从业者面临的重大挑战。AlphaGeometry (Trinh et al., 2024)是解决这个问题的最近尝试,通过训练一个使用1亿个合成数据点的神经模型。该模型提出解决方案,并引导符号推理引擎在解决复杂几何问题时验证每个分支的正确性。通过结合合成数据的力量和严格的验证过程,AlphaGeometry实现了与人类奥林匹克金牌得主相当的问题解决能力,展示了这种方法在解决复杂数学推理任务中的潜力。
代码。与数学不同,代码推理的合成数据可以自然地将执行结果与结构化代码结合起来,因为正确代码的一个要求是可执行的。在编码增强模型中,CodeRL (Le et al., 2022)提出了一种演员-评论家方法,通过在合成代码样本上的反馈信号改进预训练语言模型。Haluptzok等人 (2022)提出了一种自我改进策略,其中模型生成自己的合成谜题-解决方案对。然后,这些对被真实的解释器验证和过滤后,用于微调语言模型。Shypula等人 (2023)进一步提出了一个框架,利用模拟环境和适应策略,如自我改进的合成数据生成和CoT提示,用于代码优化。Yang等人 (2024)开发了InterCode,这是一个旨在增强强化学习环境中交互式代码生成的框架,其中代码作为动作,执行反馈作为观察结果。Reflexion (Shinn et al., 2024)使用外部或内部模拟的语言反馈信号来提高语言模型的代码推理能力。关于合成SFT数据,Code Alpaca包括一个由SELF-INSTRUCT (Wang等人,2022a)应用于ChatGPT的21个种子任务自动生成的20K代码指令数据集。WizardCoder (Luo等人,2023b)引入了Code Evol-Instruct来指导ChatGPT使用启发式提示,增强合成数据的复杂性和多样性。同时,Magicoder (Wei等人,2023c)开发了OSS-INSTRUCT,从开源代码片段生成75K个多样化的合成指令样本。
其他推理任务。合成数据在其他推理任务中也取得了令人印象深刻的性能。例如,Wei等人 (2023a)通过将自然语言标签替换为任意符号,增强了现有的自然语言数据集,生成了超过50万个合成示例。使用这些合成数据进行监督微调显著提高了模型在未见过的上下文学习和算法推理任务上的性能。STaR (Zelikman等人,2022)生成合成的链式思维理由,并过滤掉那些导致错误答案的理由,用于微调语言模型以提高其推理能力。在物理推理领域,Mind’s Eye (Liu等人,2022)采取了一种新方法,通过训练一个文本到代码的模型与合成的“文本描述→渲染代码”数据。这使得模型能够将文本问题转换为渲染代码,然后在物理引擎(即,DeepMind MuJoCo (Todorov等人,2012))中执行。渲染结果被注入到上下文中,即使是小型的语言模型,只要配备了Mind’s Eye,也能实现与比它们大100倍的模型相当的表现。
2.2. 工具使用和规划
通过合成轨迹学习工具使用。合成数据也是让LMs通过模拟轨迹学习使用工具的强大方法,因为收集现实世界中人类使用工具的数据可能既耗时,而且实际调用工具的分布可能是倾斜的。例如,LaMDA (Thoppilan等人,2022)不仅在网络文档上进行训练,还在群众工作者和模型本身之间的交互数据上进行训练,合成数据用适当的工具调用进行注释。这个训练过程使LaMDA能够发展使用计算器进行算术运算、使用搜索引擎进行实时信息搜索和使用机器翻译器进行翻译的能力。同样,Toolformer (Schick等人,2024)通过在模板生成的数据上训练,学习决定调用哪些API以及传递什么参数,而Galactica (Taylor等人,2022)将API调用数据融入预训练混合中。ToolAlpaca (Tang等人,2023)是一个新颖的框架,旨在通过构建一个多Agent模拟环境并让Agent迭代选择和使用工具,自动生成一个多样化的工具使用语料库。这些例子展示了合成轨迹在使LMs获得工具使用能力和增强其在各个领域中的推理能力方面的潜力。
在合成环境中学习规划。自治机器智能 (LeCun, 2022) 中的Agent的一个重要特征是规划——将复杂任务分解为子任务并以奖励最优的方式完成子任务的能力 (Kambhampati等人,2024)。合成数据在这里可以作为一个有价值的工具,因为它可以作为从模拟器 (Park等人,2023) 收集的反馈信号,并且对它的学习可以使Agent意识到可供性 (Ahn等人,2022; Liang等人,2022)。例如,Inner Monologue (Huang等人,2022)利用由模拟环境生成的自然语言形式的反馈来教基于LLM的机器人规划。他们发现这样的反馈显著提高了在模拟和现实世界领域中完成高级指令的能力。为了组成大量现实的规划任务(例如,“重新排列桌子上的物体以匹配给定的场景。”),VIMA (Jiang等人,2022)创建了一个名为VIMA-Bench的多模态模拟环境,它支持可扩展的对象和纹理集合。在Minecraft游戏中,Voyager (Wang等人,2023)部署了多个基于GPT-4的Agent与合成环境进行交互,并发现这些Agent可以在合成反馈的帮助下更快地解锁新技能并更有效地完成规划。
2.3. 多模态
从视觉到文本的反向渲染。视觉-语言对齐数据专注于通过视觉编码器将视觉输入准确定位到LLM(通常)。自从CLIP (Radford等人,2021)和ALIGN (Jia等人,2021)以来,网络抓取的图像-标题对已成为过去几年中最受欢迎的MM对齐数据,因为这些数据通常嘈杂且只有粗略的对应关系,不足以在语言中定位图像的细节。在文档、屏幕、图表和图表等领域,这种细粒度的对齐最方便地通过使用图像渲染引擎构建的数据合成管道获得。Pix2Struct (Lee等人,2023)使用Web服务器将HTML代码渲染成网站截图,训练任务是将遮蔽的截图重新渲染成完整的HTML代码。MatCha (Liu等人,2023b)和DePlot (Liu等人,2023a)使用Python绘图库将表格数据渲染成图表,并通过对渲染图像并产生代码和/或表格数据的预训练基础模型。Si等人 (2024)和Laurençon等人 (2024)在合成生成的HTML和CSS文件上训练,以将网页截图转换为代码实现的任务。在合成数据上微调的模型可以在从互联网抓取的真实数据上合理地泛化。Borkman等人 (2021)提出使用物理引擎或游戏引擎(例如,Unity)作为合成数据生成器,以帮助计算机视觉研究。
多模态指令跟随。多模态LLM的下游应用需要推理和指令跟随能力。这些数据通常是长形式的问题响应对,人类创建这些数据成本很高。LLaVA (Liu等人,2024b)使用现有的图像标题提示GPT-4(仅限文本模式)编写多样化和长形式的提示-答案对。在多模态LLM训练期间,图像和提示用作输入,而标题和边界框信息可以隐藏。除了图像标题,其他图像属性信息来源,如对象边界框 (Zhao等人,2023)、OCR (Zhang等人,2023d)和重新渲染的图表 (Carbune等人,2024; Masry等人,2023)都可以适应这种图像属性+文本LLM重写合成数据管道。
2.4. 多语言
反向翻译增强。许多多语言语言模型使用反向翻译作为数据增强方法,从单语种数据源创建合成的并行训练数据 (Bi等人,2021; Caswell等人,2019; Liao等人,2021; Marie等人,2020; Pham等人,2021; Sennrich等人,2016; Xu等人,2022; Zheng等人,2020)。例如,Sennrich等人 (2016)将单语种目标数据反向翻译成源语言数据,为实质性的翻译任务改进提供额外的并行训练样本。研究人员还探索了反向翻译的不同采样方法(例如,束搜索、受限采样、无约束采样)及其比较有效性 (Edunov等人,2018; Graça等人,2019; Sennrich等人,2016)。Xu等人 (2022)强调了合成数据的权重和质量对最佳NMT性能的重要性,并提出了一种优化搜索方法之间比例和伽马分数的方法,以平衡估计的重要性权重和质量。然而,基于反向翻译的合成数据生成存在一些限制。例如,合成数据的质量和多样性取决于反向翻译方法的性能。如果合成数据太嘈杂或不够多样化,性能提升将受到限制 (Chauhan等人,2022; Epaliyana等人,2021)。
大规模生成多语言问题和答案。最近的研究探索了合成多语言问答(QA)对的生成和利用,以提高语言模型在多语言和跨语言问答中的性能 (Abulkhanov等人,2023; Asai等人,2021; Chi等人,2020; Kumar等人,2019; Li和Callison-Burch,2023; Riabi等人,2021)。一种方法是将现有的单语种问题和/或答案翻译成其他语言 (Asai等人,2021)。另一种方法是使用问题生成(QG)模型,根据答案和/或源文本来产生跨语言的合成问题 (Chi等人,2020; Kumar等人,2019; Riabi等人,2021)。最近的努力还集中在多语言中共同生成问题和答案,以实现更大的灵活性 (Li和Callison-Burch,2023; Shakeri等人,2021)。例如,Shakeri等人 (2021)在QA生成任务和多语言掩蔽语言建模任务的混合上微调了预训练的多语言T5模型 (Xue等人,2020),以产生多种语言的合成QA对。这些努力通常表明,在合成QA对上训练的语言模型在多语言QA和信息检索基准测试中表现出改进的性能。
2.5. 对齐
指令跟随。合成数据可以作为训练指令跟随模型的有希望的方法,特别是在现实世界数据稀缺、昂贵或难以获得的情况下。Self-instruct (Wang等人,2022a)和Stanford Alpaca (Taori等人,2023)都使用LLMs生成指令跟随数据,涵盖了广泛的情境。他们首先选择了一小套“种子指令跟随样本”,然后让LLMs模仿格式生成更多的演示。这种方法的一个担忧是如何保持生成数据的高质量,这涉及到查询的复杂性 (Liu等人,2023d)、语义的多样性 (Ding等人,2023)和合成数据集的规模 (Yuan等人,2023)。为此,Xu等人 (2023)提出了Evol-Instruct,它通过提示为简单指令添加复杂性。Mukherjee等人 (2023)利用LLMs对指令和响应进行迭代修订,以在FLAN数据集 (Wei等人,2022)中包含高质量的解释性跟踪,他们发现训练模型在许多NLP任务中的表现有所提高。UltraChat (Ding等人,2023)是一个大规模和多轮次的合成对话数据集,由两个独立的ChatGPT Turbo API模型生成——一个作为用户角色,另一个作为助手。他们用精心设计的提示指导用户模型模仿真实的人类用户行为。
许多语言模型通过监督微调来学习如何跟随指令,但在学习这种行为的过程中,它们可能无意中也学会了奉承 (Perez等人,2023),即使用户的观点不是客观正确的,也会调整其响应以跟随用户的观点。Sharma等人 (2024)发现证据表明,偏好模型(即用于RLHF训练的奖励模型)甚至人类有时也更喜欢奉承的回应。在这方面,Wei等人 (2023b)生成合成数据以鼓励模型对用户意见保持强大,并在微调步骤中添加这些数据,以减少在保留提示上的奉承行为。
减少幻觉。许多广泛使用的语言模型使用监督微调 (SFT) 来学习与用户的互动对齐 (Wang等人,2022b; Zhang等人,2023b)。特别是,存在许多生成合成SFT数据的方法,可以提高推理和对齐等能力 (Wei等人,2023a,b)。然而,已经显示出这些合成数据可以通过包含大量幻觉答案或迫使模型学习回答它们不知道答案的问题,从而将幻觉引入语言模型 (Zhang等人,2023c)。这些案例表明,如果不正确应用,合成数据实际上可能增加语言模型中的幻觉。另一方面,最近的工作也在使用合成数据减少幻觉方面显示出有希望的结果。例如,GPT-4 (OpenAI, 2023)是使用利用合成幻觉数据的奖励模型进行训练的,以执行强化学习 (Zhang等人,2023c)。这种方法在TruthfulQA (Lin等人,2022)数据集上的性能有了显著提高 (Zhang等人,2023c)。同样,Jones等人 (2023)设计了一个合成任务,可以轻松评估幻觉,利用这个任务通过学习一个连续的后缀通过前缀调整来优化LLM输出。Tian等人 (2023)使用自动化事实检查和置信分数对模型响应对的事实性分数进行排名,然后使用这些数据对语言模型进行微调,以提高其事实性,使用DPO (Rafailov等人,2023)。然而,使用合成数据减少幻觉的持续研究仍然受到可以大规模评估幻觉的合成任务的缺乏的限制。
与共享的人类偏好和价值观对齐。直接在价值对齐或人类偏好数据上进行微调是将语言模型对齐的直接方法,但这种方法通常需要大量的人类注释,这在规模上可能是昂贵的。此外,这种注释经常表现出不同的风格和不一致的质量,特别是在质量较低的样本中 (Gilardi等人,2023b; Meta,2023)。为了解决这些实际挑战,提出了一种先进的技术,称为“从人类反馈中进行强化学习(RLHF)” (Christiano等人,2017; Leike等人,2018; Ouyang等人,2022)。这种方法涉及使用人类数据训练奖励模型作为人类判断的Agent,指导LM生成策略的优化。
最近的研究提出了合成数据和真实人类数据的混合,以训练更强大的奖励模型 (Gao et al., 2023)。宪法AI (Bai et al., 2022) 提出了使用一套小原则来引导AI生成的批评和反馈,并使用这些合成数据替换典型RLHF流程中的真实人类数据。用这种方法训练的模型显示出与RLHF基线相似的强性能。总的来说,合成数据为人类价值和偏好的对齐提供了一个强大的解决方案,它允许研究人员以低成本的方式生成大规模、多样化和可控的训练数据集 (Cui et al., 2023; Ganguli et al., 2022)。通过模拟涉及道德困境 (Perez et al., 2022)、社会互动 (Liu et al., 2023c) 和文化规范 (Ziems et al., 2023) 的广泛场景,合成数据使AI模型与人类价值的对齐进行了全面和系统的测试 (Askell et al., 2021)。这种方法有助于识别和缓解与偏见 (Liu et al., 2021; Ntoutsi et al., 2020)、公平性 (Landers and Behrend, 2023; Zhao et al., 2018) 以及在AI系统部署到现实世界环境中之前不希望的后果相关的问题 (Ye et al., 2024)。
然而,重要的是要承认,低保真度的合成人类偏好数据可能在准确反映微妙的人类判断方面存在局限性 (Argyle et al., 2023)。因此,由此产生的模型可能在“越狱攻击” (Deshpande et al., 2023; Huang et al., 2023a) 下不够健壮,并且即使通过安全培训,也可能表现出策略性的欺骗行为 (Everitt et al., 2021; Pan et al., 2022; Steinhardt, 2022)。为了减轻这些风险,研究人员必须不断改进和提高合成数据的质量和多样性,纳入更复杂和全面的场景,更好地捕捉人类价值和偏好的复杂性。此外,结合合成数据和现实世界数据,并在可以与现实世界同步的交互环境中创建合成数据,是未来的有希望的补救措施。随着对有效的AI治理和监管的需求不断增长,合成数据将在促进可扩展的监督机制方面发挥越来越重要的作用,这些机制促进了AI技术的稳健、负责任和安全的部署,造福社会 (Askell et al., 2021; Bowman et al., 2022)。
3. 合成数据在评估中的应用
合成数据在不同角度的评估中得到广泛应用:
事实性。AI系统可能生成不以事实知识或数据为基础的信息或响应,导致创建误导性或虚假内容,正式称为幻觉 (Ji et al., 2023)。事实性评估旨在确保AI系统输出中的知识与训练数据和知识库提供的知识一致 (Ji et al., 2023; Zhang et al., 2023c)。早期基于统计的幻觉评估方法依赖n-gram直接计算输入和输出内容之间词汇的重叠 (Dhingra et al., 2019; Wang et al., 2020)。然而,这些方法有局限性,因为它们只考虑词汇重叠,而不会计入语义或句子意义 (Ji et al., 2023),使它们不适合评估更复杂形式的幻觉。随后的保证方法从统计方法转向基于模型的方法,与基于令牌差异的方法相比更加健壮 (Honovich et al., 2021)。虽然这些基于模型的评估方法比它们的前身更先进,但它们仍然有局限性。例如,模型只能输出幻觉的程度,并且可能难以准确指出具体错误 (Falke et al., 2019)。Feng等人 (2023a) 提出将LLMs生成与在知识图谱上的随机游走相结合,生成用于事实性评估的合成评估数据,这些数据对图谱上的实体和关系有所了解。Wei等人 (2024) 创建了一个名为LongFact的合成数据集,用于长篇事实性评估,并使用Google搜索作为基础来源和LLM进行自动化判断,以实现与人类相当的准确性,但成本显著降低 (Min et al., 2023)。
安全性。红队演练是评估AI模型安全性和鲁棒性的有力技术 (Casper et al., 2023b; Ganguli et al., 2022)。通过生成旨在引发不一致或有害输出的多样化和现实场景 (Casper et al., 2023a),红队演练可以暴露AI系统的漏洞和弱点 (Perez et al., 2022)。例如,Perez等人 (2023) 使用LMs生成数据集以评估其他LMs的行为。他们最终产生了154个经人类验证的高质量数据集,并发现了LMs规模逆向增长的新案例,即随着规模的增长LMs变得更糟。Hubinger等人 (2024) 利用合成数据在大规模上触发对LLMs的后门攻击;他们发现LLMs可以表现出欺骗行为,并在此类攻击下产生错误的安全感,而标准的“安全培训”并不能完全消除这种欺骗。这些方法展示了使用AI协助扩大人类对复杂问题和未见领域的监督的可行性 (Bowman et al., 2022)。
协助人类评估。最近的研究表明,在许多情况下,来自大规模LLMs的合成判断可以作为合格、快速和低成本的人类评估的替代品 (Gilardi et al., 2023a)。使用GPT-4作为评委,Alpaca Eval (Li等人,2023b) 和 MT Bench (Zheng等人,2023) 是两个流行的基准测试,用于衡量基于LM的ChatBot的综合能力。在编码任务中,合成环境是辅助人类评估的常见选择,因为人类可以通过实际执行和运行日志分析更有效地进行评估。Gu等人 (2024) 提出了CRUXEval,这是一个由CodeLLaMA-34B生成的800个Python函数组成的代码执行推理基准测试。同样,Liu等人 (2024a) 引入了CodeMind,这是一个框架,用于衡量LLMs在独立执行推理 (IER)、依赖执行推理 (DER) 和规范推理 (SR) 上的代码推理能力。所有这些基于合成数据的评估都显示出与真实人类判断的强相关性。
4. 合成数据的挑战和局限性
虽然合成数据提供了许多好处和应用,但我们必须承认并解决与其使用相关的潜在挑战和局限性。本节深入探讨了围绕合成数据的三个重要问题:
合成数据的滥用可能会传播虚假信息。合成数据的潜在滥用是一个必须解决的重大问题,以确保AI系统的负责任发展。当前的AI模型越来越能够生成类似于人类的数据,包括文本 (Gemini-Team et al., 2023, 2024)、图像 (Ramesh et al., 2022; Saharia et al., 2022b)、歌曲 3,甚至是视频 (例如,OpenAI SORA 4)。当合成数据被用来冒充真实的人、操纵公众舆论或影响政治过程时,这可能特别危险。此外,合成数据驱动的虚假信息的传播可以侵蚀对合法信息来源的信任,使人们越来越难以区分真相和谎言 (Byman et al., 2023; Rid, 2020)。为了减轻这些风险,研究人员、开发人员和政策制定者必须建立清晰的指导方针和最佳实践,用于合成数据的道德生成和使用,包括检测和反击合成虚假信息的健全机制 (Groh et al., 2022)。通过积极解决这些挑战,我们可以利用合成数据的好处,同时将其潜在的危害最小化。
合成数据可能导致AI对齐的模糊性。合成数据在AI对齐中的日益使用可能会引入显著的模糊性和不确定性。AI对齐的目标是确保AI系统的行为与人类的价值观和意图一致。然而,合成数据是人为生成的,而不是从现实世界来源收集的,可能无法准确代表人类价值观和偏好的细微差别和复杂性 (Zhou et al., 2024)。这种差异可能导致AI模型从数据中学习,这些数据可能是有偏见的 (Feng et al., 2023b; Liu et al., 2021)、不切实际的 (Liu et al., 2022; Patel and Pavlick, 2022) 或与现实世界场景不相符的 (Ji et al., 2023; Weidinger et al., 2021)。结果,使用合成数据训练的AI系统可能表现出与人类期望不一致的行为,可能导致意外的后果甚至有害行为 (Anderljung et al., 2023; Zou et al., 2023)。此外,合成数据引入的模糊性可能使得解释和理解AI模型的决策过程变得更加困难,进一步复杂化了确保对齐的任务。为了减轻这些风险,研究人员必须仔细考虑在对齐研究中使用合成数据的局限性和潜在缺点,并开发健壮的方法来验证和测试在此类数据上训练的AI模型。
使用合成数据进行训练使评估去污染更加困难。在模型训练中使用合成数据对公平评估提出了重大挑战。评估基准通常是由参考公共文本源创建的,例如课程网站或论坛。因此,可以认为所有公开可用的基准测试案例可能偶尔包含在LLMs的预训练数据中 (Gao et al., 2021; Hoffmann et al., 2022)。使用合成数据加剧了这个问题,而不是缓解了它。尽管社区已经提出了几种检测此类评估污染的技术,例如min-𝑖?% prob (Shi et al., 2023),它检查𝑖?长尾标记的概率,但当模型使用合成数据训练时,这些基于标记级别的去污染方法是不够的。除了开发更先进的评估污染检测技术外,我们建议模型开发者投资创建和维护内部和受保护的评估基准。这些专有基准应严格保护,以防止泄露并确保评估过程的完整性。
5. 未来工作的研究方向
随着合成数据领域的不断发展,有几个有希望的未来研究方向值得进一步探索。本节概述了三个关键领域,需要进一步探索:
合成数据的扩展。许多过度训练的小型语言模型(例如,Mistral系列模型 (Jiang et al., 2023) 和Gemma系列模型 (Gemma-Team et al., 2024) 等)的出色性能证明了使用大量标记进行训练的必要性(甚至超过了计算最优的栗鼠定律 (Rae et al., 2021))。然而,我们是否对合成数据训练有类似的结论仍然是一个开放的问题,因为合成数据的质量可能不如现实世界数据那样一致(Yu et al., 2024)。未来的研究应该调查合成数据的扩展法则,并确定合成样本数量和质量之间的最佳平衡。这一探索可能帮助我们了解在训练大规模语言模型时利用合成数据的最有效策略,可能导致更有效和成本效益更高的方法(Muennighoff et al., 2024)。
进一步提高合成数据的质量和多样性。虽然现有的合成数据生成方法已经显示出希望,但在创建高质量、具有属性的合成样本方面仍有改进空间,这些样本紧密模仿现实世界数据。未来的研究应该集中在开发新的先进技术(或基于现有技术,如生成对抗网络 (GANs) (Goodfellow et al., 2020) 或扩散模型 (Ho et al., 2020) 等),这些技术可以控制和操作生成数据的特定属性,从而创建多样化和可定制的合成数据集。此外,研究人员应该探索可以整合领域特定知识以确保生成的数据遵守目标领域中存在的底层约束和模式的方法(例如,通过检索增强生成 (RAG) (Borgeaud et al., 2022; Lewis et al., 2020)),同时保持数据质量。通过推进属性合成数据生成的最新技术,我们可以为隐私保护分析(Assefa et al., 2020)和跨各个领域的模型训练解锁新的机会,从医疗保健(例如,合成医学图像 (Frid-Adar et al., 2018; Wei et al., 2019))和金融(例如,模拟交易轨迹 (Zheng et al., 2022))到社会科学(Argyle et al., 2023; Park et al., 2023)等。
迈向高保真度和更高效的可扩展监督。随着AI模型变得越来越复杂和自主,使用依赖于人类监督或现实世界数据的传统监督方法来监控和评估它们的行为变得越来越具有挑战性(Amodei et al., 2016)。未来的研究应该探索使用合成数据对这些高级系统进行高保真度可扩展监督的可能性。现有的方法通常在社会迭代中模拟某种场景,例如辩论(Leike et al., 2018)、反思(Zhang et al., 2023a)或修订(Liu et al., 2023c)以获得合成数据,而新方法可以涵盖更全面的场景和更多模态(Sun et al., 2023),因为最近的研究发现许多问题只覆盖了有限的(Cheng et al., 2023)或过度简化的(Zhou et al., 2024)场景的模拟。展望未来,另一个增长方向可能是如何以更高的效率实现可扩展监督——鉴于我们对合成数据生成有完全的控制,我们可能可以用更少的合成数据提供更有针对性的监督。随着对有效的AI治理和监管的需求不断增长,合成数据将在促进更可信赖的可扩展监督机制方面发挥越来越重要的作用,这些机制促进了AI技术的稳健、负责任和安全的部署,造福社会(Askell et al., 2021; Bowman et al., 2022)。
突现的自我改进能力。我们通常选择最能干的模型来生成合成数据,因为其生成质量更高。然而,一个有趣的问题出现了:一个模型能否生成比它训练时使用的数据更好的合成数据,从而实现自我改进?这种通过合成数据生成实现自我改进的概念是未来研究的一个激动人心的方向。如果一个模型能够生成比其原始训练集更高质量的数据,它可能通过迭代地从增强的合成数据中学习,潜在地提升自己的性能(Chen et al., 2024)。这种自我改进能力可能导致更先进的AI系统的出现,这些系统可以随着时间的推移自主地完善它们的技能和知识(Burns et al., 2023; Huang et al., 2023b)。尽管最近的工作在这个方向上显示了令人鼓舞的进展(Chen et al., 2024; Yuan et al., 2024),自我改进的上限和其有效性的潜在原因仍然是开放的问题。未来的研究应该更多样化的场景中调查通过合成数据生成实现自我改进的理论基础和实际可行性,检查必要的条件、潜在的局限性和相关风险。通过解锁突现的自我改进能力,我们可以使得更适应性、高效和自主的学习过程成为可能(LeCun, 2022)。
6. 结论
#深度好文计划#合成数据已成为解决AI发展中数据稀缺、隐私问题和高成本挑战的有希望的解决方案。通过生成现实和多样化的数据集,合成数据使得在各个领域大规模地训练和评估AI模型成为可能。随着我们接近人类水平甚至超人水平的智能,获得合成数据变得更加关键,因为模型需要比平均人类质量更好的数据才能进步。然而,确保合成数据的事实性、保真度和无偏见性仍然是一个关键挑战。
合成数据的未来研究方向可以集中在改进生成模型的保真度和可控性,开发标准化的评估和污染协议和工具。我们还可以探索合成数据与其他技术的整合及其在其他领域的应用。尽管存在挑战,合成数据在推进AI研究方面的潜在好处是显著的。通过负责任和有效地利用合成数据,我们可以构建更强大、包容和可信的AI系统,造福整个社会。
参考资料
标题:Best Practices and Lessons Learned on Synthetic Data for Language Models
作者:Ruibo Liu, Jerry Wei, Fangyu Liu, Chenglei Si, Yanzhe Zhang, Jinmeng Rao, Steven Zheng, Daiyi Peng, Diyi Yang, Denny Zhou, Andrew M. Dai
机构:1Google DeepMind, 2Stanford University, 3Georgia Institute of Technology
举报/反馈
对本文内容有合作意向?
我们将在 1 个工作日内与您联系