南京理工揭开AI创意之谜:CreativeBench让机器也能“脑洞大开”

这项由南京理工大学、清华大学、北京大学等多所知名高校联合开展的研究发表于2026年,研究团队开发了一个名为CreativeBench的全新评测基准,专门用来衡量人工智能系统的创造力水平。有兴趣深入了解的读者可以通过论文编号arXiv:2603.11863查询完整论文。
当我们谈论人工智能时,通常会想到它们擅长计算、记忆和执行规则,但很少有人会将"创意"与机器联系起来。就像一个只会按食谱做菜的厨师,传统的AI系统虽然能够完成复杂任务,但缺乏那种让人眼前一亮的创新思维。然而,这种情况正在悄然改变。
随着AI技术的快速发展,研究人员开始探索一个更加引人入胜的问题:机器能否真正具备创造力?这不仅仅是学术好奇心的驱动,更是因为我们正面临一个现实挑战——用于训练AI的高质量数据正在逐渐枯竭,就像一口即将干涸的井。在这种情况下,能够持续产生新颖想法的AI系统变得尤为重要,它们就像是永不枯竭的创意源泉。
为了解决这个问题,研究团队开发了CreativeBench,这是一个专门评估机器创造力的测试平台。可以把它想象成一个特殊的考场,但这里考的不是标准答案,而是看谁能想出最巧妙、最与众不同的解决方案。这个平台基于著名认知科学家玛格丽特·博登的创意理论,将创造力分为两大类型:组合创造力和探索创造力。
组合创造力就像是厨师将不同食材巧妙搭配,创造出全新口味的菜肴。比如将中式烹饪技法与意大利面条结合,产生意想不到的美味。在计算机编程的世界里,这意味着将来自不同领域的编程技术融合在一起,解决一个需要多种技能的复杂问题。研究团队通过一种叫做"逆向工程"的巧妙方法来构建这类测试题目,先让AI系统编写出融合多种技术的程序,然后反推出题目描述,确保每道题都需要真正的跨领域思维才能解决。
探索创造力则像是在重重限制下寻找出路的冒险家。想象你被困在一个迷宫中,常用的路径都被堵死了,你必须找到一条前人从未走过的新路。在编程测试中,这表现为给AI系统施加各种约束条件,禁止使用常见的编程方法,迫使它们探索全新的解决方案。研究团队采用了一种"自我对弈"的方式来生成这类题目,就像两个棋手互相出招,一个不断设置障碍,另一个努力突破限制,在这种对抗中产生越来越有挑战性的创意题目。
为了确保测试的公平性和准确性,研究团队建立了一套严格的评判标准。他们将创造力定义为"质量"与"新颖性"的乘积,就像评价一道菜不仅要看味道好不好,还要看是否有独特创新。质量通过程序能否正确运行来判断,而新颖性则通过计算生成的解决方案与标准方案之间的差异程度来衡量。这种评判方式避免了传统评测中的主观偏见,让机器创造力的评估变得更加客观可靠。
整个CreativeBench数据集包含了1859个精心设计的编程题目,涵盖14个不同的技术领域,从基础算法到网络编程,从数据分析到机器学习,形成了一个全面的创意测试平台。每道题目都经过严格的质量控制,确保它们真正需要创造性思维才能解决,而不是简单的记忆和模仿。
一、当前AI系统的创意表现令人深思
研究团队使用CreativeBench对当前最先进的AI系统进行了全面测试,结果既有惊喜也有意外。即使是表现最好的Gemini-3-Pro系统,在创意测试中的通过率也没有超过60%,这说明AI创造力仍有很大的提升空间,就像一个刚学会基本功的学徒,距离大师水平还有相当距离。
更有趣的是,研究发现了一个被称为"规模化收敛"的现象。随着AI模型变得越来越大,它们确实变得更加准确,但同时也变得更加保守。这就像是一个经验丰富的老师傅,虽然技艺精湛很少出错,但也失去了年轻时的大胆创新精神。大型AI系统更倾向于给出标准化的答案,而较小的系统虽然错误率较高,但有时会产生出人意料的创新方案。
研究还发现,AI系统在处理不同类型创意任务时表现差异明显。在组合创造力任务中,规模化带来的改进效果显著,就像拥有更多食材和更熟练技法的厨师能够创造出更丰富的菜品组合。但在探索创造力任务中,单纯增大模型规模的收益递减,这提示我们需要新的方法来提升AI的探索创新能力。
另一个重要发现是推理能力对创造力的影响呈现出不对称性。当AI系统开启推理模式时,它们在需要突破约束的探索性创意任务中表现明显改善,就像一个深思熟虑的问题解决者能够找到更多绕过障碍的方法。但在需要跨领域融合的组合创意任务中,推理能力的帮助相对有限,这暗示不同类型的创造力可能需要不同的认知机制支持。
二、EvoRePE:让AI内化进化思维的创新方法
面对AI创造力的挑战,研究团队开发了一种名为EvoRePE(进化表征工程)的创新方法。这个方法的核心思想非常巧妙:既然进化算法能够通过不断试错找到创新解决方案,那么能否让AI系统学会这种进化思维模式,并将其内化为自身的能力?
可以把EvoRePE比作学习高手的思维方式。当我们观察一个创意大师工作时,会发现他们有某种特殊的思考模式,这种模式让他们能够跳出常规思路,找到新颖的解决方案。EvoRePE就是要识别并提取这种"创意思维向量",然后将其植入到其他AI系统中。
具体而言,研究团队首先让进化算法在大量创意任务上进行探索,记录下从标准解决方案到创新解决方案的转变过程。然后,他们分析AI系统在这个过程中内部表征的变化,找到那些与创造力提升相关的关键模式。最后,将这些模式提炼成一个"创意向量",在推理时将其注入到AI系统的内部表征中,引导系统朝着更有创意的方向思考。
这种方法的优势在于它是即插即用的,不需要重新训练整个AI系统。就像给一个普通厨师戴上创意大师的"思维眼镜",让他能够看到更多创新的可能性。实验结果显示,EvoRePE能够显著提升各种AI系统的创意表现,而且这种提升与原有的进化优化方法形成互补,产生叠加效应。
更令人惊喜的是,EvoRePE的改进效果在不同规模的AI系统上都很稳定。无论是小型的7B参数模型还是更大的系统,都能从这种创意思维的注入中获益。这表明创造力可能确实存在某种通用的内在机制,而EvoRePE成功地捕捉到了这种机制的精髓。
三、深入解析创意评估的科学方法
为了确保CreativeBench能够准确衡量AI创造力,研究团队在评估方法论上进行了大量创新。传统的编程能力测试主要关注正确性,就像只看学生的答案对不对,而忽略了解题思路的巧妙程度。CreativeBench则采用了一种更加全面的评估框架,同时考虑解决方案的质量和新颖性。
质量评估相对直观,通过在受控环境中运行程序来检验其功能正确性。这就像检验一道菜是否美味可口一样直截了当。但新颖性的评估则更加复杂,需要量化一个解决方案与已知方案的差异程度。研究团队采用了一种巧妙的组合方法,既使用了专门训练的代码嵌入模型来捕捉程序的语义结构,又引入了字符级别的n-gram距离来防止表面修改带来的误判。
这种双重保险机制确保了评估的公正性。嵌入模型能够识别在功能和逻辑上的真正创新,而n-gram距离则防止了简单的变量重命名或格式调整被误认为是创新。就像既要看菜品的口味创新,又要看制作工艺的独特性,两个维度缺一不可。
为了验证这套评估方法的可靠性,研究团队邀请了专业程序员对随机选择的样本进行人工评估。结果显示,自动化评估与人类专家的判断高度一致,相关系数达到0.78,这个数值表明CreativeBench的评估结果具有很高的可信度。更令人鼓舞的是,通过人工审核发现数据集的有效率达到89.1%,这在大规模自动化生成的数据集中是相当令人满意的质量水平。
四、创意生成的自动化流水线
CreativeBench最引人注目的特点之一是其完全自动化的数据生成流水线。传统的AI能力测试往往需要大量人工设计题目,不仅成本高昂,而且难以保证题目的多样性和质量一致性。研究团队则另辟蹊径,开发了一套能够自动生成高质量创意测试题目的系统。
对于组合创造力测试,系统采用了逆向工程的策略。首先让AI系统将来自不同技术领域的代码片段融合成一个统一的解决方案,确保这个解决方案在功能上是正确的。然后自动生成测试用例来验证程序的各种行为,最后根据程序的功能反推出题目描述。这个过程就像先做出一道美味的菜,然后再写出食谱一样,确保了题目和答案的完美匹配。
对于探索创造力测试,系统则采用了自我对弈的方法。一个"约束生成器"负责分析标准解决方案,识别其中的关键技术模式,然后设计约束条件来禁止使用这些模式。另一个"求解器"则需要在这些约束下找到替代方案。这个过程是迭代进行的,约束越来越严格,直到达到求解器的能力极限。这种动态对抗确保了生成的题目既具有挑战性,又在技术上是可解的。
为了保证数据质量,系统还内置了三重过滤机制。难度检查确保题目不会太简单,质量审核验证题目描述和测试用例的一致性,多样性检查则防止重复题目的出现。每一个环节都有严格的标准,就像食品生产中的质量控制一样,确保最终产品符合预期要求。
五、AI创造力的深层机制探索
通过对大量AI系统在CreativeBench上的表现分析,研究揭示了一些关于机器创造力的深刻洞察。首先是规模效应的不对称性。在需要整合多种技能的组合创意任务中,更大的模型确实展现出明显优势,这可能是因为大型模型拥有更丰富的知识储备,能够在不同领域间建立更多连接。但在需要突破常规思维的探索性任务中,规模化的边际收益递减,暗示探索创新可能需要的不是更多知识,而是不同的思维模式。
另一个有趣的发现是推理能力对创造力的差异化影响。当AI系统开启"思考"模式时,它们在面对约束条件时表现得更加出色,能够系统性地分析限制条件并寻找突破口。这就像一个被困在房间里的人,如果能够冷静分析每一个可能的出口,就更容易找到逃脱路径。但在需要直觉和跳跃性思维的跨领域融合任务中,过度的推理反而可能成为束缚。
研究还发现了一个被称为"收敛陷阱"的现象。随着AI模型变得更大更精确,它们越来越倾向于给出"安全"的标准答案,而不是冒险尝试新颖方案。这反映了当前AI训练方法的一个根本局限:过分强调正确性可能会抑制创造性。这个发现对未来AI系统的设计具有重要启示意义。
六、技术创新的实践验证
EvoRePE方法的成功不仅在于理论上的巧妙,更在于其在实践中的显著效果。研究团队进行了大量的对照实验,验证了这种方法在不同AI系统和不同任务类型上的普适性。结果显示,无论是在组合创造力还是探索创造力任务中,EvoRePE都能带来一致的性能提升。
更重要的是,EvoRePE展现出了良好的鲁棒性。研究团队测试了不同的"创意向量"注入层位,发现在模型的中后层注入效果最佳,这与人类大脑中创意思维主要发生在高级认知区域的认知科学发现相吻合。同时,通过调节注入强度,可以在创新性和准确性之间找到最佳平衡点,避免过度创新导致的功能性错误。
这种方法的另一个优势是计算效率高。与传统的进化算法需要大量并行搜索不同,EvoRePE只需要一次性提取创意模式,然后就能以接近零的额外计算成本应用到任何推理任务中。这使得它在实际应用中具有很强的可行性,就像给普通工具装上了智能化的增强装置一样。
七、创意评估标准的科学基础
CreativeBench在评估标准设计上的创新值得特别关注。传统的AI能力测试往往采用单一维度的评价标准,但创造力本身就是一个多维度的复杂概念。研究团队基于认知科学中的P-创造力理论(心理创造力),将重点放在评估AI系统能否产生对其自身而言全新的解决方案,而不是追求历史上前所未有的绝对创新。
这种选择是经过深思熟虑的。历史创造力(H-创造力)的评估存在根本性困难:如何确定一个解决方案在人类历史上是否真正原创?特别是对于基于互联网数据训练的AI系统,这种评估几乎不可能做到完全客观。而P-创造力的评估则相对明确:只要AI系统能够偏离其最可能的输出模式,产生功能正确但结构新颖的解决方案,就体现了创造性思维。
为了量化新颖性,研究团队设计了一套基于距离度量的评估体系。对于组合创造力任务,新颖性通过融合解决方案与各个源领域方案的平均距离来衡量。对于探索创造力任务,则通过受约束解决方案与无约束基准方案的距离来计算。这种方法既考虑了语义层面的创新,也兼顾了实现层面的差异,形成了全面而客观的评估标准。
八、对未来AI发展的深远影响
CreativeBench的研究成果对人工智能发展的影响是多方面的。从技术角度来看,它首次提供了一个标准化的机器创造力评估平台,为相关研究建立了基准。这就像给创意研究领域建立了一把"标准尺子",让不同团队的研究成果能够进行公平比较。
从研究方法上看,CreativeBench展示了如何将认知科学理论与机器学习技术相结合,为跨学科研究提供了范例。这种结合不仅提升了AI系统的能力,也加深了我们对创造力本质的理解。未来的AI研究可能会更多地借鉴认知科学的理论框架,而不是仅仅依赖工程经验。
EvoRePE方法的成功也开启了一个新的研究方向:如何通过表征工程来增强AI系统的特定能力。这种方法不需要重新训练整个模型,而是通过精准的内部调节来实现能力提升,具有很强的实用价值。未来可能会出现更多类似的"能力增强器",让AI系统能够在保持原有优势的基础上获得新的技能。
对于实际应用而言,这项研究的意义更加深远。随着AI系统创造力的提升,它们将能够在更多需要创新思维的场景中发挥作用,从软件开发到内容创作,从科学研究到艺术设计。这不仅会改变这些行业的工作方式,也会为人类创造力的发挥提供更强大的工具支持。
研究还揭示了当前AI训练方法的局限性,为未来的改进指明了方向。过分追求准确性而忽视多样性的训练策略可能需要重新审视。未来的AI系统可能需要在准确性和创新性之间找到更好的平衡,这需要在训练目标、数据策略和模型架构等多个层面进行创新。
说到底,这项研究最重要的贡献可能不在于它解决了什么具体问题,而在于它重新定义了我们对机器智能的期待。过去我们习惯于将AI视为强大的计算工具,现在我们开始认真思考它们成为创意伙伴的可能性。虽然AI的创造力目前还远不如人类,但这项研究让我们看到了希望的曙光。
当然,机器创造力的发展也带来了新的思考。如果AI系统真的具备了强大的创新能力,这对人类的独特价值意味着什么?如何确保AI的创造力被用于积极的目的?这些问题没有标准答案,但CreativeBench为我们提供了探索这些问题的科学工具。
归根结底,这项研究开启了人工智能发展的一个新篇章。它不仅推动了技术的进步,更重要的是拓展了我们对智能本质的理解。在这个AI与人类协作日益紧密的时代,理解和培养机器的创造力将成为塑造未来的关键因素。正如研究团队在论文中所言,这只是机器创造力探索之旅的开始,更多令人兴奋的发现还在前方等待着我们。
Q&A
Q1:CreativeBench是什么,它如何评估AI的创造力?
A:CreativeBench是由南京理工大学等高校联合开发的AI创造力评估平台,包含1859个编程题目。它将创造力分为组合创造力(跨领域技术融合)和探索创造力(约束条件下创新),通过程序功能正确性和与标准方案的差异程度来综合评判AI的创意水平。
Q2:EvoRePE方法是如何提升AI创造力的?
A:EvoRePE是一种"进化表征工程"方法,通过分析进化算法的创意搜索过程,提取出"创意思维向量",然后在推理时将其注入AI系统的内部表征中。这种方法是即插即用的,不需要重新训练模型,就能显著提升AI在创意任务上的表现。
Q3:当前最先进的AI系统在创造力测试中表现如何?
A:即使是表现最好的Gemini-3-Pro,在CreativeBench上的通过率也没超过60%,说明AI创造力还有很大提升空间。研究发现了"规模化收敛"现象:大型AI更准确但也更保守,倾向给出标准答案而非创新方案。