波兰AI研究团队如何让语言模型“说一口流利的波兰语”

这项由波兰SpeakLeash开源科学项目联合克拉科夫AGH科技大学超算中心(ACK Cyfronet AGH)、雅盖隆大学、Azurro公司及Enelpol公司共同完成的研究,于2026年4月以预印本形式发布在arXiv平台,编号为arXiv:2604.10799v1。研究的核心成果是Bielik v3 PL系列语言模型,包含70亿参数(7B)和110亿参数(11B)两个规格,均在Apache 2.0开源许可证下免费发布。
当人们谈论AI语言模型的时候,往往聚焦于它有多少参数、训练了多少数据、能不能写诗做题。但有一个非常基础的问题却常常被忽视:这个AI究竟是怎么"读懂"文字的?就像一个人在阅读之前,需要先把文字拆解成有意义的单位,AI在处理语言之前,也必须先把文本切碎成一块块"词片"。这个切割过程,就叫做**分词**(tokenization)。
问题在于,那些覆盖几十种语言的通用分词器,在面对波兰语这样复杂的语言时,表现得相当笨拙。波兰语以词形变化极为丰富著称——同一个词根,根据性别、格、数、时态的不同,可以衍生出几十种形式——这让通用分词器常常需要把一个波兰单词切成三五个碎片才能处理。碎片越多,AI能在有限"记忆空间"里处理的内容就越少,处理速度也越慢,成本越高。这就是这支波兰研究团队想要解决的核心问题:为AI换上一套专为波兰语定制的"理解系统",让它真正高效地处理母语。
---
一、AI是怎么"读"文字的,以及为什么通用方案会拖累波兰语
要理解这项研究的意义,不妨先从一个生活中的类比入手。假设你是一个仓库管理员,每天需要把一大批货物分门别类装箱。如果你用一套专门为本地货品设计的分类标准,那些常见商品一件一箱,快速高效。但如果你用一套同时兼顾全球所有商品的通用分类手册,本地常见的那些商品可能会被拆成好几个零件分装,不仅浪费空间,取货的时候也麻烦。
AI的分词器就是这个"分类手册"。目前绝大多数流行的大语言模型——包括Mistral、Llama、Qwen等——使用的都是面向多语言优化的通用分词器,词汇表里包含10万甚至25万个词片。这些分词器在英语上表现很好,因为英语正是它们重点优化的对象。但对于波兰语这样词形变化丰富的语言,通用分词器往往需要把一个完整的波兰单词切成多个碎片。
研究团队用一个叫做**生育率**(fertility ratio)的指标来衡量这种效率损失——它表示平均每个单词需要多少个词片来表示。数字越大,意味着AI每次处理同样数量的单词时需要消耗更多资源,能放进"记忆窗口"的有效内容也就越少。
研究团队对波兰共和国宪法序言这段有代表性的正式波兰文本做了详细测量。旧版Bielik模型使用的Mistral衍生分词器,处理这段波兰语文本时,每个单词平均需要3.22个词片。而研究团队新开发的APT4分词器,处理同样的文本,每个单词只需要1.62个词片。从3.22降到1.62,意味着在同样的"记忆空间"限制下,AI能处理的波兰语内容几乎翻了一倍。与此同时,两套分词器的词汇表规模都维持在约3.2万个词片,这个规模刻意设计成与Mistral相当,目的是排除"因为词汇表更大所以更好"的干扰,让研究成果真正体现的是分词策略本身的进步。
值得注意的对照是,EuroLLM、Llama 3.2等模型虽然使用了12万到26万个超大词汇表,确实在一定程度上改善了分词效率,但付出的代价是模型体积更大、内存占用更高、推理速度更慢。在专注于波兰语或类似小语种的应用场景中,这些庞大词汇表的大量条目根本用不上,纯属浪费。Bielik团队的方案选择了另一条路:维持合理的词汇表规模,但通过更聪明的分词策略实现效率提升。
---
二、换掉"字典"却不忘记已学知识——这是整个实验最难的地方
如果直接给AI换一套全新的分词器,会发生什么?答案是,它可能会忘掉几乎所有已经学到的知识。
这就像一个人用了多年的中文字典突然被换成日文字典,虽然他脑子里积累的知识还在,但用来检索和表达那些知识的"索引系统"完全变了,原来的所有记忆路径都断裂了。这种现象在AI领域有个专门的名称,叫做**灾难性遗忘**(catastrophic forgetting)。
Bielik团队面临的挑战正是如此:Bielik v3系列模型是在大量波兰语和多语言数据上经过长期训练的成熟模型,里面积累了丰富的语言知识、常识推理能力和对话能力。要给它换上新分词器,必须找到一种方法,让新的词片系统能够继承旧系统里存储的知识,而不是从零开始重新学习。
研究团队选择了一种叫做**FOCUS**(Fast Overlapping Token Combinations Using Sparsemax,基于稀疏最大化的快速重叠词片组合)的方法来解决这个嫁接问题。这个方法的思路非常直觉:新词汇表里的每一个词片,都可以表达为旧词汇表里若干个语义相近词片的加权组合。换句话说,不是把旧字典扔掉换新的,而是为新字典里的每一个词条,找出它在旧字典里对应的一组最相关条目,然后把这些条目的"知识值"混合起来,作为新词条的初始知识。
研究团队在做出这个选择之前,系统比较了多种嫁接方案。随机初始化方案最简单粗暴,就是给新词汇表的每个词片随机分配一个初始知识向量,效果可想而知,模型需要从头学起,收敛很慢。基于词频统计的词汇迁移方案(FVT)稍微好些,根据词片出现的频率来初始化,但精度有限。线性变换方案尝试通过数学映射在新旧词汇表之间建立对应关系,但难以处理语义上的细微差异。WECHSEL方案借助多语言静态词向量来对齐词汇,MATT方案在FOCUS基础上引入了注意力机制,OFA和RAMEN方案则各自依赖外部多语言资源。在1.5B参数的小版本Bielik模型上进行的系统实验表明,FOCUS方法在训练损失最低和下游评测表现最好两个维度上都明显优于其他选项,因此被选为正式方案。
---
三、两阶段"解冻"训练——像给手术后的患者做康复
选定了嫁接方案,还需要一个精心设计的训练过程,让嫁接后的模型真正恢复健康。研究团队设计了一套两阶段渐进式训练流程,可以理解为一种"先固定、再放开"的康复训练。
第一阶段的核心思路是固定大部分神经网络,只训练少数关键部分。具体来说,训练用了40亿词元(token,可以理解为处理的文字单位数量,40亿大约相当于数十亿个波兰语单词)的数据,但在这个阶段,绝大多数模型参数都被冻结,不允许修改。唯一被允许训练更新的,是输入层的词嵌入(负责把词片转换成数字的部分)、输出层的语言模型头(负责把数字转回词片预测的部分),以及位于网络最底层和最顶层的各两个变换器层(transformer layers,共四层)。
为什么只开放这四个边界层?因为语言模型的中间层负责存储和处理复杂的推理知识,这些知识是模型最宝贵的资产,在嫁接初期不应该被打扰。边界层则主要负责词片的输入输出接口,让这些层先适应新的分词系统,然后把正确的信号传递给保持稳定的中间层,这样模型的内部知识就得到了保护。
第二阶段则全面解冻,所有参数都可以自由更新。这一阶段继续训练了160亿词元。此时模型的输入输出接口已经在第一阶段基本适应了新分词器,整体架构不再那么脆弱,可以安全地进行全面调整,让网络各个部分都能与新的分词方式更好地配合。
两个阶段总计使用了200亿词元的训练数据,这些数据全部来自原始Bielik v3模型的训练语料,保证了数据分布的一致性。从训练过程的曲线图来看,损失值从一开始较高的位置迅速下降并趋于稳定,准确率也稳步攀升,说明整个训练过程平稳有效,没有出现不稳定或发散的迹象。
---
四、换了分词器之后,还需要让模型"懂人话"
光做好了分词器嫁接和预训练,还不够。就像一个人掌握了大量知识,但不知道怎么跟人好好对话,依然无法成为有用的助手。研究团队对完成预训练的模型进一步进行了三个阶段的后训练对齐,确保模型不仅懂语言,还懂得如何有效帮助用户。
第一个阶段是**监督微调**(SFT)。团队准备了约2000万条高质量的波兰语和英语指令-回应对,用来教模型如何按照用户的要求给出正确格式和内容的回答。这个过程就像给一个知识渊博的人系统培训如何解答用户问题,训练进行了3轮,每条文本的最大长度是32768个词片,大约相当于能够处理一篇相当长的文章。
第二个阶段是**正向偏好优化**(DPO-P)。这是一种让模型学习"什么样的回答更好"的训练方式,具体使用了一种叫做DPO-Positive的变体,专注于强化期望的好回答,同时减少模型产生幻觉(即一本正经地说错误信息)的倾向。训练数据包含114000条带有人工偏好标注的样本,同样进行3轮训练。
第三个阶段是**组相对策略优化**(GRPO)强化学习。这个阶段专门针对数学、逻辑推理和STEM(科学、技术、工程、数学)等需要严格正确答案的领域。通过让模型在可验证的问题上不断尝试、获得反馈、调整策略,模型的逻辑推理能力得到进一步强化。这里使用了143000条专业训练样本。这三个阶段的后训练流程与原版Bielik v3模型完全一致,确保了两者之间的可比性。
---
五、实验成果:换了分词器的模型表现如何
这套组合拳打下来,最关键的问题是:换了分词器之后,模型的表现有没有变差?
研究团队在九个基准测试上对新模型进行了系统评估,覆盖波兰语专项能力和多语言综合能力两个维度。
在波兰语综合测评榜(Open PL LLM Leaderboard)的5-shot评测中,原版Bielik-11B-v3.0-Instruct得分65.93,换了波兰语分词器的Bielik-PL-11B-v3.0-Instruct得分64.11,差距约为1.8分。7B规格的对比是:原版Bielik-Minitron-7B-v3.0-Instruct得62.46,对应的PL版本得61.66,差距同样在1分左右。换句话说,分词器替换带来的性能代价非常小,远小于将分词效率翻倍所带来的实际收益。
波兰语情商测评(Polish EQ-Bench)的结果更为惊喜。这个测评衡量的是模型理解和推理情感状态的能力。原版11B模型得71.20,PL版本得71.15,几乎没有差距。而7B版本的PL模型得66.89,实际上高于原版7B的64.09。这说明在涉及语言理解深度的任务上,波兰语优化分词器反而带来了轻微的提升。
复杂波兰文本理解测评(CPTUB)的结果也出现了类似的惊喜。这个测评专门考察模型对比喻含义、惯用语、反讽等深层语言现象的理解。原版11B模型总分3.73,PL版本达到3.80,略优于原版。7B的PL版本得3.55,也接近原版7B的3.38。在这个专门考察波兰语语言细腻度的测试上,PL版本的表现超过了使用通用分词器的原版,印证了专用分词器对波兰语理解深度确实有帮助。
波兰医学专业测评(Polish Medical Leaderboard)考察的是模型回答波兰国家医师专科考试题目的能力。原版11B得50.21%,PL版本得48.42%,略有下降但仍然处于同类模型前列。7B PL版本得43.35%,与原版的44.36%也非常接近。
在英语能力方面,研究团队同样进行了测试,以验证专注于波兰语的优化没有损害英语表现。在英语Open LLM Leaderboard上,原版11B平均得72.45,PL版本得71.49。7B PL版本得67.63,略高于原版的66.60。这表明整套适配过程对英语能力的影响极为有限,模型成功地同时保留了波兰语优化和英语能力。
在多语言读写理解测评(Belebele,覆盖28种欧洲语言)上,原版11B平均82.98,PL版本77.41,差距约5.6分。在机器翻译测评(FLORES,20个欧洲语言对的平均BLEU分)上,原版11B得19.22,PL版本得17.82,差距约1.4分。这两项测试的小幅下降主要体现了一个合理的权衡:将分词器专门为波兰语优化,在某种程度上牺牲了对其他欧洲语言的均衡覆盖,但代价相当轻微。
从横向比较来看,Bielik-PL-11B-v3.0-Instruct在Open PL LLM Leaderboard上的64.11,超过了Mistral-Small-24B-Instruct(62.97)、phi-4(62.57)等参数规模更大的模型,也超过了Qwen3-32B(64.24)、gemma-3-12b-it(62.20)等竞争对手。换句话说,在参数量只有11B的情况下,这个为波兰语专门优化的版本依然具备强劲的竞争力。
---
六、这项研究给整个语言AI领域提供了什么样的参考路径
Bielik v3 PL的实验意义不只局限于波兰语本身,它提供了一套可复制的方法论,供其他小语种AI开发者参考。
核心方法论可以概括为三个环节的组合:第一,使用FOCUS方法进行词嵌入的知识嫁接,在更换分词器的同时最大程度保留模型已有的知识积累;第二,采用先冻结边界层再全面解冻的两阶段渐进式预训练,平衡训练稳定性与模型适应性;第三,严格复用与原版模型相同的后训练对齐流程(SFT→DPO-P→GRPO),确保模型在完成分词器适配之后,仍能具备良好的对话和推理能力。
这条路径的吸引力在于它的效率。总计200亿词元的预训练量,相比从头训练一个大语言模型所需的数万亿词元,是一个相当经济的量级。通过分阶段的参数冻结策略,团队避免了高昂的全参数训练成本,同时获得了接近全参数训练效果的适配质量。
研究团队也坦承了模型的局限性。与所有大语言模型一样,Bielik v3 PL系列模型仍然可能产生事实错误,不应被用于需要绝对准确性的场景。尽管训练数据经过了清理,模型仍有可能输出带有偏见或不适当的内容。这些是当前整个大语言模型领域的共同局限,并不是这项研究特有的问题。
---
说到底,这项研究解答了一个听起来很技术、实则影响深远的问题:能不能在不大幅牺牲性能的前提下,给一个成熟的语言模型换上专为某种语言量身定制的"理解引擎"?答案是肯定的,而且实现路径比想象中更加可行。
对波兰语用户而言,这意味着在同样的硬件条件下,AI能够处理的波兰语文本量几乎翻倍,推理速度加快,使用成本降低。对波兰语这种在全球AI生态中长期处于劣势的语言而言,这种效率提升是实实在在的语言平权。
对那些关注自己语言(无论是捷克语、匈牙利语、芬兰语,还是汉语方言、少数民族语言)在AI时代能否得到公平对待的人来说,这份研究报告提供了一个鼓舞人心的案例:语言的特殊性不必为了通用性而牺牲,只要方法得当,两者可以兼得。
有兴趣深入了解技术细节的读者,可以通过arXiv编号2604.10799查阅完整论文,原文提供了完整的实验数据、模型权重下载链接以及各项基准测试的详细分解数据。
---
Q&A
Q1:Bielik v3 PL模型和普通的多语言AI模型有什么区别?
A:普通的多语言模型使用一套覆盖几十种语言的通用分词器,在处理波兰语时往往需要把一个单词切成多个碎片,效率较低。Bielik v3 PL系列专门为波兰语定制了APT4分词器,在词汇表规模相近的情况下,每个波兰语单词平均只需1.62个词片,而通用方案需要3.22个。这意味着在相同的处理资源下,模型能处理的波兰语内容接近翻倍,推理速度更快,使用成本更低。
Q2:FOCUS方法是如何帮助模型在换分词器时不"忘记"已学知识的?
A:FOCUS的思路是为新词汇表里的每一个词片,在旧词汇表中找出语义上最相近的一组词片,然后把这些旧词片对应的知识向量加权混合,作为新词片的初始知识。相当于新字典里的每个词条都从旧字典里继承了相关的知识积累,而不是从空白开始。研究表明,与随机初始化、线性变换等方案相比,FOCUS在训练初期的损失更低,收敛更稳定,最终模型表现也更好。
Q3:替换分词器后,Bielik v3 PL模型的英语能力受到影响了吗?
A:影响非常轻微。在英语Open LLM Leaderboard上,11B的PL版本平均得71.49,原版得72.45,差距不到1分。7B的PL版本得67.63,甚至略高于原版7B的66.60。这说明专门为波兰语优化的分词器和训练流程,并没有明显损害模型在英语上的能力,整体方案实现了波兰语效率提升与英语能力保留的双赢。