星系知道的事,语言模型不知道的秘密

2019 年前后,AI 圈里有个说法悄悄流传开:大语言模型越训越大,能力越来越强,可没人真正说得清它脑子里到底在想什么。
研究者们发明了各种"探针"方法,想看看模型的隐藏层里到底藏着什么概念,这些概念是什么时候冒出来的,又是按什么顺序冒出来的。可这些研究有个致命的软肋。
语言这东西太复杂了。
你没法给"猫"这个概念和"哲学"这个概念标注一个客观的难度分数,也没法证明模型学会"因果关系"一定比学会"语法"更晚。语言里的知识网络纵横交错,没有一张标准答案摆在那里让你对答案。
这就好比你想检验一个学生是不是真的理解了历史,可历史本身就充满争议和多重解读,你连"正确答案"是什么都说不清楚,又怎么判断学生学得对不对。
这正是这篇论文想解决的问题。研究团队想到一个巧妙的办法:既然语言给不出标准答案,那就换一个有标准答案的领域来做实验。他们选中了天文学,具体来说是星系图像。
**为什么是星系图像**
星系研究已经积累了上百年,很多物理规律早就板上钉钉。比如一个星系的亮度和它的恒星质量之间是什么关系,这是写进教科书的常识。星系的红移(也就是它离我们有多远、宇宙膨胀让它的光谱怎么变化)和它的质量之间有没有关联,天文学家心里门儿清。
这意味着什么?
意味着如果你训练一个AI模型去学习星系图像,你可以提前知道:模型学会"从图像里读出星系亮度"应该是相对简单的任务,因为亮度几乎就是图像像素的直接反映;而学会"推算这个星系的恒星形成速率"则难得多,因为这需要模型综合多种间接线索做推理。
有了这把已知的"难度尺子",你就可以拿它去衡量AI模型的学习轨迹,看它学习的顺序对不对,学到的知识结构合不合理。这在语言模型身上是做不到的,因为你压根没有那把尺子。
造一个"看星系图像的GPT"
研究团队用的模型叫AstroPT。
AstroPT*:一个专门为星系图像设计的类GPT模型,由Smith等人在2024年提出,后来被欧几里得空间望远镜团队用于分析真实观测数据。
这个模型的设计思路很直接:把语言模型的套路原封不动搬到天文学上。
一张星系图片会被切成一小块一小块的图像补丁,就像拼图碎片一样,然后按照从中心向外螺旋展开的顺序排成一串。这一串补丁就变成了"句子",每个补丁就是一个"单词"。
补丁*:把一整张图像切割成的小方块,是视觉领域里对应文本"词元"的基本处理单位。
模型的训练方式也照搬语言模型:要么像GPT那样,根据前面的补丁去预测下一个补丁该长什么样(这叫自回归,简称AR);要么像BERT那样,把某些补丁遮起来,让模型根据上下文猜出被遮住的部分(这叫掩码自编码,简称MAE)。
自回归(AR)*:从左到右依次生成,每一步都基于前面已经出现的内容做预测,GPT系列用的就是这种方式。
掩码自编码(MAE)*:随机遮住输入的一部分,让模型学会用上下文补全缺失内容,BERT就是这个路子。
研究团队为什么要执着于让AstroPT长得像语言模型,而不是设计一个专门为天文学优化的架构?
论文里提到了一个叫"苦涩的教训"的观点,出自强化学习先驱理查德·萨顿:在AI领域,通用的、可扩展的架构往往最终会打败那些为特定任务量身定制的巧妙设计。与其绞尽脑汁给星系数据设计专属结构,不如老老实实用一个通用架构,然后靠数据和算力把它喂饱。
这就好比修路。你可以为每个村庄单独设计一条专属道路,弯弯绕绕正好避开每一棵树、每一块石头,短期看确实精巧;但如果哪天要修一条能连接全国的高速公路网,你会发现统一规格、标准宽度的路面反而更容易铺设、维护和扩展。语言模型的transformer架构就是这条"高速公路",用在图像上虽然一开始显得不那么量身定制,长期看却更容易复用已有的训练技巧和优化经验。
星系的秘密是怎么被泄露的
模型训练好之后,研究团队做的事情,说白了就是拿一个"读心术"工具,去窥探AstroPT的隐藏层里到底装了什么。
这个工具叫线性探针。
线性探针*:在冻结的模型隐藏层上,训练一个简单的线性模型(这里用的是岭回归)去预测某个目标变量,如果预测效果好,说明这个信息在隐藏层里是"可读取"的。
具体做法是,把星系图像喂给AstroPT,取出它某一层的隐藏状态(也就是模型内部对这张图的"理解"),然后用这个隐藏状态去线性拟合三个目标:星系的r波段星等(一种反映亮度的指标)、红移、以及比恒星形成率(一个衡量星系"造星"效率的指标)。
这三个目标恰好构成了一把难度递增的尺子。
r波段星等*:本质上就是星系在某个特定波长(红光波段)下的亮度测量值,几乎是从图像像素直接读出来的信息。
红移*:星系因宇宙膨胀而产生的光谱红移量,反映了它离我们有多远,通常需要综合多个波段的测光数据或光谱才能准确推算。
比恒星形成率(sSFR)*:单位恒星质量对应的恒星形成速率,是一个高度综合、需要多重物理推断才能得到的量。
结果出来了,而且相当整齐。
亮度这个指标,在训练刚开始没多久就能被探针以很高的准确率读出来,而且在模型的浅层(靠近输入的那几层)就能读出来。红移紧随其后出现,但要弱一些,需要更靠后的训练阶段和更深的网络层才能被较好地探测到。比恒星形成率则一直表现疲软,哪怕训练跑完一整个周期,探针的准确率依然不高。
这个顺序,跟天文学家凭经验知道的"难度排序"完全吻合。亮度最简单,红移中等,比恒星形成率最难。
更让人意外的是,这个顺序在换了训练目标之后依然纹丝不动。研究团队分别用自回归(AR)和掩码自编码(MAE)两种完全不同的训练方式跑了一遍,结果发现无论用哪种方式,亮度都是最先学会的,红移次之,比恒星形成率最难学会。这个顺序也不会随着模型变大而打乱,模型从100万参数扩大到1亿参数,探针的准确率整体在提升,但学习的先后顺序始终保持一致。
这说明了什么?
说明这个"由浅入深"的学习顺序,不是某种训练技巧带来的偶然结果,而是数据本身的内在结构决定的。星系图像里,亮度信息确实比比恒星形成率信息更容易被提取,这是刻在数据里的客观事实,任何一个足够聪明的模型,不管用什么方式训练,最终都会先学会简单的,再学会难的。
这就像小孩子学乐器。不管是跟着老师一句句模仿旋律,还是自己对着谱子摸索着弹,最终的学习顺序总是先学会认识音符和按对指法,再学会控制节奏,最后才是理解和表达乐曲的情感层次。教学方法可以千差万别,但技能本身内在的难度阶梯是没法跳过的。如果一上来就要求处理情感表达,而指法都没练熟,那种教学方式必然是低效甚至失败的。
探针指向的方向,藏着物理规律的密码
如果说前面的发现回答了"模型什么时候学会某个概念",那接下来这部分回答的是"模型是不是真的理解了这些概念之间的关系"。
这里的思路挺巧妙。每个线性探针在训练完成后,都会得到一个权重向量,这个向量指向隐藏空间里的某个方向。研究团队把这个方向叫做"探针方向",然后去比较不同物理量的探针方向之间的夹角,用余弦相似度衡量。
余弦相似度*:衡量两个向量方向接近程度的指标,取值从-1到1,数值越接近1说明两个方向越一致,越接近-1说明方向越相反,接近0说明两者基本无关。
为什么要看方向而不是看数值本身?
因为如果两个物理量在模型的"脑子"里是被绑在一起理解的,比如说"越亮的星系往往质量越大"这种关系,那么代表这两个量的探针方向应该是接近的,指向差不多的地方。如果模型把这两个概念完全割裂开来理解,方向就会八竿子打不着。
结果显示,亮度和恒星质量的探针方向高度对齐,这跟天文学常识完全一致:星系越亮通常意味着里面的恒星越多,质量自然越大。比恒星形成率和恒星质量的方向则是反着来的,这也符合已知的"主序关系",就是恒星形成率随质量增长得比较慢,导致单位质量的形成率反而随质量增加而降低。红移和恒星质量的方向是正向对齐的,这背后是一种观测选择效应:越远的星系看起来越暗,只有本身特别亮、特别重的星系才能被望远镜捕捉到,所以高红移样本里天然会偏向大质量星系。
这三组关系,模型全都精确复现了,没有一个方向搞反。
研究团队还多问了一个问题:模型是不是把"恒星质量"简单地理解成"亮度的另一种说法"?
他们设计了一个巧妙的检验。先用亮度去线性预测恒星质量,算出预测残差,也就是"实际质量减去亮度能预测的那部分质量"。如果模型只是把质量当成亮度的影子,那这个残差的探针方向应该还是跟亮度方向对得很齐。可实验结果是,残差方向和亮度方向几乎垂直,而且模型越大,这种垂直程度越明显。
这说明AstroPT没有偷懒,它没有把"质量"简化成"亮度乘以一个系数"这种取巧算法,而是真的学会了质量里那些亮度解释不了的部分,可能是恒星年龄、金属丰度、尘埃遮挡这些更精细的物理因素。
这就好比你去判断一个人的财富水平,如果只看他开的车,那车贵不代表人有钱,可能是贷款、租的,也可能是继承的祖产还没变现。一个真正理解"财富"这个概念的观察者,不会只盯着车这一个信号,还会去看房产、收入、负债这些车说明不了的部分。AstroPT在质量这件事上,展现出的正是这种"不偷懒"的理解方式,如果它真的偷懒了,残差方向早就该和亮度方向重合了,可它没有。
这套办法能给语言模型什么启发
说到这里,可能有人会问,星系图像和语言文本是两码事,这套结论真能用到大语言模型身上吗?
论文作者也很坦率地承认了这一点,星系不是语言,图像补丁也不是离散的词元,他们没有说"天文数据可以用来预训练更好的语言模型"这种话。
他们真正想表达的是另一件事:一个学习方式模仿语言模型的系统,拿到一个有已知标准答案的领域里训练和检验,能帮我们校准那些原本只能"盲测"的可解释性工具。
具体来说,这次实验验证了几件事,是可解释性研究者过去只能凭猜测、缺乏实锤证据的假设。
第一,概念确实是分批次、按难度顺序涌现的,不是眉毛胡子一把抓地同时冒出来。这个假设在语言模型里很难验证,因为你没法给"语法"和"常识推理"标一个客观的难度分数,但在星系数据里,这个假设被结结实实地证实了。
第二,训练目标(自回归还是掩码预测)不影响这个涌现顺序,说明这个顺序反映的是数据本身的结构,不是训练算法的怪癖。这对语言模型研究也有参考价值,如果换个训练目标概念涌现顺序就大变样,那说明这个"顺序"更像是算法带来的假象,而不是数据里的真实结构。
第三,线性探针读出来的方向不是随机噪声,它们真的编码了变量之间的物理关系,包括正相关、负相关,甚至更精细的"去除某个已知因素后的残差关系"。这给了"线性探针到底靠不靠谱"这个长期争议的问题一份来自天文学的正面证据。
当然,论文也诚实地列出了限制。分析目前只是相关性层面的,还没到能下因果结论的地步;星系的物理标签本身是通过其他天文模型间接推算出来的,不是绝对真值;训练只跑了一个epoch,模型规模也只测试到了1亿参数这个不算特别大的量级;线性探针能读出来的东西,终究只是隐藏空间里线性可分的那一部分,更复杂的、非线性缠绕在一起的知识结构,这套方法是看不见的。
在附录部分,研究团队还做了一个额外的因果验证实验,叫激活修补。
激活修补*:把一个样本在模型内部某一层的激活值,替换成另一个样本对应位置的激活值,观察下游的预测结果会不会跟着改变,如果改变了,说明这一层的激活确实携带着因果相关的信息,而不只是巧合的相关性。
他们找来一对星系,亮度相近但质量残差不同,把其中一个的中间层激活替换成另一个的,看模型是否会把预测结果朝着"被替换来源"的方向拉动。结果显示,这种定向修补的成功率明显高于随机对照组和打乱探针方向的对照组,说明这个残差信息不只是探针巧合读出来的表面相关,而是模型内部真实存在、并且会影响下游计算的因果结构。
Q&A
Q1:AstroPT是什么?
A:AstroPT是一个模仿大语言模型架构训练的星系图像分析模型,它把星系图片切成补丁序列,像处理文本词元一样用自回归或掩码预测的方式进行自监督训练。
Q2:为什么研究者要用星系数据来研究AI可解释性,而不是直接研究语言模型?
A:因为星系物理关系是天文学百年积累下来的已知常识,比如亮度和质量的关系、红移和质量的关系都有明确答案,这给了研究者一把语言模型完全没有的"标准答案尺子",可以精确验证探针方法是否真的读出了模型内部的真实结构。
Q3:这项研究发现模型学习星系概念有固定顺序吗?
A:有,亮度这种直接从像素能读出的信息最先被模型学会,且在浅层网络就能探测到;红移这种需要综合多波段信息推算的量学会得更晚更深;比恒星形成率这种高度间接推断的量则一直难以被稳定学会,这个顺序不随训练目标或模型规模的变化而改变。