ICML 2026|DNA大模型不止于LLM,湖南大学OpticalDNA开启视觉理解新范式

作者 | 论文团队
编辑丨ScienceAI

近年来,DNA Foundation Model 已成为人工智能与生命科学交叉领域最活跃的研究方向之一。

从 DNABERT、Nucleotide Transformer、HyenaDNA,到最新的 Evo、AlphaGenome,越来越多的工作开始借鉴大语言模型(LLM)的技术路线:将 DNA 序列表示为 token,并通过 Transformer、状态空间模型(State Space Model)等架构学习超长序列中的上下文关系。过去几年,这一路线不断推动模型上下文长度和预测能力的提升,也逐渐成为当前 DNA 大模型最主流的建模范式。

不过,随着模型开始处理数十万乃至全基因组尺度的输入,一个新的问题逐渐浮现:除了沿着序列逐步建模,是否还存在一种更符合基因组稀疏、区段化和超长特征的表示方式?

近期,湖南大学/岳麓山实验室曾湘祥教授团队提出了一种新的基因组视觉建模框架 OpticalDNA。不同于现有工作继续沿着序列建模方向优化,OpticalDNA 借鉴 OCR(Optical Character Recognition)的思想,将 DNA 从一维字符序列重新组织为可阅读、可定位、可检索的视觉文档,探索了一条新的基因组基础模型技术路线。相关论文《Rethinking Genomic Modeling Through Optical Character Recognition》被人工智能国际顶级会议 ICML 2026 接收。

论文地址:https://arxiv.org/abs/2602.02014

代码地址:https://hongxinxiang.github.io/projects/OpticalDNA/

为什么 DNA 大模型几乎都在借鉴 LLM?

过去几年,大语言模型取得突破后,一个十分自然的想法是:既然 DNA 序列是由 A、T、C、G 四种字符组成,那么是否也可以像自然语言一样进行建模?

于是,大多数 DNA Foundation Model 都遵循了一套相似的建模流程:

  • 将 DNA 划分为 token;

  • 采用 Transformer 或状态空间模型进行顺序建模;

  • 学习长距离上下文表示;

  • 利用预训练表示完成各种下游任务。

这种技术路线取得了显著成功,也推动 DNA Foundation Model 快速发展。但是,它同时也继承了自然语言建模的一些基本假设:模型需要按照序列顺序逐步阅读整条 DNA。

随着模型不断扩展到超长序列,这种假设开始面临新的挑战。

一个容易被忽略的问题:

自然语言和基因组,真的具有相同的信息组织方式吗?

过去几年,DNA Foundation Model 的快速发展,很大程度上受益于自然语言模型的发展经验。但一个经常被忽略的问题是:自然语言和真实基因组,真的具有相同的信息组织方式吗?

对于自然语言而言,语义通常沿着句子连续展开,逐词阅读即可逐步理解全文。然而,真实基因组却呈现出完全不同的组织特点(图 1)。

首先,信息极其稀疏(Sparse)。真正决定基因表达、调控和复杂性状的功能区域,仅占整个基因组的一小部分,而大量背景区域的信息密度较低。

其次,功能具有明显的区域性(Region-centric)。生物学研究更关注启动子、增强子、剪接位点等功能片段,而不仅仅是连续的字符序列。

更重要的是,基因组存在广泛的长距离互作(Long-range Interaction)。相距数十万甚至数百万碱基的调控元件,仍可能共同调控同一个基因,这意味着理解基因组不仅需要局部建模,还需要建立跨区域的信息关联。

换句话说,人们真正关心的,并不仅仅是预测结果,更希望知道模型关注了哪里(Where),以及这些区域为什么重要(Why)。

一个更加直观的比喻是:人类阅读论文时,会先浏览标题、摘要和图表,再快速定位真正重要的章节;而今天的大多数 DNA 大模型,却仍然需要从第一个碱基开始,依次处理到最后一个碱基。

因此,真正值得重新思考的,也许不是模型规模,而是:是否存在一种更符合基因组自身结构特点的建模方式?

图 1 自然语言和基因组信息组织方式差异: 自然语言的语义沿着文本连续展开,而真实基因组的重要信息却分散在超长序列中的少数功能区域,并通过长距离调控共同决定生物学功能。

OpticalDNA:

让 AI 第一次像「阅读文档」一样理解 DNA

针对上述问题,OpticalDNA 并没有继续优化顺序建模,而是提出了一个新的视角:Genome as Document。

也就是说,基因组不仅可以表示为一维字符序列,也可以组织为一份可阅读、可定位、可检索的长文档(图 2)。

图 2 OpticalDNA 将超长基因组重新组织为可阅读的视觉文档:OpticalDNA 首先将 DNA 排版为多页文档(DNA Documents),再划分为具有空间位置的视觉 Patch,并利用视觉编码器学习区域级表示。

整体来看,OpticalDNA 可以概括为四个关键设计(图 3)。

(1)视觉化 DNA 表示

模型首先把 DNA 序列按照固定规则渲染成结构化页面。每个碱基不仅被写进页面中,还保留与原始基因组坐标之间的映射关系。这样一来,模型在图像中找到的重要区域,可以再精确映射回基因组位置。

(2)理解驱动的压缩

与其对所有碱基平均处理,OpticalDNA 更强调「面向理解的压缩」。视觉编码器把页面压缩成紧凑的视觉词元(visual tokens),既减少长序列建模的有效 token 数,又尽量保留关键区域的信息。

(3)OCR 风格的预训练任务

团队不是只让模型做简单分类,而是设计了一套更接近真实分析流程的任务,包括:整页读取、区域定位、区域内读取、缺失片段补全、子序列检索,以及全局分类等。这样模型学到的不只是「看过」,而是「读懂、定位、检索、补全」。

(4)多页融合与提示驱动输出

对于超长基因组,单页无法容纳全部内容,因此方法引入多页融合模块,将不同页面的信息汇总,再由解码器根据不同任务输出结果。这使得 OpticalDNA 既可以做基础识别,也可以胜任下游功能预测和区域解释。

图 3|OpticalDNA:让 AI 像阅读文档一样理解基因组。整个框架包含三个关键部分。首先(a),将超长 DNA 重新组织为具有空间布局的多页文档,并利用视觉编码器学习区域级表示;随后(b),借鉴 OCR 任务设计阅读、定位、检索、补全等六类文档理解任务,使模型学习「怎么看基因组」;最后(c),结合多页信息融合与任务指令,实现统一的基因组推理框架。

阅读方式的改变,带来了哪些提升?

OpticalDNA 的优势不仅体现在单个任务,而是在「长距离建模、跨物种泛化、全基因组预测、可解释性和效率」多个维度上都表现突出。

(1)长距离 eQTL 任务上表现领先

在 DNA LongBench 的 eQTL 任务中,OpticalDNA 获得了很强的 AUROC 表现,同时仅需更少的有效 token 数。这说明视觉化压缩并没有牺牲建模能力,反而在长距离序列理解中体现出了优势。

表 1 不同模型在长距离 eQTL 任务比较

(2)RiceSubBench:跨亚种泛化更稳健

在水稻亚种泛化实验中,OpticalDNA 不仅在域内表现良好,在分布外(far-OOD)场景下也具有更好的鲁棒性,说明模型学到的表示不是死记某个参考序列,而是具有更强迁移能力。

表 2 主流模型在水稻亚种泛化实验中表现

(3)RiceWGBP:全基因组表型预测更实用

对约 4 亿碱基的完整水稻基因组做表型预测时,OpticalDNA 不仅预测误差更低,而且单个基因组的推理时间是主流模型推理时间的 3~25 倍。做到了又快又准。

表 3 RiceWGBP 全基因组表型预测结果

(4)可解释性更强

通过 Grad-CAM 等方法,研究者发现模型高贡献区域能够落在有生物学意义的局部片段上。换句话说,OpticalDNA 不只是给出一个「黑箱预测分数」,还能够在一定程度上回答「模型到底看了哪里」。

图 4 OpticalDNA 的 Grad-CAM 可解释性结果

模型能够为每个 DNA 页面生成热力图,并计算页面级重要性分数,从而判断哪些页面和局部区域对最终预测贡献更大。结果显示,模型关注区域并非均匀分布,而是集中在短而连续的序列片段上;在剪接位点识别案例中,高响应区域与已标注的供体剪接位点明显重合。OpticalDNA 可以提供「重要页面 — 关键区域 — 基因组位置」的解释链。

结语:从「语言建模」到「视觉建模」

OpticalDNA 的意义,也许不仅仅在于提出了一个新的 DNA Foundation Model。更重要的是,它提供了一种新的思考方式:过去几年,DNA Foundation Model 更多借鉴了自然语言的发展路径;而 OpticalDNA 尝试进一步借鉴计算机视觉领域的发展经验,将 OCR 的阅读、定位、检索与区域理解能力引入基因组建模。

它并不是对语言建模范式的否定,而是在此基础上,探索一种更符合超长基因组结构特点的视觉建模范式。

如果说过去的问题是:如何让 AI 读懂更长的 DNA?

那么 OpticalDNA 更进一步提出了另一个问题:除了像阅读自然语言一样理解 DNA,AI 是否还能像阅读一份文档一样理解整个基因组?

这项工作给出的答案是:

可以,而且这种新的视觉建模思路,为超长基因组分析、可解释建模以及全基因组智能理解提供了一条值得探索的新方向。

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询