RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling
作者: Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu
分类: cs.LG, q-bio.GN
发布日期: 2026-08-24
备注: 21 pages, 5 figures
💡 一句话要点
提出RIBOSPAN以解决长序列RNA建模问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: RNA建模 长序列建模 双向自注意力 单核苷酸标记化 全长mRNA设计 表示学习 深度学习
📋 核心要点
- 现有RNA基础模型的上下文长度限制,导致无法有效建模全长RNA,尤其是在单核苷酸分辨率下。
- RIBOSPAN通过引入双向自注意力机制和单核苷酸标记化,支持高达10,240 nt的上下文长度,提升RNA建模能力。
- 实验结果显示,RIBOSPAN在多种RNA类型上表现出色,尤其在长RNA的表示质量上具有明显优势。
📝 摘要(中文)
全长RNA,特别是信使RNA,通常超过现有RNA基础模型的预训练上下文长度,限制了单核苷酸分辨率下的完整转录本建模。我们提出RIBOSPAN,一个具有16.1亿参数的双向RNA基础模型,原生预训练上下文长度可达10,240 nt。RIBOSPAN结合了密集的双向自注意力、单核苷酸标记化和注意力隔离序列打包,能够高分辨率建模完整的长RNA。通过核苷酸重建、受控长上下文表示基准和冻结RNA类型表示分析评估模型。原生10K预训练在10,240个标记下保持强重建能力,而在40%掩蔽下的继续预训练在重度损坏下改善恢复,同时保持表示质量。长上下文基准进一步表明,原生10K模型保持强上下文响应性和上下文特定表示分离,同时保持扰动引起的表示变化高度局部化。
🔬 方法详解
问题定义:本论文旨在解决现有RNA基础模型在长序列建模中的局限性,特别是上下文长度不足导致的完整转录本建模困难。现有方法无法有效处理超过预训练上下文长度的全长RNA,限制了单核苷酸分辨率的应用。
核心思路:RIBOSPAN的核心思路是通过密集的双向自注意力机制和单核苷酸标记化,结合注意力隔离序列打包,来实现对长RNA的高分辨率建模。这种设计使得模型能够处理更长的上下文,提升了RNA序列的表示能力。
技术框架:RIBOSPAN的整体架构包括多个模块:首先是双向自注意力层,用于捕捉长距离依赖;其次是单核苷酸标记化,确保细粒度的序列表示;最后是注意力隔离序列打包,优化了长序列的处理效率。
关键创新:RIBOSPAN的主要创新在于其能够原生支持10,240 nt的上下文长度,显著提升了RNA建模的精度和效率。这一特性使其在处理长RNA时,表现出比现有模型更强的上下文响应性和表示分离能力。
关键设计:在模型设计中,RIBOSPAN采用了1.61亿参数的双向结构,结合40%掩蔽的继续预训练策略,以改善在重度损坏情况下的恢复能力。此外,模型在冻结表示评估中展现出最先进的RNA表示质量,特别是在长RNA的表现上具有明显优势。
🖼️ 关键图片
📊 实验亮点
实验结果表明,RIBOSPAN在多种RNA类型上实现了最强的整体性能,特别是在长RNA的表示质量上,显著优于现有基线模型。原生10K预训练在10,240个标记下保持强重建能力,且在40%掩蔽下的继续预训练显著改善了模型在重度损坏情况下的恢复能力。
🎯 应用场景
RIBOSPAN的研究成果在RNA序列分析、全长mRNA设计和优化等领域具有广泛的应用潜力。其高分辨率建模能力可用于基因表达研究、药物开发以及合成生物学等多个领域,推动RNA相关研究的深入发展。
📄 摘要(原文)
Full-length RNAs, particularly messenger RNAs, often exceed the context lengths used to pretrain existing RNA foundation models, limiting complete-transcript modeling at single-nucleotide resolution. We present RIBOSPAN, a 1.61-billion-parameter bidirectional RNA foundation model natively pretrained with context lengths up to 10,240 nt. RIBOSPAN combines dense bidirectional self-attention, single-nucleotide tokenization, and attention-isolated sequence packing to enable high-resolution modeling of complete long RNAs. We evaluate the model through nucleotide reconstruction, a controlled long-context representation benchmark, and frozen RNA-type representation analysis. Native 10K pretraining preserves strong reconstruction at 10,240 tokens, while continued pretraining with 40% masking improves recovery under heavy corruption while preserving representation quality. The long-context benchmark further shows that native 10K models maintain strong contextual responsiveness and context-specific representation separation while keeping perturbation-induced representation changes highly localized. Inference-time YaRN scaling recovers much of the contextual organization lost by direct extrapolation of short-context models, but induces substantially greater distal representation diffusion. Frozen-representation evaluations further demonstrate state-of-the-art RNA representation quality, with RIBOSPAN achieving the strongest overall performance across diverse RNA types and retaining a clear advantage on long RNAs. Building on the same backbone, we develop a multidimensionally conditioned discrete-diffusion framework for full-length mRNA generation and redesign, including synonymous-codon diffusion for protein-preserving CDS optimization. Together, RIBOSPAN establishes a powerful long-context foundation for transferable RNA representation learning and full-transcript mRNA design.