【文献分享】RNARL:强化学习驱动的RNA密码子多目标统一生成框架

发布时间:2026/10/4 22:22:24

【文献分享】RNARL:强化学习驱动的RNA密码子多目标统一生成框架 一、文章介绍信使RNAmRNA疫苗和疗法的成功如新冠疫苗彻底改变了疫苗研发范式其快速设计、灵活生产和高效免疫激活的优势使其成为未来疫苗和治疗药物开发的核心平台之一。然而由于遗传密码的简并性同一蛋白质序列可由大量不同的RNA序列编码这些同义RNA变体在翻译效率、结构稳定性和表达水平上可能存在显著差异。这些差异主要源于物种特异性密码子使用偏好和RNA二级结构特征。因此RNA密码子设计——即在保持蛋白质序列不变的前提下优化编码RNA序列——已成为实现疫苗效力和治疗效果最大化的关键策略。然而现有RNA密码子设计方法面临三大根本性挑战。第一长序列3,000 nt的高效处理和优化仍是关键瓶颈传统启发式搜索算法如LinearDesign虽然能在一定程度上平衡翻译效率和结构稳定性但随着序列长度增加搜索空间呈指数增长计算成本急剧上升。第二现有方法缺乏跨物种和跨RNA类型的泛化能力大多针对特定宿主如人类或特定RNA类型如线性mRNA设计难以适应多样化的应用场景。第三深度学习方法如基于LSTM的模型或预训练语言模型虽然能够实现高通量生成但受限于训练数据的天然分布生成的RNA序列往往无法超越天然序列的性能即缺乏“优化”能力而纯粹的优化算法虽然能产生性能优异的序列但计算代价高昂无法实现大规模设计。这种“生成-或-优化”的割裂范式从根本上限制了RNA序列设计的效率和性能天花板。为从根源上解决上述挑战Shenggeng Lin、Hong Tan及其合作者在Genome Biology上发表了题为“RNARL: reinforcement learning-driven unified generative framework for multi-objective RNA codon design”的研究论文提出了一个名为RNARL的强化学习驱动框架首次将序列生成与多目标优化深度统一。RNARL的核心思想是利用强化学习直接优化生成策略使生成模型在训练过程中根据预设的多目标设计标准如高翻译效率、高结构稳定性迭代精炼其生成策略从而直接产生满足设计目标的高性能RNA序列。该框架包含演员模型Actor和奖励模型Reward两大核心组件。演员模型基于混合专家MoETransformer架构以蛋白质序列为输入通过ESM-2蛋白质语言模型编码后经MoE Transformer生成候选RNA序列奖励模型则对生成的RNA序列进行多目标评分包括最小自由能MFE、密码子适应指数CAI、GC含量和未配对核苷酸比例。两者通过**组相对策略优化GRPO**算法进行联合训练——演员模型根据奖励信号不断调整策略以生成更高奖励的序列奖励模型则提供精确的质量评估形成一个“生成-评估-优化”的闭环。研究者构建了涵盖六个代表性物种人类、拟南芥、产黄青霉、莱茵衣藻、大肠杆菌、嗜热古菌和五种RNA类型mRNA、环状RNA、正链RNA、双链RNA、逆转录病毒RNA的多样化数据集全面验证了RNARL的泛化能力。实验结果表明RNARL在GC含量、CAI和未配对核苷酸比例等指标上均显著优于GEMORNA、LinearDesign、CodonTransformer等现有最优方法尤其是在多目标平衡方面展现出独特优势——CAI优化方法虽然能达到理论最大值1.0但会牺牲结构稳定性MFE升高而RNARL在保持高CAI的同时维持了更优的结构稳定性。RNARL成功处理了长达~3,900 nt的序列并在两种公开RNA疫苗专利序列HPV和EBV mRNA疫苗的优化中展现出优于专利序列的性能验证了其实际应用价值。RNARL在线平台Google Colab已对外开放无需编程即可使用。二、算法原理介绍RNARL的算法设计围绕“演员-奖励强化学习闭环 MoE Transformer架构 组相对策略优化”三个核心层次展开。一演员模型生成器。演员模型以蛋白质序列为输入输出编码该蛋白的RNA序列。架构上蛋白质序列首先通过ESM-2蛋白质语言模型650M参数编码为嵌入向量然后输入MoE Transformer。Transformer编码器采用8层隐藏维度768的结构MoE层包含6个专家每个token激活2个专家通过门控网络动态选择最适合当前序列特征的专家组合增强模型对不同蛋白质序列如富含丝氨酸的序列的适应性。输出层生成每个密码子位置的核苷酸概率分布通过采样生成RNA序列。为解决训练数据中序列长度的长尾分布问题RNARL采用长度感知分布采样LADS——按100个氨基酸为间隔分箱根据各箱序列数量反向校准采样权重使模型在训练中平等接触短、中、长序列有效提升长序列处理能力。二奖励模型评估器。奖励模型以RNA序列为输入通过可学习嵌入层和MoE Transformer编码后经全连接层输出质量分数。奖励分数定义为标准化MFE负值越小越稳定和CAI越高越高效的加权组合RewardWMFE×ScaledMFEWCAI×ScaledCAI\text{Reward} W_{\text{MFE}} \times \text{ScaledMFE} W_{\text{CAI}} \times \text{ScaledCAI}RewardWMFE​×ScaledMFEWCAI​×ScaledCAI其中WMFE2.0W_{\text{MFE}}2.0WMFE​2.0WCAI1.0W_{\text{CAI}}1.0WCAI​1.0ScaledCAI在CAI达到目标阈值0.8时截断为1.0以避免过度优化单一指标。这种设计使奖励模型能定量评估翻译效率和结构稳定性之间的平衡。三组相对策略优化GRPO。GRPO是RNARL的训练引擎。对每个输入蛋白质序列演员模型采样GGG个候选RNA序列组大小为4奖励模型计算每个序列的奖励值。在同一组内计算奖励均值和标准差将奖励标准化为优势函数A^(si,ai,j)R(si,ai,j)−μiσi\hat{A}(s_i, a_{i,j}) \frac{R(s_i, a_{i,j}) - \mu_i}{\sigma_i}A^(si​,ai,j​)σi​R(si​,ai,j​)−μi​​。优化目标是最大化LGRPO(θ)E[min⁡(ri,jA^i,j,clip(ri,j,1−ϵ,1ϵ)A^i,j)−β⋅KL(πθ∣∣πref)]\mathcal{L}_{\text{GRPO}}(\theta) \mathbb{E} \left[ \min \left( r_{i,j} \hat{A}_{i,j}, \text{clip}(r_{i,j}, 1-\epsilon, 1\epsilon) \hat{A}_{i,j} \right) - \beta \cdot \text{KL}(\pi_\theta || \pi_{\text{ref}}) \right]LGRPO​(θ)E[min(ri,j​A^i,j​,clip(ri,j​,1−ϵ,1ϵ)A^i,j​)−β⋅KL(πθ​∣∣πref​)]其中ri,jr_{i,j}ri,j​为当前策略与旧策略的概率比KL散度约束策略更新步长防止偏离参考策略过远。这种组内相对比较方式避免了绝对奖励值在不同蛋白质间的不可比性使训练更稳定高效。三、总结RNARL是一个基于强化学习的RNA密码子多目标统一生成框架通过演员-奖励模型闭环和GRPO算法将序列生成与多目标优化深度融合直接产生高性能RNA序列。其核心创新在于以强化学习打破传统的“生成-或-优化”割裂范式使生成模型在奖励信号驱动下迭代精炼策略实现翻译效率和结构稳定性的联合优化。RNARL在跨越六个物种和五种RNA类型的广泛验证中表现出卓越的泛化能力和长序列处理能力~3,900 nt并成功优化了公开RNA疫苗专利序列。该框架为RNA疫苗和核酸药物的理性设计提供了一个高效、通用且用户友好的计算平台有望加速高质量RNA序列的发现与开发。
延伸阅读

更多相关文章

2026/10/2 14:20:00

百万上下文多模态AI:长文档分析与跨模态理解的技术实现与应用

1. 项目概述:当AI模型开始“看”得更远最近在跟进大模型应用落地的项目时,我反复被一个核心问题困扰:如何让AI真正理解一份长达数百页的PDF合同、一个包含几十张图纸的工程包,或者一段长达数小时的会议录像?传统的文本…

2026/9/30 21:52:23

一个8年工作经验的程序员的畅谈Vibe coding

在AI飞速发展的今天,“Vibe coding”已成为主流开发模式。我在参与许多大厂的分享会后得知,有些大厂甚至推出了“古法编程”排行榜。这不禁让我思考:程序员的工作热情是否会随着AI的发展而日益消退?是否所有程序员都将变成可被替换…

2026/10/4 22:22:04

Python 入门第 0 章:环境准备与基础概念(0 基础 1 天搞定)

第 0 章 环境准备 & 基础概念推文导语:Python 入门第一步不是写代码,是搭好环境、搞懂底层基础概念,避免后面踩坑。计算机小白跟着做,一天完成,为后续所有章节铺路。一、Python 安装(推荐版本&#xff…

2026/10/4 22:22:04

Notepad++ x64免安装版实战:从解压到配置迁移的完整指南

简介:NotePad.x64免安装版是一款面向程序员及文本编辑者的免费源代码编辑器,无需安装即可解压运行,适合移动存储或临时工作环境。该64位版本优化了系统资源利用,支持C、Java、Python等多语言编辑,具备语法高亮、代码折…

2026/10/4 22:22:04

Notepad++ x64免安装版:从运行库依赖到配置隔离的完整指南

简介:NotePad.x64免安装版是一款面向程序员、学生及文本编辑爱好者的免费源代码编辑器,基于64位系统做了针对性优化,解压后即可直接运行,省去安装环节,特别适合放在U盘、移动硬盘或临时工作环境中使用。压缩包仅4.22MB…

2026/10/4 0:01:02

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/4 0:01:02

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑