苹果发布SimpleDesign:跳过中间层,一个端到端模型同时生成蛋白质序列和结构

来源:互联网 时间:2026-09-13

苹果机器学习研究团队最近发表了一个叫SimpleDesign的模型,论文登在《Transactions on Machine Learning Research》上,预印本也已公开。它要解决的问题是蛋白质协同设计——同时给出氨基酸序列和对应的三维结构。这件事在药物、酶、抗体和生物材料的早期研发里都用得上。

目前主流做法是“两步走”:先训练一个自编码器,把连续的蛋白质三维结构压缩成离散的“结构标记”,再在这个压缩后的隐空间上训练生成模型。字节跳动Seed团队开源的DPLM-2、Meta的ESM3走的都是这条路。好处是成熟,代价是多出一个需要单独训练和调优的tokenization环节,整套流程也更难解释、更难部署。苹果团队提出的问题很直白:这两步非得有吗?

SimpleDesign的答案是直接走。它是一个标准的多模态Transformer:氨基酸序列以离散标记输入,三维结构用连续的Cα原子坐标直接表示,离散部分的交叉熵目标和连续部分的回归目标合并到同一个训练目标里,单阶段端到端训练。为了让一个模型学会多个任务,训练时同时对两边加扰动——序列做随机遮盖,结构坐标加高斯噪声,并且系统性地调整两边的损坏比例:结构损坏重而序列基本完整时,模型学的是折叠;结构清晰而序列被大量遮盖时,学的是逆折叠;两边都部分损坏时,学的就是协同设计。

训练数据超过200万组序列-结构对,主要来自AFESM数据集,它是基于AlphaFold数据库对已知蛋白质家族的预测结构做扩充得到的。在计算机评估中,SimpleDesign在协同设计、结构生成和无条件序列生成三类基准上都取得了与现有先进模型相当的成绩;结构方面产出的骨架在RMSD、pLDDT等指标上表现稳定,序列质量不输多数多模态模型。研究者的说法是,在更简单的训练流程下达到了这个水平。

这项工作的脉络很清楚。2025年9月,同一个团队发表过SimpleFold,用流匹配加通用Transformer块直接从序列预测三维结构,绕开了AlphaFold那类计算上更重的方法。SimpleDesign是把同样的极简思路从“预测结构”扩展到“双向生成”。作者包括Jiarui Lu、Yuyang Wang、Yizhe Zhang、Jiatao Gu、Navdeep Jaitly、Joshua M. Susskind、Miguel Ángel Bautista等。

必须说清的边界:所有评测都停留在计算机模拟阶段,生成的蛋白质没有经过湿实验验证,是否真能折叠、是否有功能、在生物体内是否安全,都还没有答案。团队把“与实验团队合作验证5到10个设计蛋白”列为下一步关键工作。看这类成果时,把“模型算得漂亮”和“实验里管用”分开看,能省掉很多误判。对做AI应用的开发者来说,这件事真正的启发在方法层面——当某个领域长期依赖专门架构时,值得回头问一句:通用架构加上足够的数据和合适的目标函数,是不是也能到同一个位置。

相关文章

A5创业网 版权所有

返回顶部