基因组语言模型生成新型噬菌体:AI驱动自然进化之外的生物设计
这次不是图像模型,也不是语音克隆,而是把大语言模型那套思路直接搬到了基因组上。斯坦福大学等团队发表在 Science 上的工作,用基因组语言模型生成了一类自然界里不直接存在的新型噬菌体。它真正的意义不在“又验证了一个模型”,而在于模型生成的 DNA 序列,经过实验室合成和生物学功能验证,确实表现出噬菌体应有的感染能力。
这个工作的核心卖点很清晰:让 AI 在“自然进化”之外寻找可用的基因组序列空间。传统噬菌体改造靠诱变、筛选、定向进化,本质上还是在自然序列附近打转;而基因组语言模型学到的分布,让它有机会生成与已知天然噬菌体差异明显、但依然具备生物学功能的新序列。这等于把“阅读理解 DNA 语言”和“写出新的 DNA 句子”这两件事放在同一个框架里完成。
本文会从技术角度拆解这几件事:基因组语言模型如何理解 DNA 序列、模型怎么生成新型噬菌体基因组、生成结果如何通过实验验证、“自然进化之外”这个说法到底该怎么理解,以及这类 AI for Science 工作的门槛和边界在哪里。如果你关心大模型在生命科学领域的落地,或者想评估这类工作对自己的研究方向有没有参考价值,这篇可以直接读完。
1. 核心信息速览
| 维度 | 信息 |
|---|---|
| 研究主体 | 斯坦福大学等团队,合作单位以论文作者列表为准 |
| 发表平台 | Science,具体以最终文献信息为准 |
| 研究主题 | 利用基因组语言模型生成新型噬菌体,探索自然进化之外的生物设计 |
| 技术关键词 | 基因组语言模型、DNA 序列生成、噬菌体设计、序列-功能验证 |
| 研究对象 | 噬菌体基因组序列 |
| 输入/输出 | 输入参考基因组或序列上下文,输出可合成的 DNA 序列 |
| 验证方式 | 序列生成 + 功能预测筛选 + 实验室合成与感染验证 |
| 核心卖点 | 生成与天然噬菌体基因组有显著差异、但仍具备功能的序列 |
| 计算门槛 | 模型预训练对算力有一定要求,但下游生成和推理属于常规大模型负载 |
| 湿实验门槛 | 高。需要合成生物学、微生物学实验平台完成功能验证 |
| 适用读者 | 大模型研究人员、合成生物学家、AI for Science 方向开发者 |
需要说明的是,论文的完整模型参数、数据规模、具体生成策略细节,要查原文补充。这里的速览表只保证信息口径和公开标题一致。
2. 为什么偏偏选噬菌体做基因组语言模型的设计对象
不是所有物种都适合拿来做“序列生成 + 功能验证”这个闭环。噬菌体有几个天然优势,让它成为基因组语言模型最合适的验证对象之一。
第一,噬菌体基因组小。常见的噬菌体基因组从几千碱基到几十万碱基不等,远小于细菌和真核生物基因组。序列长度可控,意味着模型不需要处理超长上下文,生成的完整基因组也能在实验室里直接合成和组装。如果用真核生物基因组做对象,光是几亿碱基的序列生成和合成成本就基本不可行。
第二,噬菌体的序列-功能关系相对集中。噬菌体感染宿主的过程,主要依赖衣壳蛋白、尾丝蛋白、裂解酶等少数几个关键功能模块。功能模块少,意味着模型生成序列后,验证“它是不是一个能工作的噬菌体基因组”有相对明确的检查点:是否能表达完整颗粒、是否能吸附宿主、是否能注入遗传物质、是否能裂解宿主。每一步都有可量化的实验指标。
第三,噬菌体有直接的应用价值。噬菌体疗法是抗生素耐药背景下被反复讨论的方向,特异性感染细菌而不感染人类细胞,使新型噬菌体本身就有潜在临床价值。如果生成出来的新型噬菌体具备裂解特定病原菌的能力,这就是一个既验证模型、又有转化前景的结果。
所以选择噬菌体不是随机挑了个研究对象,而是综合考虑了序列规模、实验可验证性、功能模块复杂度和社会应用价值之后的结果。这个选择本身,就是这类工作能闭环的关键前提。
3. 基因组语言模型的基本思想
基因组语言模型的核心假设是:DNA 序列可以被当作一种“语言”来学习。自然语言里有单词、有语法、有语义;基因组里虽然没有空格和标点,但存在启动子、编码区、非编码调控元件、蛋白质结构域边界等具有功能含义的“词法”和“句法”单元。模型要做的就是在大规模基因组序列上,把这种隐含的规律学出来。
和自然语言模型相比,基因组语言模型有几个特殊点。
DNA 只有四种碱基 A、T、C、G,看起来比自然语言简单得多,但序列之间的功能约束极其复杂。一个碱基的替换可能完全不影响蛋白质序列,也可能导致蛋白结构崩溃。基因重叠、编码区和非编码区交织,让“词边界”的确定比自然语言困难得多。自然语言分词有明确的词表,基因组里没有天然的 token 边界,到底切多长、用什么策略切,本身就是一个影响模型能力的核心设计决策。
所以大多数基因组语言模型会采用类似 BPE 的 tokenization 思路,把频繁共现的 k-mer 片段合并成 token。这样做的好处是,模型可以同时看到短程的序列组成特征和长程的功能模块关联。下面是一个常见的序列 token 化流程示意:
在实际研究中,tokenizer 的词表大小、k-mer 切分方式、上下文长度,都会直接影响模型对基因组序列的理解能力。这类模型预训练任务也很多样,常见的是掩码语言建模或自回归下一 token 预测。无论哪种,本质都是让模型记住“什么样的序列组合在进化上是合理的”。
这里需要提醒一点:模型学到的是自然基因组序列的统计规律,不是生物学功能本身。它能判断一段序列“像不像天然噬菌体基因组”,但不直接知道这段序列能不能感染宿主。所以生成之后,还需要功能预测和湿实验验证来补齐“序列到功能”这一环。
4. 技术路线拆解:从预训练到新型噬菌体生成
从公开标题和这类研究的通用技术框架来看,整个流程可以分成四个层面:数据与预训练、序列生成、计算筛选、实验验证。下面逐个拆解。
4.1 数据与预训练
基因组语言模型训练需要大量高质量基因组序列。噬菌体方向通常会用到公共数据库中的噬菌体基因组、原核生物基因组,甚至更广泛的病毒基因组作为训练语料。数据质量决定了模型能力的上限,如果数据库里存在大量注释错误或组装错误的序列,模型学到的规律就会被污染。
预训练阶段的目标是让模型学会基因组的“语法”。这个阶段不需要标注数据,直接用序列本身做自监督学习。对于噬菌体这种基因组较小的对象,一个足够深的 Transformer 模型完全可以捕捉到编码区、启动子、终止子等功能元件的上下文关联。当然,模型规模、上下文长度、训练数据配比这些细节,不同团队会有不同选择,具体参数要以论文原文为准。
4.2 序列生成
生成阶段是决定“自然进化之外”这个目标能不能实现的关键。如果模型只是从训练数据里复制天然噬菌体片段,再重新组合,那它生成的序列本质上还是自然序列的重排,谈不上“进化之外”。真正的难点在于:让模型在保持功能约束的前提下,走向与天然序列有显著差异的区域。
自回归生成是当前的主流方案:
这里的 temperature 和采样策略会直接影响生成序列的新颖程度。temperature 过低,生成序列会贴近训练集的保守模式,功能成功率可能高,但新颖度不足;temperature 过高,序列会偏离自然分布,新颖度够了,但绝大部分会是无功能的随机序列。如何平衡这两者,是这类研究最核心的工程问题之一。
从这类研究的常见做法看,生成阶段往往不是一次采样就结束,而是会做多轮条件生成,在生成过程中引入序列长度约束、编码区完整性约束、GC 含量约束等条件,把搜索空间逐渐引导到“既新颖又可能可用”的区域。
4.3 计算筛选与打分
生成出来的候选序列数量通常很大,但能进入湿实验验证的只有极少数。中间必须经过计算筛选,筛掉明显不可行的候选。
筛选流程一般包括几个维度。第一是序列本身的基本合法性,比如有没有提前终止密码子、编码区是否完整、GC 含量是否在噬菌体可承受范围内。第二是功能预测,用已知的蛋白结构预测、功能域注释工具去检查关键蛋白是否保持可表达状态。第三是序列相似性评估,计算生成序列与已知天然噬菌体基因组的序列距离,用于量化“新颖程度”。
下面是一个筛选流水线的配置模板:
这个模板只是通用示意,实际项目里的阈值、数据库和过滤逻辑要按研究需求调整。它的作用是说明:生成序列不能直接用,必须经过层层计算筛选,才能把“看起来像基因组的序列”变成“值得花几十万合成验证的候选”。
4.4 湿实验验证闭环
计算筛选出的候选序列,最终要回到实验室验证。通常的路径是:化学合成候选基因组,组装到噬菌体载体或合成基因组骨架中,转入宿主菌,观察是否能形成有感染活性的噬菌斑。这一步是整个工作的金标准,也是成本最高、失败率最高的环节。
从这类研究的通用结果来看,计算预测和实际功能之间往往有很大差距。一个模型可能生成一千条序列,计算筛选后剩几十条,实验室合成后真正有活性的可能只有几条。但这恰恰是这类研究的价值所在:通过“生成-筛选-验证”的闭环,模型会一代比一代更懂得什么序列区域才是真正可用的功能空间。
5. 什么叫“自然进化之外的生物设计”
这个说法是整篇论文的题眼,值得单独解释清楚。
自然进化的本质是突变加选择。突变是随机的,选择是环境决定的。这个过程经历了几十亿年,但实际探索过的序列空间非常有限。一个长度为 10000 碱基的噬菌体基因组,理论上有 4 的 10000 次方种可能序列,这个数字比宇宙中的原子数量还要大。自然进化穷尽不了这个空间,人类用传统实验室进化也做不到。
基因组语言模型做的事情,是在学习过大量天然序列的基础上,找到那些“符合生物学约束但天然序列里不存在”的组合。它不是在自然序列上做简单突变,也不局限于单一亲本序列,而是把整个训练语料中分散的、关于噬菌体如何工作的规律重组成全新的序列组合。
所以“自然进化之外”应该从两个层面理解。
第一,序列层面。生成序列与任何已知噬菌体基因组的整体相似度较低,它不属于某个天然噬菌体的直接后代或简单变异,而是落在自然序列之间的空白区域。
第二,功能层面。虽然序列是新的,但功能仍然是噬菌体功能——能感染宿主、能复制、能裂解。这说明模型找到的不是“无效的随机序列”,而是“仍然符合生物物理和分子互作规律的新序列组合”。
这也是这类研究最让人兴奋的地方:它证明了序列空间里有大量没有被自然进化访问过、但同样能承担生物学功能的区域。这些区域,只有靠生成模型这种大规模搜索工具才可能触达。
当然,“自然进化之外”不等于“违反自然规律”。模型学习到的仍然是自然序列的统计规律,生成过程仍然受蛋白质折叠、密码子偏性、宿主互作等基本约束。更准确的说法是:它在自然进化给出的答案之外,重新组合出了同样有效的答案。
6. 对 AI for Science 的技术启发
这项工作的意义如果只停留在“噬菌体”这个对象上,价值就被低估了。它更像一个模板,展示了生成式 AI 在生命科学领域的一种通用研究范式:用大模型探索自然数据分布之外的可用空间。
这个范式有几个关键方法论可供参考。
第一,从“预测”走向“生成”。很多 AI 生物模型做的事情是预测:预测蛋白质结构、预测基因功能、预测突变致病性。生成模型则更进一步:它不只判断一段序列好不好,而是直接给出新的候选序列。预测是打分器,生成是设计器。在生物设计领域,生成能力意味着可以主动探索未知空间,而不是被动评估已知样本。
第二,计算与湿实验的闭环迭代。生成模型在实验验证后拿到反馈,再优化生成策略,这个过程可以反复循环。每次循环都让模型更清楚序列空间中哪些区域是可用的。这个闭环效率决定了项目能走多远。
第三,小基因组对象是 AI 生物设计的理想试验田。噬菌体、质粒、启动子这类“小而完整”的遗传元件,序列短、功能可测、合成成本相对低,最适合用来验证生成模型的能力。在噬菌体上跑通的方法论,未来可以逐步推广到更大、更复杂的基因组设计。
不管是大模型团队想切入生命科学,还是合成生物学家想引入 AI 方法,这类工作提供的都不是某个具体模型,而是一套可复用的协作路径。
7. 局限与挑战:生成序列离“可用”还有多远
站在技术角度看,这样工作迈出了重要一步,但离大规模实用化还有明显距离,几个短板值得关注。
计算预测的精度仍是最大瓶颈。基因组语言模型擅长生成“看起来合理”的序列,但“看起来合理”到“实际有功能”之间,隔着大量实验室才能回答的问题。蛋白质能否正确折叠、包装信号是否被正确识别、感染宿主时能否逃过宿主防御机制,这些光靠序列统计规律很难准确预测。如果生成十亿条序列只能筛出十条有活性的,实验成本就压不住。
数据偏差也是一层限制。基因组数据库里已知噬菌体序列,本身是自然进化留下来的“成功样本”,但只是全部可能成功序列里的极小一部分。模型在训练数据上拟合,会倾向于生成与已知序列分布相近的序列,这会限制它探索真正“偏远”的功能序列区域。如何让模型在保持功能的同时敢于偏离训练分布,依然没有标准答案。
序列长度和结构复杂度也是天花板。噬菌体基因组相对简单,但真实生物体基因组里存在大量复杂的染色质结构、表观调控、多基因互作网络。这些特征很难在目前的基因组语言模型中建模。从生成噬菌体到生成更复杂物种的基因组,中间还有本质性的方法障碍。
还有一层容易被忽视的问题是合成成本。即使是小基因组,从头合成并验证一条候选序列,成本也远高于普通计算实验。这决定了计算筛选环节的价值:筛得越准,实验成本越低。未来这个方向的竞争力,很大程度上取决于计算筛选模型的精度。
8. 生物安全与合规使用边界
这类工作涉及的序列生成能力,必须放在明确的生物安全框架下讨论。AI 生成基因组序列的能力越强,合规边界就越重要。
研究团队在发表这类成果时,通常需要经过机构生物安全委员会和伦理委员会审查,确保生成序列不会用于制造具有潜在危害的病原体。作为读者和研究参考者,我们也应该建立同样的意识:大模型生成生物序列的能力,是研究工具,不是随意使用的玩具。
具体来说,涉及噬菌体、病毒、病原菌相关序列生成时,要注意这几个方向。一是使用公开数据库和合法获取的数据,不触碰未授权样本。二是合成和功能验证必须在具备资质的实验室完成,遵守所在国家和机构的生物安全法规。三是生成序列不能直接用于制造或改造危险病原体,不能绕过监管把序列交给不具备资质的第三方。四是面向临床或商业应用时,必须完成完整的毒力评估、安全性测试和伦理审批。
如果打算跟进这个方向,建议先建立一套清晰的合规评审流程,再开始算实验和湿实验。技术能力边界和合规边界,两者必须同时守住。
9. 对研究者和工程师的启发:如何跟进这类工作
如果你关注这个方向,或者想在自己的研究里引入基因组语言模型,下面几个经验值得记住。
第一,不要一开始就追求“完整基因组生成”。可以先从启动子设计、蛋白质编码序列优化、小型调控元件设计这些更可控的任务入手。任务规模越小,功能验证越容易,模型设计迭代也越快。在噬菌体完整基因组生成之前,一定有一个逐步放大任务规模的过程。
第二,计算生成和实验验证一定要尽早结对。很多 AI 团队做序列生成只停在计算层面,生成一堆序列,却没有任何湿实验验证能力,最终无法判断模型好坏。如果条件不允许自建实验平台,就找靠谱的合成生物学实验室合作,让验证反馈成为模型改进的输入。
第三,重视生成策略中的“新颖度-功能度”平衡。这是整个系统的核心超参数。可以用序列相似度作为新颖度的度量,用功能预测模型或湿实验成功率作为功能度的度量,两者画成帕累托曲线,观察不同参数下生成的分布变化。这类分析本身,就是一篇很有价值的方法学文章。
第四,把数据、特征、生成结果全部工程化沉淀。基因组语言模型项目涉及的数据类型很杂:训练用的基因组序列、注释信息、筛选打分、湿实验反馈。没有一套清晰的目录管理和版本管理,项目越往后越难复盘。
一个典型的候选序列记录结构可以长这样:
这种记录方式,让每一条生成序列都可以追溯到生成参数、计算筛选结果和实验状态。只要实验闭环持续跑下去,这个数据集本身就是团队最核心的资产。
10. 总结与下一步
这篇文章的核心价值不在于“AI 生成了噬菌体”这个新闻点,而在于它验证了一套可以复制的方法:用基因组语言模型在自然进化覆盖范围之外,找到仍然具有生物学功能的序列区域。这对合成生物学和 AI for Science 都有方向性的意义。
最值得关注的验证环节是:生成序列是否真的通过了实验室感染功能验证,以及与已知天然噬菌体的差异程度到底有多大。这两个数据,决定了这项工作的成色。
最容易踩的坑则是过度解读“进化之外”这个概念。生成序列仍然是生物学规律约束下的产物,不是凭空跳出自然法则。它探索的是自然进化尚未覆盖的序列空间,不是违反生物学基本定律的序列空间。
后续值得继续关注的方向有几个:生成模型向更长基因组扩展的能力、计算筛选精度的提升、生成序列在噬菌体疗法中的真实应用效果,以及这套方法在细菌、真菌等更大基因组设计上的迁移能力。如果你对 AI 驱动的生物设计感兴趣,可以从这篇开始,把它的方法、数据和验证路径梳理清楚,再考虑迁移到自己的研究方向上。建议收藏备用,后面需要对比基因组语言模型类工作时,这篇会是一个很好的对照锚点。