基因组语言模型生成新型噬菌体:AI驱动自然进化之外的生物设计

基因组语言模型噬菌体设计DNA序列生成
于 2026-08-29 04:29:00 修改
·本内容遵循CC 4.0 BY-SA版权协议

这次不是图像模型,也不是语音克隆,而是把大语言模型那套思路直接搬到了基因组上。斯坦福大学等团队发表在 Science 上的工作,用基因组语言模型生成了一类自然界里不直接存在的新型噬菌体。它真正的意义不在“又验证了一个模型”,而在于模型生成的 DNA 序列,经过实验室合成和生物学功能验证,确实表现出噬菌体应有的感染能力。

这个工作的核心卖点很清晰:让 AI 在“自然进化”之外寻找可用的基因组序列空间。传统噬菌体改造靠诱变、筛选、定向进化,本质上还是在自然序列附近打转;而基因组语言模型学到的分布,让它有机会生成与已知天然噬菌体差异明显、但依然具备生物学功能的新序列。这等于把“阅读理解 DNA 语言”和“写出新的 DNA 句子”这两件事放在同一个框架里完成。

本文会从技术角度拆解这几件事:基因组语言模型如何理解 DNA 序列、模型怎么生成新型噬菌体基因组、生成结果如何通过实验验证、“自然进化之外”这个说法到底该怎么理解,以及这类 AI for Science 工作的门槛和边界在哪里。如果你关心大模型在生命科学领域的落地,或者想评估这类工作对自己的研究方向有没有参考价值,这篇可以直接读完。

1. 核心信息速览

维度 信息
研究主体 斯坦福大学等团队,合作单位以论文作者列表为准
发表平台 Science,具体以最终文献信息为准
研究主题 利用基因组语言模型生成新型噬菌体,探索自然进化之外的生物设计
技术关键词 基因组语言模型、DNA 序列生成、噬菌体设计、序列-功能验证
研究对象 噬菌体基因组序列
输入/输出 输入参考基因组或序列上下文,输出可合成的 DNA 序列
验证方式 序列生成 + 功能预测筛选 + 实验室合成与感染验证
核心卖点 生成与天然噬菌体基因组有显著差异、但仍具备功能的序列
计算门槛 模型预训练对算力有一定要求,但下游生成和推理属于常规大模型负载
湿实验门槛 高。需要合成生物学、微生物学实验平台完成功能验证
适用读者 大模型研究人员、合成生物学家、AI for Science 方向开发者

需要说明的是,论文的完整模型参数、数据规模、具体生成策略细节,要查原文补充。这里的速览表只保证信息口径和公开标题一致。

2. 为什么偏偏选噬菌体做基因组语言模型的设计对象

不是所有物种都适合拿来做“序列生成 + 功能验证”这个闭环。噬菌体有几个天然优势,让它成为基因组语言模型最合适的验证对象之一。

第一,噬菌体基因组小。常见的噬菌体基因组从几千碱基到几十万碱基不等,远小于细菌和真核生物基因组。序列长度可控,意味着模型不需要处理超长上下文,生成的完整基因组也能在实验室里直接合成和组装。如果用真核生物基因组做对象,光是几亿碱基的序列生成和合成成本就基本不可行。

第二,噬菌体的序列-功能关系相对集中。噬菌体感染宿主的过程,主要依赖衣壳蛋白、尾丝蛋白、裂解酶等少数几个关键功能模块。功能模块少,意味着模型生成序列后,验证“它是不是一个能工作的噬菌体基因组”有相对明确的检查点:是否能表达完整颗粒、是否能吸附宿主、是否能注入遗传物质、是否能裂解宿主。每一步都有可量化的实验指标。

第三,噬菌体有直接的应用价值。噬菌体疗法是抗生素耐药背景下被反复讨论的方向,特异性感染细菌而不感染人类细胞,使新型噬菌体本身就有潜在临床价值。如果生成出来的新型噬菌体具备裂解特定病原菌的能力,这就是一个既验证模型、又有转化前景的结果。

所以选择噬菌体不是随机挑了个研究对象,而是综合考虑了序列规模、实验可验证性、功能模块复杂度和社会应用价值之后的结果。这个选择本身,就是这类工作能闭环的关键前提。

3. 基因组语言模型的基本思想

基因组语言模型的核心假设是:DNA 序列可以被当作一种“语言”来学习。自然语言里有单词、有语法、有语义;基因组里虽然没有空格和标点,但存在启动子、编码区、非编码调控元件、蛋白质结构域边界等具有功能含义的“词法”和“句法”单元。模型要做的就是在大规模基因组序列上,把这种隐含的规律学出来。

和自然语言模型相比,基因组语言模型有几个特殊点。

DNA 只有四种碱基 A、T、C、G,看起来比自然语言简单得多,但序列之间的功能约束极其复杂。一个碱基的替换可能完全不影响蛋白质序列,也可能导致蛋白结构崩溃。基因重叠、编码区和非编码区交织,让“词边界”的确定比自然语言困难得多。自然语言分词有明确的词表,基因组里没有天然的 token 边界,到底切多长、用什么策略切,本身就是一个影响模型能力的核心设计决策。

所以大多数基因组语言模型会采用类似 BPE 的 tokenization 思路,把频繁共现的 k-mer 片段合并成 token。这样做的好处是,模型可以同时看到短程的序列组成特征和长程的功能模块关联。下面是一个常见的序列 token 化流程示意:

PYTHON
from transformers import AutoTokenizer
 
# 假设 tokenizer 是在大规模基因组语料上训练的
tokenizer = AutoTokenizer.from_pretrained("genomic-lm-tokenizer")
 
dna_sequence = "ATGCGTACGTTAGCTAGCTAGCTAGGATCC"
tokens = tokenizer(dna_sequence)["input_ids"]
print(tokens)

在实际研究中,tokenizer 的词表大小、k-mer 切分方式、上下文长度,都会直接影响模型对基因组序列的理解能力。这类模型预训练任务也很多样,常见的是掩码语言建模或自回归下一 token 预测。无论哪种,本质都是让模型记住“什么样的序列组合在进化上是合理的”。

这里需要提醒一点:模型学到的是自然基因组序列的统计规律,不是生物学功能本身。它能判断一段序列“像不像天然噬菌体基因组”,但不直接知道这段序列能不能感染宿主。所以生成之后,还需要功能预测和湿实验验证来补齐“序列到功能”这一环。

4. 技术路线拆解:从预训练到新型噬菌体生成

从公开标题和这类研究的通用技术框架来看,整个流程可以分成四个层面:数据与预训练、序列生成、计算筛选、实验验证。下面逐个拆解。

4.1 数据与预训练

基因组语言模型训练需要大量高质量基因组序列。噬菌体方向通常会用到公共数据库中的噬菌体基因组、原核生物基因组,甚至更广泛的病毒基因组作为训练语料。数据质量决定了模型能力的上限,如果数据库里存在大量注释错误或组装错误的序列,模型学到的规律就会被污染。

预训练阶段的目标是让模型学会基因组的“语法”。这个阶段不需要标注数据,直接用序列本身做自监督学习。对于噬菌体这种基因组较小的对象,一个足够深的 Transformer 模型完全可以捕捉到编码区、启动子、终止子等功能元件的上下文关联。当然,模型规模、上下文长度、训练数据配比这些细节,不同团队会有不同选择,具体参数要以论文原文为准。

4.2 序列生成

生成阶段是决定“自然进化之外”这个目标能不能实现的关键。如果模型只是从训练数据里复制天然噬菌体片段,再重新组合,那它生成的序列本质上还是自然序列的重排,谈不上“进化之外”。真正的难点在于:让模型在保持功能约束的前提下,走向与天然序列有显著差异的区域。

自回归生成是当前的主流方案:

PYTHON
import torch
 
def generate_phage_sequence(model, tokenizer, prompt_tokens, max_length=8192, temperature=0.85):
model.eval()
generated = prompt_tokens.copy()
 
with torch.no_grad():
for _ in range(max_length):
inputs = torch.tensor([generated])
logits = model(inputs).logits[:, -1, :]
probs = torch.softmax(logits / temperature, dim=-1)
next_token = torch.multinomial(probs, num_samples=1).item()
generated.append(next_token)
if next_token == tokenizer.eos_token_id:
break
 
return tokenizer.decode(generated)

这里的 temperature 和采样策略会直接影响生成序列的新颖程度。temperature 过低,生成序列会贴近训练集的保守模式,功能成功率可能高,但新颖度不足;temperature 过高,序列会偏离自然分布,新颖度够了,但绝大部分会是无功能的随机序列。如何平衡这两者,是这类研究最核心的工程问题之一。

从这类研究的常见做法看,生成阶段往往不是一次采样就结束,而是会做多轮条件生成,在生成过程中引入序列长度约束、编码区完整性约束、GC 含量约束等条件,把搜索空间逐渐引导到“既新颖又可能可用”的区域。

4.3 计算筛选与打分

生成出来的候选序列数量通常很大,但能进入湿实验验证的只有极少数。中间必须经过计算筛选,筛掉明显不可行的候选。

筛选流程一般包括几个维度。第一是序列本身的基本合法性,比如有没有提前终止密码子、编码区是否完整、GC 含量是否在噬菌体可承受范围内。第二是功能预测,用已知的蛋白结构预测、功能域注释工具去检查关键蛋白是否保持可表达状态。第三是序列相似性评估,计算生成序列与已知天然噬菌体基因组的序列距离,用于量化“新颖程度”。

下面是一个筛选流水线的配置模板:

JSON
{
"input_dir": "./generated_candidates",
"filter_rules": {
"min_sequence_length": 5000,
"max_sequence_length": 200000,
"gc_content_range": [30, 65],
"internal_stop_codons": 0,
"min_annotated_genes": 5
},
"distance_check": {
"threshold": 0.3,
"reference_db": "./phage_reference_db"
},
"output": "./filtered_candidates"
}

这个模板只是通用示意,实际项目里的阈值、数据库和过滤逻辑要按研究需求调整。它的作用是说明:生成序列不能直接用,必须经过层层计算筛选,才能把“看起来像基因组的序列”变成“值得花几十万合成验证的候选”。

4.4 湿实验验证闭环

计算筛选出的候选序列,最终要回到实验室验证。通常的路径是:化学合成候选基因组,组装到噬菌体载体或合成基因组骨架中,转入宿主菌,观察是否能形成有感染活性的噬菌斑。这一步是整个工作的金标准,也是成本最高、失败率最高的环节。

从这类研究的通用结果来看,计算预测和实际功能之间往往有很大差距。一个模型可能生成一千条序列,计算筛选后剩几十条,实验室合成后真正有活性的可能只有几条。但这恰恰是这类研究的价值所在:通过“生成-筛选-验证”的闭环,模型会一代比一代更懂得什么序列区域才是真正可用的功能空间。

5. 什么叫“自然进化之外的生物设计”

这个说法是整篇论文的题眼,值得单独解释清楚。

自然进化的本质是突变加选择。突变是随机的,选择是环境决定的。这个过程经历了几十亿年,但实际探索过的序列空间非常有限。一个长度为 10000 碱基的噬菌体基因组,理论上有 4 的 10000 次方种可能序列,这个数字比宇宙中的原子数量还要大。自然进化穷尽不了这个空间,人类用传统实验室进化也做不到。

基因组语言模型做的事情,是在学习过大量天然序列的基础上,找到那些“符合生物学约束但天然序列里不存在”的组合。它不是在自然序列上做简单突变,也不局限于单一亲本序列,而是把整个训练语料中分散的、关于噬菌体如何工作的规律重组成全新的序列组合。

所以“自然进化之外”应该从两个层面理解。

第一,序列层面。生成序列与任何已知噬菌体基因组的整体相似度较低,它不属于某个天然噬菌体的直接后代或简单变异,而是落在自然序列之间的空白区域。

第二,功能层面。虽然序列是新的,但功能仍然是噬菌体功能——能感染宿主、能复制、能裂解。这说明模型找到的不是“无效的随机序列”,而是“仍然符合生物物理和分子互作规律的新序列组合”。

这也是这类研究最让人兴奋的地方:它证明了序列空间里有大量没有被自然进化访问过、但同样能承担生物学功能的区域。这些区域,只有靠生成模型这种大规模搜索工具才可能触达。

当然,“自然进化之外”不等于“违反自然规律”。模型学习到的仍然是自然序列的统计规律,生成过程仍然受蛋白质折叠、密码子偏性、宿主互作等基本约束。更准确的说法是:它在自然进化给出的答案之外,重新组合出了同样有效的答案。

6. 对 AI for Science 的技术启发

这项工作的意义如果只停留在“噬菌体”这个对象上,价值就被低估了。它更像一个模板,展示了生成式 AI 在生命科学领域的一种通用研究范式:用大模型探索自然数据分布之外的可用空间。

这个范式有几个关键方法论可供参考。

第一,从“预测”走向“生成”。很多 AI 生物模型做的事情是预测:预测蛋白质结构、预测基因功能、预测突变致病性。生成模型则更进一步:它不只判断一段序列好不好,而是直接给出新的候选序列。预测是打分器,生成是设计器。在生物设计领域,生成能力意味着可以主动探索未知空间,而不是被动评估已知样本。

第二,计算与湿实验的闭环迭代。生成模型在实验验证后拿到反馈,再优化生成策略,这个过程可以反复循环。每次循环都让模型更清楚序列空间中哪些区域是可用的。这个闭环效率决定了项目能走多远。

第三,小基因组对象是 AI 生物设计的理想试验田。噬菌体、质粒、启动子这类“小而完整”的遗传元件,序列短、功能可测、合成成本相对低,最适合用来验证生成模型的能力。在噬菌体上跑通的方法论,未来可以逐步推广到更大、更复杂的基因组设计。

不管是大模型团队想切入生命科学,还是合成生物学家想引入 AI 方法,这类工作提供的都不是某个具体模型,而是一套可复用的协作路径。

7. 局限与挑战:生成序列离“可用”还有多远

站在技术角度看,这样工作迈出了重要一步,但离大规模实用化还有明显距离,几个短板值得关注。

计算预测的精度仍是最大瓶颈。基因组语言模型擅长生成“看起来合理”的序列,但“看起来合理”到“实际有功能”之间,隔着大量实验室才能回答的问题。蛋白质能否正确折叠、包装信号是否被正确识别、感染宿主时能否逃过宿主防御机制,这些光靠序列统计规律很难准确预测。如果生成十亿条序列只能筛出十条有活性的,实验成本就压不住。

数据偏差也是一层限制。基因组数据库里已知噬菌体序列,本身是自然进化留下来的“成功样本”,但只是全部可能成功序列里的极小一部分。模型在训练数据上拟合,会倾向于生成与已知序列分布相近的序列,这会限制它探索真正“偏远”的功能序列区域。如何让模型在保持功能的同时敢于偏离训练分布,依然没有标准答案。

序列长度和结构复杂度也是天花板。噬菌体基因组相对简单,但真实生物体基因组里存在大量复杂的染色质结构、表观调控、多基因互作网络。这些特征很难在目前的基因组语言模型中建模。从生成噬菌体到生成更复杂物种的基因组,中间还有本质性的方法障碍。

还有一层容易被忽视的问题是合成成本。即使是小基因组,从头合成并验证一条候选序列,成本也远高于普通计算实验。这决定了计算筛选环节的价值:筛得越准,实验成本越低。未来这个方向的竞争力,很大程度上取决于计算筛选模型的精度。

8. 生物安全与合规使用边界

这类工作涉及的序列生成能力,必须放在明确的生物安全框架下讨论。AI 生成基因组序列的能力越强,合规边界就越重要。

研究团队在发表这类成果时,通常需要经过机构生物安全委员会和伦理委员会审查,确保生成序列不会用于制造具有潜在危害的病原体。作为读者和研究参考者,我们也应该建立同样的意识:大模型生成生物序列的能力,是研究工具,不是随意使用的玩具。

具体来说,涉及噬菌体、病毒、病原菌相关序列生成时,要注意这几个方向。一是使用公开数据库和合法获取的数据,不触碰未授权样本。二是合成和功能验证必须在具备资质的实验室完成,遵守所在国家和机构的生物安全法规。三是生成序列不能直接用于制造或改造危险病原体,不能绕过监管把序列交给不具备资质的第三方。四是面向临床或商业应用时,必须完成完整的毒力评估、安全性测试和伦理审批。

如果打算跟进这个方向,建议先建立一套清晰的合规评审流程,再开始算实验和湿实验。技术能力边界和合规边界,两者必须同时守住。

9. 对研究者和工程师的启发:如何跟进这类工作

如果你关注这个方向,或者想在自己的研究里引入基因组语言模型,下面几个经验值得记住。

第一,不要一开始就追求“完整基因组生成”。可以先从启动子设计、蛋白质编码序列优化、小型调控元件设计这些更可控的任务入手。任务规模越小,功能验证越容易,模型设计迭代也越快。在噬菌体完整基因组生成之前,一定有一个逐步放大任务规模的过程。

第二,计算生成和实验验证一定要尽早结对。很多 AI 团队做序列生成只停在计算层面,生成一堆序列,却没有任何湿实验验证能力,最终无法判断模型好坏。如果条件不允许自建实验平台,就找靠谱的合成生物学实验室合作,让验证反馈成为模型改进的输入。

第三,重视生成策略中的“新颖度-功能度”平衡。这是整个系统的核心超参数。可以用序列相似度作为新颖度的度量,用功能预测模型或湿实验成功率作为功能度的度量,两者画成帕累托曲线,观察不同参数下生成的分布变化。这类分析本身,就是一篇很有价值的方法学文章。

第四,把数据、特征、生成结果全部工程化沉淀。基因组语言模型项目涉及的数据类型很杂:训练用的基因组序列、注释信息、筛选打分、湿实验反馈。没有一套清晰的目录管理和版本管理,项目越往后越难复盘。

一个典型的候选序列记录结构可以长这样:

JSON
{
"candidate_id": "phage_design_0001",
"sequence": "ATGCGTACGTTAG...",
"source_model": "phage-lm-v1",
"sampling_temperature": 0.85,
"gc_content": 46.3,
"nearest_natural_similarity": 0.24,
"predicted_function_score": 0.78,
"wet_lab_status": "pending",
"validation_notes": ""
}

这种记录方式,让每一条生成序列都可以追溯到生成参数、计算筛选结果和实验状态。只要实验闭环持续跑下去,这个数据集本身就是团队最核心的资产。

10. 总结与下一步

这篇文章的核心价值不在于“AI 生成了噬菌体”这个新闻点,而在于它验证了一套可以复制的方法:用基因组语言模型在自然进化覆盖范围之外,找到仍然具有生物学功能的序列区域。这对合成生物学和 AI for Science 都有方向性的意义。

最值得关注的验证环节是:生成序列是否真的通过了实验室感染功能验证,以及与已知天然噬菌体的差异程度到底有多大。这两个数据,决定了这项工作的成色。

最容易踩的坑则是过度解读“进化之外”这个概念。生成序列仍然是生物学规律约束下的产物,不是凭空跳出自然法则。它探索的是自然进化尚未覆盖的序列空间,不是违反生物学基本定律的序列空间。

后续值得继续关注的方向有几个:生成模型向更长基因组扩展的能力、计算筛选精度的提升、生成序列在噬菌体疗法中的真实应用效果,以及这套方法在细菌、真菌等更大基因组设计上的迁移能力。如果你对 AI 驱动的生物设计感兴趣,可以从这篇开始,把它的方法、数据和验证路径梳理清楚,再考虑迁移到自己的研究方向上。建议收藏备用,后面需要对比基因组语言模型类工作时,这篇会是一个很好的对照锚点。

AI生成完整噬菌体基因组:从序列设计到功能验证的工程范式
王辉猛
AI生成完整噬菌体基因组:从序列到“活体”的生命设计突破
凿船尸爷
phagea:基于噬菌体进化算法
“phagea基于噬菌体进化算法”是一套融合生物学机理与计算智能思想的原创性元启发式优化框架,其核心创新在于将自然界中噬菌体(bacteriophage)与宿主细菌之间高度特异、动态协同且具备自适应调控能力的感染—复制—裂解—传播生命周期,形式化建模为一种新型群体智能搜索范式。该算法并非简单类比生物现象,而是深度借鉴噬菌体在真实生态系统中所展现的四大关键行为机制(1)靶向识别(host-specific adsorption),即通过尾丝蛋白与细菌表面受体的高亲和力结合实现精准定位,对应算法中个体对解空间局部优质区域的定向探测能力;(2)基因注入与信息重写(DNA injection & host hijacking),模拟将优良解片段高效嵌入当前候选解结构的过程,体现为交叉算子中基于拓扑相似性的片段迁移与上下文感知的基因覆盖策略;(3)裂解释放与种群扰动(lysis-induced population perturbation),通过周期性触发“群体裂解事件”,强制淘汰低适应度亚群并释放高多样性新个体,有效打破早熟收敛陷阱,维持种群长期探索活力;(4)溶原—裂解双稳态切换(lysogenic-lytic switch),引入环境压力反馈调节机制,依据当前搜索阶段的收敛速率、多样性衰减速率及目标函数梯度变化,自适应调整算法在exploitation(开发)与exploration(探索)之间的动态平衡权重,显著提升其在多峰、非凸、高维、带约束及噪声干扰等复杂优化场景下的鲁棒性与泛化能力。phagea以Java语言实现,充分依托JVM平台的跨平台性、内存管理稳定性及面向对象建模优势,构建了模块化、可扩展的算法骨架包括PhagePopulation(噬菌体种群)、BacterialHost(宿主环境抽象)、InfectionEngine(感染引擎)、LysisScheduler(裂解调度器)、LysogenyController(溶原控制器)等核心类,并支持用户自定义适应度函数、约束处理策略、编码方案(如实数编码、排列编码、树形编码)以及终止条件。尤为关键的是,phagea通过jPype这一高性能Java-Python桥接库,实现了无缝Python调用能力——jPype并非简单的进程间通信或REST API封装,而是直接在CPython解释器内嵌JVM实例,共享内存地址空间,允许Python端以原生对象语法操作Java类实例,调用其方法、访问字段、注册回调监听器,从而将phagea深度集成至Scikit-learn、PyTorch、TensorFlow等主流AI生态链中,例如可作为超参数优化器嵌入神经网络训练流程,或作为强化学习策略搜索模块参与马尔可夫决策过程求解。这种双语言协同设计极大拓展了phagea的应用边界研究人员可在Python中快速原型验证新问题建模,再无缝切换至Java进行高性能批量实验;工业界开发者则可将其作为微服务组件部署于Spring Cloud架构,支撑大规模分布式优化任务。作为生物启发算法家族的重要成员,phagea区别于传统遗传算法(GA)、粒子群优化(PSO)或差分进化(DE)的核心哲学在于它不依赖随机变异或速度更新等通用算子,而是将进化压力具象为“寄生—宿主”博弈关系,使搜索过程天然蕴含对抗性、层次性与涌现性,为解决组合爆炸、动态环境适应、多目标帕累托前沿逼近、黑盒函数代理建模等前沿难题提供了全新范式。其开源项目结构(phagea-master)表明其已具备完整工程化形态,包含Maven构建配置、JUnit测试套件、详尽Javadoc文档及典型基准测试(如CEC系列、ZDT、DTLZ多目标测试集)案例,标志着该算法已从理论构想走向可复现、可验证、可部署的成熟计算智能工具。
slaslady
AI重塑微生物组研究从抗菌肽智能设计噬菌体疗法挖掘
郁清叔叔
AI赋能微生物组研究从高维数据挑战到抗菌肽与噬菌体精准设计
小软观察
AI驱动抗菌肽与噬菌体设计:从数据到湿实验的完整技术指南
jordan.xue
生成AI与蛋白设计[代码]
生成AI与蛋白质设计是当前生命科学与人工智能交叉领域最具颠覆性与前沿性的研究方向之一。其核心在于利用以深度学习为代表的生成式建模范式,从海量生物序列与结构数据中学习蛋白质的“语法”与“语义”,进而实现对全新蛋白质分子的理性、可控、可编程的设计——即所谓“蛋白质从头设计(de novo protein design)”。这一范式彻底突破了传统蛋白质工程依赖天然模板或随机突变的局限,使人类首次具备了按需定制具有特定三维构象、热力学稳定性、结合亲和力、催化活性乃至多价组装能力的蛋白质分子的能力。在技术路径上,该领域呈现出“计算—实验—反馈”闭环驱动的鲜明特征。一方面,实验技术如噬菌体展示(Phage Display)与定向进化(Directed Evolution)构成了验证与筛选的关键环节前者通过将外源肽段或蛋白结构域与噬菌体衣壳蛋白融合表达,构建超大规模(10⁷–10¹¹)基因型-表型物理连接文库,在多轮亲和淘选后富集高结合活性变体;后者则借助易错PCR、DNA改组(DNA shuffling)或CRISPR介导的连续编辑,在细胞内建立动态突变—表达—筛选系统,模拟自然选择压力以加速功能优化。二者虽强大,但本质上属于“黑箱试错”,通量受限、周期冗长、难以解析设计原理。而生成AI的介入,正是为这一过程注入“白箱化”认知与“前向预测”能力。具体而言,蛋白质结构预测已因AlphaFold2与RoseTTAFold等基于注意力机制的端到端深度学习模型实现历史性突破,其预测精度逼近实验分辨率(Cα RMSD < 1 Å),标志着“结构生物学第三纪元”的开启。但预测仅是理解的起点,设计才是创造的核心。当前主流生成式方法可分为三类第一类为基于能量函数引导的采样设计,如RFdiffusion与Chroma,其将扩散模型(Diffusion Model)引入蛋白主链与侧链构象空间建模——通过定义“加噪—去噪”过程,让模型逐步从纯噪声中生成符合物理约束(键长、键角、二面角、范德华排斥、氢键网络)与功能需求(如结合口袋形状、静电势分布、界面互补性)的三维结构;第二类为逆折叠(Inverse Folding)范式,即给定目标结构(PDB坐标),反推能稳定折叠成该构象的最优氨基酸序列,典型代表有ProteinMPNN(基于流匹配的自回归模型)与ESM-IF1(基于掩码语言建模的上下文感知序列生成器),其本质是解耦“结构—序列”映射中的简并性与鲁棒性;第三类为端到端序列生成,如SAINT、ProtGPT2等基于Transformer的大语言模型,直接在百万级UniRef蛋白序列语料上预训练,学习残基共进化模式、远程相互作用与功能模体语法,再经指令微调(Instruction Tuning)实现“设计具有X酶活的热稳定β桶蛋白”等条件生成任务。尤为关键的是,这些模型并非孤立运行,而是深度嵌入蛋白质工程全链条上游对接多尺度分子动力学(MD)模拟验证热力学稳定性;中游耦合Rosetta等基于物理的能量评估器进行打分重排;下游无缝衔接DNA合成、酵母/大肠杆菌表达、SPR/ITC亲和力测定及冷冻电镜结构解析。例如,2023年华盛顿大学David Baker团队利用RFdiffusion+ProteinMPNN流程,成功从零设计出13种此前自然界未见的纳米笼结构,并全部获得X射线晶体结构验证,其中多个具备精确孔径调控能力,可用于靶向药物递送。这标志着生成AI已从“预测准确率竞赛”迈入“功能实现率验证”新阶段。未来演进将聚焦三大纵深方向其一,模型架构将持续融合先验知识——不仅纳入量子化学参数、溶剂化效应、翻译后修饰位点等细粒度物理规则,更将整合细胞内环境(如分子拥挤度、伴侣蛋白浓度)与系统生物学通路约束;其二,知识融合将打破模态壁垒,构建“序列—结构—动力学—功能—疾病表型”五维联合嵌入空间,使模型可响应“设计一种在酸性肿瘤微环境中特异性激活的溶瘤蛋白”等复杂临床命题;其三,实验自动化将形成“AI设计—机器人合成—微流控筛选—闭环反馈”无人实验室(Self-Driving Lab),显著压缩“设计—制造—测试—学习”周期至小时级。由此,生成AI正将蛋白质工程从一门经验密集型技艺,升维为一门数据驱动、原理可溯、规模可控的系统性工程科学,其终极影响或将重塑生物医药、工业酶制剂、生物材料乃至人工光合作用等战略产业的技术底层。
废话输出机427
AI赋能微生物组研究抗菌肽理性设计噬菌体疗法精准化
勃对立
AI在精准医学中的主导地位
在诸如蛋白质结构预测的国际竞争中,AI方法展现出了卓越的性能,为相关研究领域树立了新的标杆。这些先进的方法对于解决基因组序列解释问题,比如识别患者基因组中的癌症驱动突变,具有重要潜力。
cpongm
2
Science|基因组语言模型实现噬菌体生成设计
本研究首次利用基因组语言模型Evo 1/2实现完整噬菌体ΦX174基因组生成设计,通过微调、三层约束过滤与实验验证,成功合成16株具备宿主特异性、高适应度及抗性克服能力的活性噬菌体。关键技术创新包括微病毒科专属微调、短序列提示策略、重叠ORF专用注释及噬菌体重启协议,验证了AI驱动合成基因组学在噬菌体疗法中的可行性。
Asa12138
391
AI生成完整噬菌体基因组:设计到验证的突破
本文解析AI首次成功生成完整、可存活且具抑菌功能的噬菌体基因组的技术突破。核心涵盖DNA序列建模为语言、自回归与扩散生成框架、多层级生物学约束(编码、调控、包装、功能)的联合求解,以及设计-构建-测试-学习(DBTL)闭环工程实践。强调模型需结合湿实验验证,凸显其在噬菌体疗法、耐药菌应对和合成生物学基础设施升级中的应用潜力与安全边界。
weixin_34301132
488
AI基因组:语言模型设计新型噬菌体
本文系统解析了基于语言模型新型噬菌体基因组设计方法,涵盖基因组语言模型的训练流程、k-mer tokenization策略、Transformer自回归建模原理,以及生成序列的in silico评估与湿实验验证闭环。重点突出其在合成生物学中实现‘数据驱动设计-合成-验证’范式转变的技术路径,区别于传统理性设计与蛋白质语言模型,聚焦整基因组尺度的模块化功能协同建模。
无可就是九头鸟
281
基因组语言模型:从序列语法到新型噬菌体设计
本文系统阐述基因组语言模型如何将DNA序列建模为具有语法结构的文本,重点解析其在新型噬菌体生成中的技术路径预训练学习基因组“语法”、条件采样生成新序列、计算筛选过滤无效候选、湿实验验证感染功能,以及干湿闭环迭代优化。强调该方法突破传统理性设计与定向进化的局限,实现数据驱动的可迭代生物序列工程。
李傲天
325
基因组语言模型如何生成噬菌体:原理、复现与验证全解析
本文系统解析基因组语言模型生成功能性噬菌体基因组的技术原理、复现路径与生物信息学验证方法。重点涵盖DNA序列分词策略(k-mer/BPE)、自回归生成机制、与蛋白质语言模型的本质差异;阐明选择噬菌体作为生成对象的三大依据(尺寸适中、模块清晰、应用明确);详细拆解训练数据构建、模型微调、计算筛选(ORF预测、BLAST同源比对、Pfam功能注释)及湿实验验证闭环;并提供本地推理部署、资源优化与合规边界等实操指南。
理柴德波浪技术
288
蛋白质设计:从理性设计AI生成,定向进化与Rosetta的融合
本文综述蛋白质设计技术演进,重点剖析Rosetta物理建模框架与深度学习方法的融合路径。涵盖能量函数、构象采样、序列优化等核心算法;详解RFdiffusion、Chroma扩散模型的结构生成能力及ProteinMPNN的高效序列设计机制;强调机器学习辅助定向进化与主动学习闭环在实验验证中的关键作用,推动从理性设计迈向功能导向的端到端AI生成
九章智算云
305
RNA Club | 解码CRISPR-Cas与噬菌体进化博弈从Anti-CRISPR机制到基因编辑新策略
本文系统解析CRISPR-Cas系统的免疫原理及其两类主要类型(Class 1/2),重点阐述噬菌体进化出的Anti-CRISPR蛋白(如AcrIF25、AcrIF3、AcrIIC家族)如何通过构象干扰、伪基底模拟、结构域锁定等机制特异性抑制Cas蛋白活性;进而探讨其在提升基因编辑安全性、实现时空可控编辑及指导新型Cas变体设计中的转化价值,并延伸至AI驱动的Anti-CRISPR预测与合成生物学回路构建等前沿方向。
珍喜欢点灯啊
100
“十五五“开局合成生物驱动生物农药产业跃迁——从基因编辑、RNA调控到微生物组工程
本文聚焦“十五五”开局背景下合成生物学对生物农药产业的变革性影响,系统阐述基因编辑(CRISPR-Cas9、碱基编辑)、RNAi技术(dsRNA农药)、代谢工程(推-拉策略)及微生物组工程(SynComs、噬菌体组)四大核心技术进展;分析AI赋能设计、中试平台建设、登记绿色通道等产业化关键支撑;强调多组学整合与智能农业融合趋势,凸显其在精准防控、减药增效和可持续发展中的核心作用。
AIex-YH
608
H3BERTa抗体语言模型:从伪困惑度筛选到AI驱动的抗体设计
本文介绍专用于抗体CDR-H3区域的预训练语言模型H3BERTa,其核心创新在于生物学适配的架构设计与伪困惑度(Pseudo-Perplexity)评估方法。模型通过掩码预测学习CDR-H3与框架区的共进化规律,支持抗体库高效筛选、定向进化指导、高质量生成及库质量评估。相比通用蛋白质模型,H3BERTa在注意力聚焦、上下文定义和计算效率上具有显著优势,并可与理化性质、结构预测等多指标联合应用,推动AI驱动的理性抗体工程。
换个宇宙
315
Science最新封面:AI大模型跨越物种边界、解码生命“密码全书”,基因组学进入全新时代
斯坦福大学团队发布基因组基础模型 Evo,它基于 3000 亿 DNA token 训练,采用 StripedHyena 架构,能在单碱基分辨率下处理长序列。Evo 在跨物种基因预测、生成功能性基因系统等方面表现出色,但也存在数据集有限等问题,未来将拓展功能和数据,同时需关注安全伦理。
超正经学术君
650
基于1百万物种的百亿级基因数据,英伟达等构建EDEN系列模型,基因组与蛋白质预测能力达 SOTA
英伟达与Basecamp Research等联合发布EDEN系列宏基因组基础模型,基于覆盖100万物种、9.7万亿核苷酸的高质量长序列数据集BaseData训练,参数规模达280亿。该模型在跨物种DNA理解与生成、重组酶设计、抗菌肽生成及合成微生物组构建等多项任务中达到SOTA,验证了单一AI模型驱动分子至生态系统级可编程生物学治疗设计的通用性。
HyperAI超神经
660
【科研快讯】刘如谦团队再发Nature:AI蛋白质设计超越自然进化,开创蛋白质工程通用范式
刘如谦团队在Nature发表研究,提出‘先AI设计稳定性、再PACE连续进化功能’的蛋白质工程新范式。利用ProteinMPNN和AlphaFold2设计稳定化BoNT/E蛋白酶变体,再通过PACE平台快速进化出高活性、高特异性切割非天然靶点(如ataxin-2)的新酶。该策略显著提升表达量、热稳定性与催化效率,突破天然酶性能瓶颈,为治疗性蛋白酶开发提供通用技术路径。
洵锋学术
422
Science最新封面:AI大模型跨越物种边界、解码生命“密码全书”,基因组学进入全新时代...
斯坦福大学团队发布基因组基础模型 Evo,它基于 3000 亿 DNA token 训练,能在单碱基分辨率下预测和生成。Evo 在跨物种基因预测、生成功能性基因系统等方面表现出色,但也存在数据集有限、生成长序列连贯性不足等问题。同时,其应用还面临安全与伦理考量。
AITIME论道
971
生物学工程化:AI驱动的基因-靶点-诊断端到端闭环
本文系统阐述Chai-2、AlphaGenome和MAI-DxO三大模型协同构建的端到端生物学工程闭环Chai-2实现抗体的理性设计与湿实验可开发性优化;AlphaGenome解析非编码基因组调控机制,支撑反义寡核苷酸等精准干预设计;MAI-DxO以可审计、可追溯的序贯决策框架重构临床诊断流程。三者共同突破数据偏见、湿实验鸿沟、临床采纳与合规审批等关键瓶颈,推动生物医学从经验试错迈向可建模、可预测、可迭代的工程范式。
weixin_30888413
386
AI引导的定向进化:蛋白质语言模型与上位效应预测的工程实践
本文介绍基于蛋白质语言模型(如ESM、ProtBERT)的AI引导定向进化方法,核心在于利用模型对序列的语义表征能力,预测多点突变间的上位效应,从而智能设计高成功率突变文库。流程涵盖目标定义、虚拟扫描、组合突变评估、智能文库构建及实验-模型迭代闭环。该方法显著提升高维突变空间探索效率,适用于酶工程、抗体优化等场景,同时强调计算资源、实验通量与数据质量的关键约束。
weixin_33725515
629
AI驱动病毒设计:技术实现、计算资源与合规应用解析
本文聚焦AI驱动病毒设计的技术栈,涵盖序列生成、蛋白质结构预测(如AlphaFold2/ESMFold)、功能评估与合成可行性分析等核心模块;详述计算资源需求(GPU显存、内存、存储)、工作流编排(PyTorch/TensorFlow、Snakemake)、数据预处理及合规自动化管道设计;强调在疫苗研发、基因治疗等有益场景下的负责任应用,嵌入多重生物安全风险过滤机制。
weixin_34295316
386
Gemini 2.0助力科学突破,AI联合科学家系统登场
Gemini 2.0驱动AI联合科学家系统,通过多智能体协作提出创新研究假设和实验方案,已在生物医学领域验证其潜力。系统包括假设生成、反思、排序、进化等环节,能够自我优化,提高研究假设的质量和创新性。未来展望中,AI科学家有望在更广泛的科研领域发挥更大作用。
新加坡内哥谈技术
2066
AI驱动蛋白设计:从理论到实践的全流程解析
本文系统解析AI驱动蛋白设计的演进脉络与技术实践,涵盖理论基础(能量函数、Anfinsen法则)、传统工具(Rosetta)、AI范式革命(AlphaFold2、ProteinMPNN、RFdiffusion),以及从结构生成、序列设计、计算验证到实验优化的完整工作流。重点强调深度学习在条件化生成、高通量筛选和功能导向设计中的核心作用,并指出计算-实验闭环中的关键陷阱与应对策略。
weixin_33924770
456
百奥几何:AI for Science 浪潮下的中国先锋,如何以专业模型重塑生物制药未来?
百奥几何作为中国AI for Science领域的先锋,聚焦生物制药垂直场景,构建以几何深度学习为基础的蛋白质结构预测、生成设计及专属知识驱动的模型矩阵。其技术强调复合物建模、多目标优化与物理约束反馈,并依托高质量生物数据与国产算力协同优化,实现从AI研发到药物发现的产业闭环。文章剖析其专业模型壁垒、产业落地路径及对国产科学智能发展的启示。
BKKKKKKK
480