AI首次设计自然界不存在的病毒基因组:突破与风险并存

AI进入生命设计领域:从文本生成到基因组创造
人工智能的应用边界正在被不断突破。继在蛋白质结构预测、药物研发等领域取得突破性进展后,AI如今已经能够设计出自然界中从未存在过的病毒基因组。这一进展标志着生成式AI从处理文本、图像、代码,正式迈入了对生命最基本编码——核酸序列的直接设计。
值得回顾的是,AI在生命科学领域的突破有着清晰的演进脉络。2020年,DeepMind的AlphaFold2解决了困扰生物学界50年的蛋白质折叠问题,能够以原子级精度预测蛋白质三维结构。蛋白质折叠问题是指从一维氨基酸序列预测蛋白质三维结构的挑战——一个典型蛋白质由数百个氨基酸组成,理论上可能的折叠构象数量是天文数字。这一复杂性可以用"莱文塔尔悖论"来直观说明:一个由100个氨基酸组成的蛋白质,如果随机搜索所有可能构象,即使每种构象只需皮秒级时间,穷举搜索所需时间也将超过宇宙年龄;然而自然界中蛋白质在毫秒到秒的时间尺度内就能折叠成正确结构,暗示着折叠过程遵循某种尚未完全理解的物理规律。自1994年起,CASP(蛋白质结构预测关键评估)竞赛每两年举办一次,成为该领域的标准评测,而AlphaFold2在2020年CASP14中达到了约90的GDT分数,接近实验测定精度,被《科学》杂志评为年度突破。AlphaFold2采用了多序列比对(MSA)和结构模板信息作为输入,结合一种名为Evoformer的创新模块迭代更新序列和配对表示,其训练数据来自蛋白质数据银行(PDB)中约17万个已解析结构。2022年DeepMind发布了覆盖超过2亿种蛋白质的结构预测数据库,几乎涵盖所有已知蛋白质。2024年,AlphaFold3进一步扩展到预测蛋白质与DNA、RNA、小分子等的复合物结构。在药物研发领域,Insilico Medicine利用AI在18个月内完成了从靶点发现到候选药物确定的全流程,而传统方法通常需要4-5年。这些进展共同构成了AI从"理解生命"到"设计生命"的演进路径,而病毒基因组的设计正是这条路径上的最新里程碑。
据相关研究显示,研究人员利用AI模型生成了完整的病毒基因组序列,并且部分设计的序列在实验室中被证实具有生物活性。这意味着AI不再只是分析或预测已有的生物信息,而是能够创造出全新的、可运作的遗传物质。
AI设计病毒基因组的技术原理
核酸序列作为一种"语言"
这类研究的核心思路,与大语言模型处理自然语言有着惊人的相似之处。DNA和RNA本质上是由四种碱基(A、T、G、C或A、U、G、C)构成的序列,可以被视为一种拥有特定"语法"和"语义"的语言。
这种类比并非表面化的修辞,而是有深刻的数学基础。自然语言由词汇和语法规则构成,基因组同样具有层级结构:碱基组成密码子(三联体),密码子编码氨基酸,氨基酸组成蛋白质。从信息论角度看,基因组序列的信息熵并非均匀分布——编码区受到更强的选择压力约束,信息冗余度相对较低(遗传密码中的简并性除外),而非编码区的信息特征更接近自然语言中的语法结构。更重要的是,基因组中存在大量的长程依赖关系——启动子与编码区、调控元件与目标基因之间的远距离互作,这与自然语言中上下文依赖关系高度类似。特别值得注意的是,基因组中存在大量的顺式调控元件(如TATA盒、CpG岛、增强子等),它们与远端基因的关系类似于自然语言中的代词回指——需要跨越很长的上下文距离才能正确解析语义。此外,密码子使用偏好(codon usage bias)也构成了一种"方言"特征,不同物种乃至同一物种的不同基因对同义密码子有明显偏好,这种偏好直接影响翻译效率和蛋白质折叠。Transformer架构中的自注意力机制恰好擅长捕捉这类长距离关联,这也解释了为什么大语言模型的架构可以几乎无缝迁移到基因组序列的建模任务中。
Transformer是2017年由Google团队在论文"Attention Is All You Need"中提出的神经网络架构。其核心创新——自注意力(self-attention)机制——允许模型在处理序列中的每个位置时,同时关注序列中所有其他位置的信息,并根据相关性动态分配注意力权重。这使得模型能够高效捕捉任意距离的依赖关系,突破了此前循环神经网络(RNN)和长短期记忆网络(LSTM)在处理长序列时的梯度消失问题。在基因组建模中,一个基因的表达可能受到数千碱基之外的增强子或沉默子调控,自注意力机制特别适合建模这类远程调控关系。
通过在海量的真实基因组数据上进行训练,AI模型能够学习到病毒基因组的内在规律——哪些序列组合能够编码有功能的蛋白质,哪些结构能够支持病毒的复制与组装。AI模型必须学习到这些多层次的统计规律——从单碱基水平的组成偏好,到局部的密码子使用模式,再到全局的基因组组织架构——才能生成功能性序列。在此基础上,模型可以"生成"出全新的、训练集中从未出现过的序列,同时保持生物学上的合理性。
从生成到实验验证的闭环
值得关注的是,研究并未止步于计算机模拟。真正引发广泛讨论的关键在于,部分AI设计的基因组在实际实验中展现出了功能性。这种"生成—合成—验证"的闭环,正是当前AI驱动的合成生物学最具颠覆性的范式:AI提出假设,实验快速验证,从而大幅压缩了传统生物工程的研发周期。
传统合成生物学遵循"设计-构建-测试-学习"(DBTL)循环,这一核心工程范式借鉴自工程学的迭代设计理念。"设计"阶段利用计算工具规划遗传回路;"构建"阶段通过DNA合成和组装技术制造设计的遗传构件;"测试"阶段在体外或体内验证功能;"学习"阶段分析数据以指导下一轮设计。传统上每个完整循环可能耗时数月甚至数年。AI的引入从根本上改变了这一范式的效率。在"设计"阶段,AI可以在数小时内生成数千个候选序列,而人类专家可能需要数周才能设计少量方案。在"测试"阶段,AI的预测能力可以大幅减少需要实际验证的候选方案数量。
与此同时,DNA合成技术的成本在过去十年下降了1000倍以上,使得"合成—验证"闭环的经济可行性大幅提升。现代DNA合成技术主要分为化学合成法和酶法合成两大路线。传统的亚磷酰胺化学合成法自1980年代以来一直是行业标准,通过逐步耦合核苷酸单体构建寡核苷酸链,单次合成长度通常限制在200个碱基以内;更长的序列需要通过Gibson组装、Golden Gate组装等方法将多个片段拼接。近年来,Terminal deoxynucleotidyl Transferase(TdT)酶法合成成为新兴方向,DNA Script和Nuclera等公司开发的酶法平台理论上可实现更长的单次合成长度和更温和的反应条件。合成成本从2000年代初的约$10/碱基下降到目前的$0.05-0.10/碱基。目前合成一个完整病毒基因组(数千到数万碱基对)的成本已降至数千美元量级,这使得高通量的实验验证成为可能。
AI设计病毒的应用前景
从积极的角度看,这项技术具有巨大的应用潜力,覆盖多个医学和生命科学领域。
噬菌体疗法:对抗超级细菌的新路径
随着抗生素耐药性问题日益严峻,能够精准感染并杀灭特定致病菌的噬菌体正受到重新重视。AI设计的定制化噬菌体,有望成为对抗超级细菌的新型武器,为临床提供传统抗生素之外的治疗选择。
抗生素耐药性(AMR)被世界卫生组织列为全球十大公共卫生威胁之一。细菌通过基因突变和水平基因转移获得耐药性,而抗生素的过度使用和滥用加速了这一过程。目前全球抗生素研发管线严重不足——自1980年代以来,仅有少数几类新型抗生素被批准上市。MRSA(耐甲氧西林金黄色葡萄球菌)、CRE(碳青霉烯耐药肠杆菌科细菌)等超级细菌在医院环境中造成的感染死亡率可高达50%。到2050年,如果不采取行动,AMR每年可能导致1000万人死亡,经济损失达100万亿美元。
噬菌体是地球上数量最多的生物实体,估计总数超过10^31个,远超所有其他生物的总和。噬菌体疗法的历史可以追溯到1920年代,但随着抗生素时代的到来而被西方医学界边缘化,仅在格鲁吉亚和波兰等东欧国家持续应用。如今,全球每年约有120万人死于抗生素耐药菌感染(据2022年《柳叶刀》研究),世界卫生组织警告人类可能进入"后抗生素时代"。
噬菌体的宿主识别主要依赖尾部纤维蛋白(tail fiber protein)或受体结合蛋白(RBP)与细菌表面特定受体的相互作用,这种识别具有极高的特异性。天然噬菌体的裂解周期(从吸附到释放子代)通常为20-60分钟,单次裂解可释放50-200个子代噬菌体。然而传统噬菌体疗法面临多重挑战:宿主范围通常过窄、细菌可快速进化出噬菌体抗性(通过CRISPR-Cas系统、表面受体突变或限制-修饰系统)、人体免疫系统可能清除噬菌体颗粒、以及监管框架的不确定性。传统噬菌体疗法的最大瓶颈在于寻找匹配特定病原菌的噬菌体需要大量时间——从自然环境中筛选、分离、鉴定通常需要数周。AI设计的定制化噬菌体可以绕过这一瓶颈,直接根据目标细菌的表面受体特征和防御机制生成针对性的噬菌体基因组,同时可以针对多个宿主受体设计多价识别能力并预先规避已知的细菌防御机制,将响应时间从数周压缩至数天。
基因治疗与疫苗研发的加速器
许多基因治疗方案依赖于经过改造的病毒载体来递送治疗基因,而AI能够设计出更高效、更安全、免疫原性更低的载体。在疫苗设计中,AI也可以帮助优化抗原序列,大幅加速应对新发传染病的响应速度。
基因治疗的核心挑战之一是如何将治疗性基因安全、高效地递送到目标细胞中。腺相关病毒(AAV)是目前最常用的基因治疗载体,已有多款基于AAV的基因治疗药物获批上市,如治疗脊髓性肌萎缩症的Zolgensma(单次治疗定价超过200万美元)。AAV属于细小病毒科,基因组大小约4.7kb,是非致病性病毒,其优势包括低免疫原性、可感染分裂和非分裂细胞、多种血清型提供不同组织趋向性。目前已发现13种天然AAV血清型和数百种变体。然而现有AAV载体存在免疫原性高、组织靶向性有限、装载容量小(约4.7kb)等局限,且约30-60%的人群体内已有针对常见AAV血清型的中和抗体(由自然感染产生),严重限制了治疗效果。AI可以通过设计全新的衣壳蛋白序列来突破这些限制,创造出自然进化从未产生过、人类从未接触过的载体变体,从根本上规避预存免疫问题,同时实现更精准的组织靶向和更低的免疫排斥反应,从而推动基因治疗从罕见病向常见病扩展。
基础生命科学的探索工具
此外,这项技术还为基础研究提供了强大工具,帮助科学家理解病毒进化的边界,探索"生命所有可能的形态",拓展人类对生物学规律的认知。通过生成自然界中不存在的病毒序列并观察其行为,研究人员可以系统性地探索序列空间中哪些区域对应有功能的生命形式,从而反向揭示生命运作的基本原理。这种方法本质上是将生命科学从"观察自然选择的结果"转变为"主动探索适应度景观的拓扑结构"——适应度景观(fitness landscape)是进化生物学中的核心概念,由Sewall Wright在1932年提出,它将基因型空间映射为适应度值的多维地形图,其中"山峰"对应高适应度的功能序列,"山谷"对应无功能或有害的序列。AI生成的序列可以被视为对这一抽象景观的系统性采样,帮助科学家绘制出前所未有的高分辨率适应度地图。
不容忽视的生物安全风险与伦理挑战
然而,这项突破也带来了严肃的安全与伦理拷问。
双重用途困境
生物安全是首要问题。如果AI能够设计出具有功能的病毒基因组,那么理论上它也可能被滥用于设计具有更强传染性或致病性的病原体。这种"双重用途"(dual-use)困境,是所有强大生物技术都无法回避的难题。降低了病原体设计的技术门槛,可能意味着风险向更广泛群体扩散。
"双重用途研究"(DURC)的治理讨论可追溯到2011-2012年的H5N1禽流感"功能增益"实验争议。当时荷兰伊拉斯谟医学中心的Ron Fouchier和美国威斯康星大学的Yoshihiro Kawaoka分别独立实现了H5N1病毒的哺乳动物间空气传播(利用雪貂作为人类流感传播的标准动物模型),引发了长达一年的研究暂停令和激烈的全球辩论。美国NSABB史无前例地建议《自然》和《科学》杂志不要发表实验细节。2014年美国政府暂停了对流感、SARS、MERS的功能增益研究资助,直到2017年才在新框架下恢复。此后,美国建立了包括机构审查委员会(IRB)、国家生物安全科学顾问委员会(NSABB)在内的多层审查机制。
功能增益研究的伦理争议在COVID-19大流行期间被进一步放大。武汉病毒研究所与美国EcoHealth Alliance的合作研究是否构成功能增益研究、SARS-CoV-2是否可能源于实验室泄漏等问题引发了激烈的公共讨论。2022年,美国国立卫生研究院修订了"增强型潜在大流行病原体"(ePPP)审查框架,要求对可能增强病原体传播性、致病性或免疫逃逸能力的研究进行更严格的风险-收益评估。值得注意的是,功能增益研究的支持者认为这类研究对于大流行预备(pandemic preparedness)至关重要——只有理解病原体如何获得大流行潜力,才能提前开发对策。这一论点与AI病毒设计的讨论高度相关:AI模型在学习生成功能性病毒序列的过程中,是否也隐含地学习了如何增强病原体的危险特性?
然而AI生成病毒基因组带来了全新的治理挑战:传统监管框架针对的是"实验室中的研究行为",而AI模型一旦发布,其"研究"可以在任何联网的计算机上进行,这使得属地管辖和机构审查变得极为困难。
AI模型开放性与安全护栏
目前许多强大的生物序列生成模型是开源或部分开放的。如何在推动科研开放的同时,建立有效的"护栏"机制,防止模型被用于生成危险序列,是行业必须尽快解决的问题。一些机构已开始探索为DNA合成公司提供筛查工具,以识别和拦截潜在的危险订单。
目前全球DNA合成行业的安全筛查主要依赖国际基因合成联盟(IGSC)制定的自愿性协议。该协议要求合成公司将客户订单与受管控病原体序列数据库进行比对,并核实客户身份和机构合法性。然而这一体系存在明显漏洞:它是自愿性质而非强制要求,全球仅约80%的合成能力受到覆盖;比对数据库可能无法识别AI设计的全新序列(因为这些序列与已知危险序列没有直接同源性);此外,桌面型DNA合成仪的出现可能使集中式筛查体系被完全绕过。近年来,DNA Script、Ansa Biotechnologies等公司开发出的基于酶法合成的桌面型DNA打印机,使用户可以在自己的实验室中按需合成DNA片段,无需依赖外部供应商,这种去中心化趋势可能使基于订单筛查的安全体系失效,迫使监管思路从"控制供应链"转向"控制设计工具和知识传播"。2023年,美国政府发布行政命令要求接受联邦资助的研究必须使用经过筛查的合成服务商,这是向强制筛查迈出的重要一步,但全球层面的协调仍然任重道远。
在创新与监管之间寻找平衡
AI设计自然界不存在的病毒,既展示了生成式AI在生命科学领域的惊人潜力,也再次将生物安全治理推到了聚光灯下。这不仅仅是一项技术成就,更是一个需要科研界、监管机构和整个社会共同面对的治理议题。
人们对这项技术的态度是复杂而谨慎的:一方面期待它在噬菌体疗法、基因治疗等医疗领域带来革命性突破,另一方面又深切担忧其被滥用的可能性。在AI能力持续爆发的当下,如何建立与之匹配的安全框架和伦理规范,或许比技术本身的进步更为紧迫。这需要技术开发者、生物安全专家、政策制定者和公众之间建立更加紧密的对话机制,在开放创新与风险管控之间找到动态平衡点。
核心要点
- 技术演进:AI在生命科学中经历了从"预测结构"(AlphaFold)到"设计序列"(病毒基因组生成)的关键跨越,标志着从理解生命到创造生命的范式转变
- 技术原理:基于Transformer架构的大语言模型将基因组视为一种特殊"语言",通过自注意力机制捕捉碱基序列中的长程依赖关系,在海量基因组数据上训练后生成全新的功能性序列
- 应用前景:定制化噬菌体疗法应对超级细菌危机、新型AAV载体推动基因治疗普及化、加速疫苗研发响应新发传染病
- 安全挑战:AI降低病原体设计技术门槛带来双重用途风险,传统监管框架难以应对去中心化的AI模型发布和桌面型DNA合成设备
- 治理方向:需要从自愿性行业协议向强制性全球监管框架演进,同时探索从"控制供应链"到"控制设计工具"的监管思路转变
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
