Mol-JEPA:将JEPA架构引入分子科学的多模态基础模型

引言:分子表征学习的新尝试
近日,一位研究者在Reddit的机器学习社区分享了一项耗时约一年完成的研究成果——Mol-JEPA。这是一个面向分子领域的多模态JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)基础模型。作者以谦逊的态度发布了这项工作,并附上了展示核心成果的总结网站,同时坦言"仍有许多提升性能的空间",欢迎社区提供反馈与想法。

这项工作之所以值得关注,不仅在于它将JEPA架构引入分子科学这一相对新颖的应用场景,更在于它采用了"多模态"的思路来理解和表征分子——这为药物发现、材料科学等领域的AI应用开辟了新的探索方向。
JEPA架构的核心原理
从生成式到预测式的范式转变
JEPA(联合嵌入预测架构)是由Yann LeCun等人倡导的一种自监督学习范式。与传统的生成式模型(如自回语言模型或扩散模型)不同,JEPA并不试图在像素级或token级重建原始数据,而是在抽象的表征空间中进行预测。
具体来说,JEPA会对输入数据的一部分进行编码,然后预测另一部分在嵌入空间中的表征,而非直接重建其原始形态。这种方式的核心优势在于:它避免了在无关细节上浪费建模能力,从而学习到更加语义化、泛化能力更强的表征。
值得注意的是,JEPA并非孤立提出的技术方案,而是Yann LeCun在2022年发表的论文《A Path Towards Autonomous Machine Intelligence》中系统阐述的"世界模型"愿景的核心组件。LeCun认为,当前主流的生成式AI(包括大语言模型)本质上是在token层面做模式匹配,缺乏对世界的真正理解。他提出的替代方案是让模型在抽象的表征空间中学习预测,从而构建类似人类心智模型的内部表征。JEPA的早期成功案例包括Meta AI团队开发的I-JEPA(用于图像)和V-JEPA(用于视频),这些工作验证了在表征空间中进行预测确实能学到比像素级重建更具语义价值的特征。正是这些视觉领域的成功经验,为将JEPA扩展到分子科学等其他模态提供了信心和方法论基础。
JEPA为何适合分子建模
将JEPA应用于分子领域具有天然的合理性。分子数据本身高度结构化且信息冗余——一个分子的许多局部特征可以从其整体结构推断出来。相比强行重建每一个原子或化学键的生成式方法,在表征空间中预测分子的部分结构,更符合化学直觉,也更有利于捕捉分子的功能性特征。
要理解Mol-JEPA的创新之处,有必要回顾分子领域自监督学习的演进脉络。早期方法以对比学习为主,例如MolCLR通过对分子图施加不同的数据增强来构造正负样本对。随后,掩码预训练策略兴起,典型代表是Grover和GraphMAE,它们通过遮蔽部分原子或化学键并要求模型重建来学习分子表征。然而这些方法普遍面临一个问题:像素级或节点级的重建目标迫使模型在原子类型、键角等低层细节上投入大量建模能力,而这些细节对下游的药物活性预测等任务帮助有限。JEPA框架通过在抽象空间中预测来规避这一问题,这正是Mol-JEPA的理论出发点——它代表了分子自监督学习从"重建细节"到"预测语义"的范式跃迁。
Mol-JEPA的多模态融合设计
多模态分子表示的互补价值
Mol-JEPA最突出的特点是其"多模态"属性。在分子科学中,同一个分子可以用多种方式表示:
-
SMILES字符串:将分子表示为文本序列,便于计算机处理。SMILES(Simplified Molecular Input Line Entry System)是1988年由David Weininger提出的分子线性表示法,它将分子的二维拓扑结构编码为ASCII字符串。例如,乙醇表示为"CCO",苯表示为"c1ccccc1"。SMILES的优势在于紧凑高效,可以直接输入NLP模型处理,这也催生了ChemBERTa、MolBERT等基于Transformer的分子语言模型。但SMILES存在固有缺陷:同一分子可以有多种合法的SMILES表示(即非规范性),且字符串无法直接编码三维空间信息。
-
分子图:以原子为节点、化学键为边的图结构,反映拓扑关系。处理这类数据的主力工具是图神经网络(GNN),其核心思想是通过消息传递机制,让每个节点迭代地聚合邻居节点的信息来更新自身表征。在分子领域广泛使用的GNN变体包括SchNet、DimeNet(侧重三维几何信息)以及AttentiveFP、D-MPNN(侧重拓扑信息)等。GNN天然适合编码分子的局部化学环境,但在捕捉长程相互作用方面存在过平滑等挑战。
-
三维构象:分子在空间中的几何构型,包含立体化学信息。分子的三维构象指原子在三维空间中的具体坐标排布,它对分子的生物活性至关重要——药物分子必须在三维空间中与靶点蛋白的结合口袋实现互补匹配。然而,同一分子可能存在多个低能量构象(构象异构体),且构象空间随分子大小呈指数增长。获取三维构象通常依赖于量子力学计算(如DFT密度泛函理论)或分子动力学模拟,计算成本远高于生成二维图或SMILES。这意味着三维数据的规模通常远小于二维数据,如何在数据不均衡的条件下有效融合多模态信息,是Mol-JEPA这类模型面临的实际工程挑战。
-
理化性质描述符:各类计算或实验得到的属性数据
每种模态都从不同角度刻画了分子的特性。单一模态往往难以完整表达分子的全部信息,而多模态融合能够让模型综合利用这些互补的视角,从而获得更全面、更鲁棒的分子表征。这也是Mol-JEPA选择多模态路线的根本原因——在JEPA的表征空间预测框架下,不同模态的信息可以在抽象语义层面自然对齐和互补,避免了在原始数据层面硬性拼接不同格式数据的尴尬。
分子基础模型的定位
作者将Mol-JEPA定位为"基础模型"(foundation model),意味着它旨在通过大规模自监督预训练学习通用的分子表征,然后迁移到多种下游任务中——例如分子性质预测、药物-靶点相互作用预测、分子生成等。这种"一次预训练、多处复用"的模式,正是当前AI领域的主流范式在分子科学中的延伸。
基础模型(Foundation Model)概念由斯坦福HAI研究所在2021年正式提出,指在大规模数据上预训练、可适配多种下游任务的大型模型。这一范式从NLP(GPT系列、BERT)和计算机视觉(CLIP、SAM)领域向科学领域的迁移正在加速。在分子与材料科学中,代表性工作包括Meta的ESM系列(蛋白质语言模型)、Google DeepMind的GNoME(无机材料发现)、以及微软的MoLFormer等。这些模型的共同逻辑是:利用海量未标注的分子数据进行自监督预训练,学习通用的化学表征,然后在少量标注数据上微调完成特定任务,从而大幅降低对昂贵实验数据的依赖。Mol-JEPA正是在这一宏观趋势下的新探索,其独特之处在于将JEPA这一新型学习范式与多模态融合相结合,试图在分子基础模型的技术路线图上开辟一条差异化路径。
研究意义与现实挑战
在药物发现中的潜在应用
分子基础模型的价值在药物研发领域尤为显著。传统的湿实验成本高昂、周期漫长,而一个高质量的分子表征模型能够在虚拟筛选、先导化合物优化等环节大幅提升效率。将JEPA的高效表征学习能力与多模态信息融合相结合,理论上有望在数据效率和泛化能力上超越现有方法。
具体而言,在药物研发管线中,虚拟筛选(Virtual Screening)是指利用计算方法从百万甚至数十亿量级的化合物库中快速筛选出可能与靶点蛋白结合的候选分子,替代传统的高通量实验筛选。筛选出的苗头化合物(hit)经过初步验证后进入先导化合物(lead)优化阶段,研究者需要在保持活性的同时改善分子的药代动力学性质(ADMET,即吸收、分布、代谢、排泄和毒性)。传统药物研发从靶点发现到新药上市平均耗时10-15年、花费超过10亿美元。高质量的分子表征模型有望将虚拟筛选的命中率从百分之零点几提升数倍,并在先导优化阶段减少合成-测试循环的次数,从而显著压缩研发周期和成本。Mol-JEPA如果能够在这些关键环节证明其表征质量的优势,将具有直接的产业价值。
需要客观看待的局限
你可能没注意到,作者本人也明确指出该模型"仍有许多改进性能的工作要做"。作为一项由个人历时一年完成的研究,Mol-JEPA目前更多是一次有价值的架构探索和概念验证,而非成熟的产业级解决方案。其真实性能表现、与现有主流分子模型(如各类GNN、分子Transformer)的对比优势,仍有待更广泛的基准测试和社区验证。
当前分子AI领域的主流模型大致可分为三个流派:基于GNN的方法(如SchNet、DimeNet++、Uni-Mol等),擅长处理分子图和三维几何结构;基于Transformer的方法(如MolBERT、ChemBERTa、MoLFormer等),将SMILES视为自然语言进行处理;以及混合方法(如GEM、Graphormer),试图兼顾图结构感知和全局注意力机制的优势。在主流基准测试(如MoleculeNet、OGB-LSC)上,各方法各有所长,尚未出现压倒性的统一方案。Mol-JEPA的独特之处在于它不属于上述任何一个流派,而是引入了全新的学习范式——在表征空间中跨模态预测,这可能为突破现有方法的性能瓶颈提供新思路,但也意味着它需要在这些成熟的基准上证明自己。
此外,作为来自Reddit社区的单一来源分享,这项工作的具体实验细节和可复现性也需要读者结合其公开的总结网站进行进一步核实。
开放科学精神的生动实践
Mol-JEPA的发布方式本身也颇具代表性——研究者主动在开放社区分享成果、公开项目网站、诚恳寻求反馈。这种开放协作的科研态度,正是推动AI与科学交叉领域快速进步的重要动力。
对于关注AI4Science、分子表征学习或JEPA架构的研究者和从业者而言,Mol-JEPA提供了一个值得跟进的探索案例。它或许还不完美,但代表了将前沿自监督学习架构引入化学领域的有益尝试。感兴趣的读者可以访问作者提供的项目网站深入了解其技术细节与实验结果。
核心要点
相关推荐

Playco借GPT-6 Astra开发游戏原型,手动修复量减少50%
游戏工作室Playco利用GPT-6 Astra模型,从单一灰盒衍生出三个主题化游戏原型,手动修复工作量减少50%。本文解析其实践方法、效率提升背后的技术原因及对游戏行业的启示。

OpenAI投入10亿美元推出Daybreak计划:用AI守护关键基础设施
OpenAI宣布Daybreak for Frontline Defenders计划,承诺投入10亿美元为医院、电网、水务等关键基础设施提供前沿网络AI防御能力、安全培训及技术支持,弥合网络攻防能力鸿沟。

Unsloth v0.1.71-beta发布:微调加速框架核心改进解析
Unsloth v0.1.71-beta版本发布,新增智能媒体能力适配、命名规范优化等改进。深入解析Unsloth微调框架的显存优化、训练加速及模型兼容性优势,附beta版使用建议。