2024年,诺贝尔化学奖授予了AlphaFold的创造者Demis Hassabis和John Jumper,以表彰他们在蛋白质结构预测上的开创性工作。同年,DeepMind的AlphaProof在国际数学奥林匹克竞赛(IMO)中达到银牌水平,AlphaGeometry在几何题上接近金牌水平。进入2024至2025年,基于大模型与进化搜索结合的AI系统(如DeepMind的AlphaEvolve)不断刷新矩阵乘法、圆包装等算法与数学问题的纪录。在中国,深势科技构建了覆盖药物与材料研发的AI计算平台Bohrium,百度推出科学发现智能体"伐谋",华为发布盘古药物分子大模型。
这些成就令公众惊叹,也带来了深层困惑:这些系统究竟是如何工作的?它们是同一种技术的不同应用,还是根本不同的技术路线?百度伐谋、AlphaEvolve、AlphaProof、AlphaFold,它们之间究竟是什么关系?
在深入介绍技术之前,有必要先澄清几个广泛流传的误解。
第一,AI4S(AI for Science)就是大语言模型加智能体。事实上,AlphaFold的核心是深度神经网络的结构预测,不涉及任何大语言模型;AlphaZero的强化学习框架同样与大语言模型无关。
第二,搜索和演化是AI4S的核心乃至唯一方法。搜索演化确实是重要范式,但AlphaFold预测蛋白质结构、GNoME发现新材料,其核心都不是搜索演化,而是监督学习或生成模型。
第三,AI解数学题就是让大语言模型一步步推理。AlphaProof并非让大语言模型"想"出证明,而是在形式化证明空间中做强化学习引导的树搜索,每一步都经过Lean 4证明助手的严格逻辑验证。
第四,AI制药就是让AI生成一个分子。完整的AI制药涉及靶点发现、虚拟筛选、分子生成、多目标优化、药代动力学预测、实验验证等众多环节,每个环节使用不同的AI方法。
第五,这些方法彼此独立、互不相干。事实上,它们正在快速融合,未来的AI4S系统越来越是多范式混合体。
一、概念界定与五大核心范式1.1 概念界定
在探讨AI4S时,极易混淆"方法(Method)"与"系统(System)"的概念:
"方法"指的是底层的算法原理与数学计算逻辑(如扩散模型、强化学习、进化搜索、贝叶斯优化)。方法是抽象的、可复用的。
"系统"指的是工程落地的具体软件、平台或框架(如AlphaFold、AlphaEvolve、FM-Agent、ChemCrow)。系统是具体的、可部署的。
一个"系统"必然采用一种或多种"方法",并具备特定的"系统架构"。系统架构类型包括:单一模型架构(训练后一次前向传播即可输出结果,如AlphaFold2)、搜索或优化系统架构(在推理时需要在解空间中进行迭代搜索,如AlphaEvolve)、智能体架构(以大语言模型或策略网络为决策核心,能够感知环境、制定计划、调用外部工具,如ChemCrow)、多智能体架构(多个智能体协作完成复杂任务,如Coscientist)、工具平台架构(提供计算基础设施和多种算法接口,如深势科技Bohrium、Lean 4证明助手)。1.2 AI4S五大核心范式
范式分类依据是系统解决问题的核心算法逻辑,而非系统工程架构。例如,AlphaEvolve和百度伐谋在工程架构上都具有智能体特征(调用工具、多步推理),但它们解决科学问题的核心算法逻辑是"种群迭代与自然选择"的进化搜索;而ChemCrow的核心逻辑是"任务规划与工具调用",不存在种群竞争。基于此,我们将AlphaEvolve和FM-Agent归入进化计算范式,将ChemCrow归入智能体范式。
监督学习与判别式预测 (Supervised Learning & Discriminative Prediction):通过大量已知数据学习输入到输出的映射规律,其核心是"模式识别与预测",是AI4S中替代昂贵物理计算、实现毫秒级推断的"加速器"。
生成式模型与分布采样 (Generative Modeling & Distribution Sampling):学习已知科学数据的概率分布并从随机噪声中采样出全新的结构,其核心是"无中生有的创造",适合探索未知的化学与物理空间。
强化学习与序贯决策 (Reinforcement Learning & Sequential Decision Making):将科学问题转化为在规则约束下的多步决策游戏,其核心是"在逻辑迷宫中寻找最优路径",适合长程推理与定理证明。
进化计算与黑盒优化 (Evolutionary Computation & Black-Box Optimization):模拟生物进化或基于代理模型在缺乏梯度的庞大离散空间中进行迭代搜索,其核心是"试错、评估与优胜劣汰",适合算法发现与科学假设演化。
智能体与多智能体协同 (Agents & Multi-Agent Orchestration):以大语言模型为认知中枢自主拆解复杂科研任务并调用外部专业工具,其核心是"工作流编排与跨领域综合",适合自动化实验与复杂科研规划。
二、范式一:监督学习与判别式预测2.1 范式核心原理、适用情况与局限限制
核心原理:本范式旨在从大量标注数据中学习输入特征到输出标签的条件概率映射 。其核心计算过程是构建深层神经网络,通过反向传播算法最小化预测值与真实值之间的损失函数。训练完成后,给定新输入,模型通过一次(或固定步数的)前向传播直接输出预测结果,无需在解空间中进行迭代搜索。其智能来源于训练数据中蕴含的规律,而非运行时的探索。
适用情况:拥有大量高质量标注数据;输入与输出之间存在明确的确定性映射或统计相关性;问题可表示为结构化数据(如序列、图、网格)。典型应用包括蛋白质结构预测、材料性质预测、气象预报、分子性质预测、基因组学调控预测、偏微分方程快速求解。
局限与限制:高度依赖训练数据的分布,对分布外(Out-of-Distribution, OOD)数据的泛化能力较差;无法凭空创造训练集中未曾出现过的新颖结构;通常是"黑盒",缺乏物理可解释性;训练数据的获取成本可能极高(如需要昂贵的DFT(密度泛函理论)计算或实验测量)。2.2 AlphaFold2/3:蛋白质结构的端到端预测
出处:
Jumper, J. et al. "Highly accurate protein structure prediction with AlphaFold."Nature, 596, 583-589 (2021);
Abramson, J. et al. "Accurate structure prediction of biomolecular interactions with AlphaFold 3."Nature, 630, 493-500 (2024).
基本信息:由DeepMind于2021年(AlphaFold2)和2024年(AlphaFold3)开发。AlphaFold2于2020年在CASP14竞赛中取得突破性成绩,2021年正式发表于Nature。AlphaFold3于2024年5月发布。
能力与适用场景:根据氨基酸序列高精度预测蛋白质的三维结构。AlphaFold3进一步扩展至蛋白质与DNA、RNA、小分子配体、离子等的复合物结构预测。适合结构生物学、基于结构的药物设计(SBDD)、蛋白质工程。
局限与限制:对缺乏同源序列的孤儿蛋白预测精度下降;无法直接预测蛋白质的动态构象变化和折叠动力学过程;对内在无序区域(IDR)的预测置信度低;AlphaFold3对共价修饰和翻译后修饰的处理仍有限。
详细计算与处理过程:
多序列比对(MSA)构建:给定目标氨基酸序列,通过JackHMMER等工具在大型序列数据库(如UniRef、BFD)中搜索同源序列,构建MSA。MSA蕴含了关键的进化共变信息:若两个位点在进化中总是同时突变,它们在三维空间中极大概率相互接触。同时构建模板库,即从PDB中找到的与目标序列相似的已知结构。
Evoformer特征提取:将MSA(维度为序列数乘以残基数)和残基对表示(维度为残基数乘以残基数)输入48层Evoformer模块。每层包含两个子模块。MSA表示更新:对MSA的每一行做注意力计算(行注意力,捕捉同一序列中不同残基的关系),再对每一列做注意力计算(列注意力,捕捉不同序列中同一位置的进化信息),并通过外积均值(outer product mean)将信息从MSA表示传递到残基对表示。残基对表示更新:对残基对矩阵做三角形注意力计算(triangle attention),分为"以起始节点为起点"和"以终止节点为起点"两种方向,捕捉三个残基之间的几何约束(如三角不等式)。经过48层后,MSA表示和残基对表示充分融合了进化信息和几何约束。
结构模块(Structure Module)精化:从Evoformer输出的残基对表示和MSA表示的第一行出发,结构模块以迭代方式(八次循环)精化三维坐标。每次循环中,使用不变点注意力(Invariant Point Attention, IPA):在每个残基的局部坐标系中做注意力计算,保证输出对刚体变换不变。然后更新每个残基的刚体变换(旋转和平移),即更新每个残基的局部坐标系。最后将局部坐标转换为全局坐标,得到所有原子的三维位置。
训练:使用PDB中约十七万个已知结构的蛋白质作为训练数据。损失函数为Frame Aligned Point Error(FAPE),衡量预测的原子坐标与真实坐标之间的偏差,在每个残基的局部坐标系中计算,以保证旋转平移不变性。训练使用一百二十八块TPUv3,耗时数周。
AlphaFold3的扩散架构:AlphaFold3将结构生成改为扩散模型,从噪声出发逐步去噪生成三维原子坐标,使其能统一处理各类生物分子复合物,无需针对不同类型设计特定的对接模块。
技术进展与应用:AlphaFold2预测了超2亿个蛋白质结构,彻底改变了结构生物学的工作流;AlphaFold3的发布则使药物靶点-配体复合物的结构预测成为可能。基于这些技术底座,DeepMind旗下的Isomorphic Labs在2024年与礼来(Eli Lilly)和诺华(Novartis)达成了总价值数十亿美元的药物研发合作,标志着AI结构预测正式跨越为工业级小分子药物设计的核心引擎。而到了2026年2月10日,该公司通过一份27页的技术报告正式发布了全新的AI药物设计引擎 IsoDDE。该引擎在 Runs N' Poses 等关键基准测试中性能全面超越AlphaFold 3,被《自然》杂志及众多科学家誉为 “AlphaFold 4”。IsoDDE不仅在复合物结构预测上达到了新高度,更在小分子对接与亲和力优化的药物设计任务中展现出惊人的精度,标志着AI在生物分子相互作用预测领域迈入了一个更高精度的全新世代。目前,全球已有数百万研究人员深度依赖AlphaFold及Isomorphic生态进行研发。2.3 GNoME:图神经网络与主动学习发现新材料
出处:
Merchant, A. et al. "Scaling deep learning for materials discovery."Nature, 624, 80-85 (2023).
基本信息:由Google DeepMind于2023年开发并发表于Nature。
能力与适用场景:预测晶体材料的形成能,筛选热力学稳定的新材料。适合无机固体材料的发现,特别是寻找具有特定元素组成的稳定晶体结构。
局限与限制:仅预测热力学稳定性(形成能),无法评估动力学稳定性(如材料在特定条件下是否容易分解);无法提供合成路径建议;对含有复杂缺陷、表面或界面的材料预测能力有限;训练数据依赖于已有的DFT计算结果,可能存在偏差。
详细计算与处理过程:
晶体图表示:将晶体结构表示为图,原子为节点(特征包含元素类型、氧化态等),化学键为边(特征包含键长、键角等)。同时使用晶体学的周期性边界条件,确保图表示能正确反映晶体的无限周期性。
图神经网络(GNN)预测:使用消息传递神经网络(Message Passing Neural Network),多轮消息传递后,聚合所有节点信息,输出该晶体的形成能(formation energy)预测。形成能越低,结构越稳定。
主动学习闭环(Active Learning Loop):这是GNoME的核心。第一轮,用已有的DFT计算数据(约四万八千个稳定结构)训练图神经网络。第二轮,用训练好的模型对大量候选结构(通过元素替换、结构扰动等方式生成)进行预测,选出预测形成能最低的候选。第三轮,对选出的候选进行DFT精确计算(每个结构约需分钟级CPU时间),获得真实形成能。第四轮,将DFT结果加入训练集,重新训练图神经网络。重复第二至第四轮多轮。
结果验证:最终,GNoME预测了二百二十万个稳定晶体结构,其中约三十八万个是全新的(此前未被任何数据库收录)。
技术进展与应用:GNoME的发现已对材料科学产生重大影响。目前已有数十种GNoME预测的材料被全球多个独立实验室(如A2A项目)成功合成并验证,包括新型超导体、热电材料和催化剂。这一工作彻底改变了材料科学"试错法"的研发模式,将材料发现效率提高了数个数量级。2.4 GraphCast / GenCast / 盘古气象 / 风乌:AI气象预报
出处:
Lam, R. et al. "Learning skillful medium-range global weather forecasting."Science, 382(6677), 1416-1421 (2023);
Price, I. et al. "GenCast: Diffusion-based ensemble forecasting for medium-range weather."Nature(2024);
Bi, K. et al. "Accurate medium-range global weather forecasting with 3D neural networks."Nature, 619, 533-538 (2023);
Chen, L. et al. "FengWu: Pushing the limits of large language models for medium-range weather forecasting."arXiv preprint(2023).
基本信息:GraphCast和GenCast由DeepMind开发(GenCast为2024年底发布的最新扩散模型气象系统);盘古气象大模型由华为于2023年开发并发表于Nature;风乌由上海人工智能实验室于2023年开发。
能力与适用场景:利用深度学习模型输入当前全球气象状态,自回归预测未来数天至十天的全球天气。GenCast特别擅长生成概率性集合预报,量化极端天气的不确定性。适合中期天气预报,可替代或辅助传统数值天气预报系统。
局限与限制:对极端罕见天气事件(如突发龙卷风、局地暴雨)的预测能力仍有提升空间;长期自回归预测会产生误差累积和模糊化(Blurring)现象;模型训练依赖于历史再分析数据,对气候变化的适应性有限;无法提供物理解释。
详细计算与处理过程:
数据与图构建:使用ERA5等再分析数据(1979至2018年),包含全球范围内温度、风速、气压、湿度等气象变量在多个气压层上的分布,空间分辨率为零点二五度。GraphCast将地球表面离散化为基于二十面体的多分辨率网格(约一百万个节点)。盘古气象使用3D Transformer架构,将大气层划分为多个气压层。风乌采用类似的多层3D架构。
空间信息聚合:通过多层图上的消息传递(GraphCast)或3D Transformer的注意力机制(盘古、风乌),聚合全球气象信息,模拟大气中不同区域之间的相互作用和物理传播。
GenCast的扩散采样:GenCast引入了扩散模型,通过从噪声中采样生成多个可能的未来天气轨迹,从而提供集合预报,解决了传统AI气象模型预测结果"模糊化"的问题。
自回归迭代:一次前向传播输出未来6小时状态,将输出作为下一步输入,循环迭代实现十天以上的中期预报。
技术进展与应用:GraphCast在1380个预报变量中的90%以上指标超越了欧洲中期天气预报中心(ECMWF)的传统数值天气预报系统(IFS),且推理速度快一千倍以上。GenCast在概率预报和极端天气预警上表现卓越。盘古气象大模型已在华为云上线服务,为全球用户提供气象预报API。风乌在多项指标上也达到了国际领先水平。2.5 ESMFold 与 AlphaMissense:蛋白质语言模型与突变预测
出处:
Hayes, T. et al. "Simulating 500 million years of evolution with a language model (ESM3)." Science / bioRxiv (2024);
Cheng, J. et al. "Accurate proteome-wide missense variant effect prediction with AlphaMissense." Science, 381(6664) (2023).
基本信息:ESMFold由Meta AI(FAIR)于2022年发布,2023年正式发表于Science;AlphaMissense由DeepMind于2023年开发并发表于Science。ESM3由EvolutionaryScale团队于2024年底发布;AlphaMissense由DeepMind于2023年开发并发表于Science。
能力与适用场景:ESM3是一个拥有980亿参数的蛋白质基础模型,能够联合理解并生成蛋白质的序列、结构和功能。它不仅能进行极速结构预测,更适合从头设计具有特定功能的全新蛋白质。AlphaMissense预测了7100万个人类错义突变的致病性,适合罕见病和遗传病研究。
局限与限制:ESM3模型极其庞大,推理和微调的算力门槛极高;对超大分子复合物的生成仍需结合其他物理精化工具;AlphaMissense仅提供致病性概率,无法解释具体分子机制。
详细计算与处理过程:
ESM3的计算过程:ESM3采用了一种创新的“掩码边缘建模”架构,在序列、结构(三维坐标的离散化token)和功能(关键词和GO术语)三个模态上进行联合预训练。它“模拟”了数亿年的蛋白质进化过程。在推理和生成时,用户可以通过指定部分结构或功能标签,让模型通过自回归或迭代掩码预测的方式,生成完全符合要求的新型蛋白质序列和结构。
AlphaMissense的计算过程:基于AlphaFold2的架构,对目标蛋白的每个氨基酸位点进行突变,计算突变前后序列到结构的“适应度”变化,从而对7100万个错义突变进行致病性评分。
技术进展与应用:ESM3的标志性成果是设计出了自然界中从未存在过的全新荧光蛋白(esmGFP),该蛋白在湿实验中成功表达并发出明亮荧光,这标志着AI从“结构预测”正式迈入了“蛋白质功能创造”的时代。AlphaMissense的预测结果则已被广泛整合到临床遗传学数据库中。2.6 MACE / NequIP:机器学习力场
出处:
Batatia, I. et al. "MACE: Higher Order Equivariant Message Passing Neural Networks for Fast and Accurate Force Fields."NeurIPS(2022);
Batzner, S. et al. "E(3)-equivariant graph neural networks for data-efficient and accurate interatomic potentials."Nature Communications, 13, 2453 (2022).
基本信息:MACE由剑桥大学、多伦多大学等机构于2022年开发并发表于NeurIPS;NequIP由哈佛大学、MIT等机构于2022年开发并发表于Nature Communications。
能力与适用场景:用等变图神经网络学习原子间势能面,替代昂贵的DFT计算,预测每个原子受到的力和系统总势能。适合大规模分子动力学模拟、材料热力学性质计算、催化反应模拟。
局限与限制:对训练数据中未出现过的极端化学环境(如断键、化学反应过渡态)泛化能力较差;训练数据的获取仍需依赖DFT计算;对长程相互作用(如范德华力)的处理需要特殊设计。
详细计算与处理过程:
图构建:以原子为节点,一定截断半径内的原子对为边,构建分子图。节点特征包括原子序数,边特征包括原子间距离和方向。
高阶等变消息传递:使用高阶等变消息传递(不仅传递标量信息,还传递向量和张量信息,如球谐函数展开)。多轮消息传递后,节点特征充分融合了局部化学环境信息。等变性(Equivariance)保证了:如果整个分子旋转或平移,预测的力也相应旋转或平移,严格符合物理定律。MACE通过引入更高阶的张量积,显著提升了模型的表达能力和精度。
输出与动力学积分:预测每个原子受到的力(三维向量)和系统总势能。将MACE或NequIP嵌入分子动力学模拟循环(如Velocity Verlet算法),更新原子位置。相比DFT,加速数千倍,精度接近DFT水平。
技术进展与应用:MACE和NequIP已成为计算化学和材料科学中广泛使用的工具。它们使得原本需要数周超算时间的分子动力学模拟可以在数小时内完成,极大地加速了新材料和催化剂的筛选过程。2.7 Enformer 与 Evo:基因组学基础模型
出处:
Avsec, Ž. et al. "Effective gene expression prediction from sequence by integrating long-range interactions (Enformer)."Nature Methods, 18, 1196-1203 (2021);
Nguyen, E. et al. "Sequence modeling and design from molecular to genome scale with Evo."Science, 386(6723) (2024).
基本信息:Enformer由DeepMind于2021年开发并发表于Nature Methods;Evo由Arc Institute于2024年开发并发表于Science。
能力与适用场景:Enformer根据DNA序列预测基因表达水平和染色质可及性,适合非编码区变异的功能解读。Evo是一个基于DNA语言模型的基础模型,能够进行基因组的序列建模和设计,适合合成生物学和基因组工程。
局限与限制:Enformer对细胞类型特异性的预测能力有限;Evo生成的基因组序列仍需大量的湿实验验证;模型庞大,推理成本高。
详细计算与处理过程:
Enformer的计算过程:输入一段长达200kb的DNA序列,通过卷积层提取局部motif特征,然后通过多层Transformer(带有相对位置编码和注意力稀释机制)捕捉长程相互作用(如增强子与启动子的相互作用),最终输出5313个基因组轨道(如CAGE信号、ChIP-seq信号)的预测值。
Evo的计算过程:使用StripedHyena架构(一种结合了卷积和注意力机制的高效长序列架构),在数万个原核生物基因组上进行自监督预训练。模型学习DNA序列的深层语法和进化约束,能够进行基因组的条件生成、突变效应预测和基因线路设计。
技术进展与应用:Enformer已被广泛用于解读GWAS研究中发现的非编码区疾病相关变异。Evo的发布标志着AI从蛋白质层面深入到了基因组层面,为设计全新的基因线路和合成生物学提供了强大工具。2.8 神经算子:FNO / DeepONet / NeuralGCM
完整出处:
Li, Z. et al. "Fourier Neural Operator for Parametric Partial Differential Equations."ICLR(2021);
Lu, L. et al. "Learning nonlinear operators via DeepONet."Nature Machine Intelligence, 3, 218-229 (2021);
Magnusson, M. et al. "NeuralGCM: A hybrid machine learning and physics model for weather and climate."arXiv preprint(2024).
基本信息:FNO由加州理工学院等机构于2021年开发;DeepONet由布朗大学等机构开发;NeuralGCM由Google Research等机构于2024年开发。
能力与适用场景:神经算子(Neural Operators)旨在学习无穷维函数空间之间的映射,用于快速求解偏微分方程(PDE)。适合流体力学(Navier-Stokes方程)、热传导、气象气候模拟等复杂物理系统的快速仿真。
局限与限制:对训练数据中未出现过的边界条件和几何形状泛化能力有限;模型的可解释性较差;训练需要大量高精度的PDE求解数据。
详细计算与处理过程:
FNO的计算过程:将输入函数(如初始流场)进行傅里叶变换转换到频域,在频域中使用线性层(谱卷积)学习全局相互作用,随后进行逆傅里叶变换回到物理空间。通过多层此类结构,FNO能够以网格无关的方式直接学习偏微分方程的解算子,其频域卷积操作天然具备全局感受野,可高效捕捉长程物理相互作用。
DeepONet的计算过程:采用独特的双分支架构来学习无穷维函数空间之间的映射。其中,分支网络负责提取输入函数(如边界条件或源项)的全局特征,主干网络负责提取查询坐标(如空间位置或时间)的基函数特征。最终输出通过这两个特征向量的融合计算得出。这种设计使其能够学习任意非线性算子,并在训练后实现对任意连续坐标点的快速查询,摆脱了对固定网格离散化的依赖。
NeuralGCM的计算过程:采用物理与数据驱动的混合架构,将传统的物理动力核心(通用环流模型)与机器学习参数化方案相结合。在计算循环中,机器学习模块负责预测对流、辐射等难以精确解析的小尺度物理过程,并将其作为强迫项输入到物理动力核心中。这种混合计算模式在大幅降低计算成本的同时,严格保证了宏观物理过程的守恒性。
技术进展与应用:神经算子已在空气动力学设计、石油藏模拟和气候建模中展现出巨大潜力。NeuralGCM在保持物理一致性的同时,显著提高了中期和次季节气候预报的准确性。
三、范式二:生成式模型与分布采样3.1 范式核心原理、适用情况与局限限制
核心原理:本范式的目标不是预测已有事物的属性,也不是从已有选项中挑选最优,而是学习目标数据的潜在概率分布,并从中采样生成全新的、符合物理规律的结构。近年来,去噪扩散概率模型(DDPM)和流匹配(Flow Matching)成为主流生成框架。其核心计算过程是一个从纯噪声逐步逆向去噪(或沿向量场积分)的过程。生成模型与监督预测模型的根本区别在于:监督预测是"给定输入,预测输出"(如给定序列预测结构),生成模型是"从分布中采样新结构"(如从噪声中生成一个全新的蛋白质)。
适用情况:需要从头设计(De novo design)全新结构;数据足以支撑分布学习;结构具有明确的几何或拓扑表示。典型应用包括蛋白质从头设计、分子对接、晶体材料生成、抗体设计、3D分子生成。
局限与限制:生成的结构可能违反物理定律或化学合成规则(如合成可及性差);模式崩塌(Mode Collapse)问题可能导致生成的多样性不足;条件生成的精确控制仍然困难;生成过程通常需要数百步迭代,计算成本较高;生成的结构需要后续的实验验证,成功率不确定。3.2 RFdiffusion:三维等变扩散模型设计蛋白质
出处:
Watson, J.L. et al. "De novo design of protein structure and function with RFdiffusion."Nature, 620, 1085-1092 (2023).
基本信息:由华盛顿大学David Baker实验室于2023年开发并发表于Nature。
能力与适用场景:从随机噪声中生成全新的蛋白质三维骨架,并可根据靶点结构进行条件生成。适合从头设计高亲和力结合蛋白(Binder)、酶活性位点设计、对称蛋白纳米材料设计。
局限与限制:仅生成蛋白质骨架(无氨基酸序列),需依赖其他工具(如ProteinMPNN)设计序列;生成的复杂拓扑结构可能在湿实验中难以表达或折叠;对膜蛋白等复杂环境中的蛋白设计能力有限。
详细计算与处理过程:
前向加噪过程(训练阶段):给定一个真实的蛋白质三维结构(包含每个残基的氮、碳、碳原子的三维坐标和方向),在训练时逐步向其添加高斯噪声。经过一千步加噪后,结构完全变成随机噪声。同时,对蛋白质的骨架扭转角也进行相应的加噪处理。
训练去噪网络:训练一个三维等变神经网络(基于RoseTTAFold架构改进),使其能够根据当前的噪声状态和时间步,预测出被添加的噪声(或预测出无噪声的干净结构)。等变性(Equivariance)保证了无论蛋白质在空间中如何旋转和平移,网络的预测结果都遵循相同的几何变换,这对于三维分子结构至关重要。
条件引导生成(推理阶段):从纯随机噪声开始,神经网络逐步预测并减去噪声。在这个过程中,可以引入条件信息(Conditioning)。例如,如果目标是设计一个结合特定靶点蛋白的binder,可以将靶点蛋白的固定结构作为条件输入,网络在去噪时就会"避开"靶点所占的空间,并在结合界面处生成互补的形状和化学性质。
序列设计:RFdiffusion主要生成蛋白质的三维骨架(Backbone)。生成骨架后,通常需要使用另一个基于深度学习的序列设计工具(如ProteinMPNN)为骨架分配最合适的氨基酸序列,最后使用AlphaFold2进行结构验证和精化。
技术进展与应用:RFdiffusion设计的多种高亲和力蛋白质binder已成功通过湿实验验证,部分针对流感病毒和新冠病毒的中和蛋白设计已进入临床前研究阶段。此外,RFdiffusion还被用于设计新型酶、蛋白纳米材料和信号蛋白,展现了极高的商业与医疗价值。3.3 Boltz-1/2、Chroma 与 FrameDiff:开源多模态与可编程蛋白质生成
出处:
Gatmiry, K. et al. "Boltz-1: Democratizing Biomolecular Interaction Modeling." arXiv preprint (2024);
Ingraham, J.B. et al. "Illuminating protein space with a programmable generative model (Chroma)." Nature, 613, 110-118 (2023);
Yim, J. et al. "SE(3) diffusion model with application to protein backbone generation (FrameDiff)." ICML (2023).
基本信息:Boltz-1/2由Boltz公司于2024年底开源发布;Chroma由Generate Biomedicines于2023年开发;FrameDiff由MIT等机构于2023年开发。
能力与适用场景:Boltz-1/2是开源的多模态生物分子大模型,不仅能高精度预测蛋白质、核酸与小分子的复合物结构,还具备强大的亲和力优化和配体生成能力,被视为AlphaFold 3在开源社区的最强平替。Chroma强调“可编程性”,允许用户通过几何约束控制生成;FrameDiff专注于在SE(3)群上进行严格的蛋白质骨架生成。
局限与限制:Boltz对极度灵活的无序区域预测仍有挑战;Chroma和FrameDiff对大分子复合物的生成控制精度仍需提升;生成的骨架均需后续序列设计工具适配。
详细计算与处理过程:
Boltz-1/2的计算过程:采用基于Transformer的编码器-解码器架构。编码器使用相对位置编码和三角注意力机制处理多聚体复合物的序列和MSA信息;解码器则结合了扩散模型(Diffusion Model)和置信度预测模块。在生成模式下,Boltz能够以靶点口袋为条件,直接在三维空间中扩散生成高亲和力的小分子配体或优化现有配体的侧链,实现“预测+生成”的一体化。
Chroma的计算过程:使用基于图神经网络的扩散模型,在蛋白质的骨架坐标和侧链构象空间上进行去噪。其核心创新在于引入了“编程接口”,用户可以通过指定对称性或几何约束,引导去噪过程生成符合要求的蛋白质结构。
FrameDiff的计算过程:将蛋白质骨架表示为SE(3)群上的刚体变换序列。在推理时,从SE(3)群上的均匀分布噪声出发,使用等变神经网络逐步去噪,生成符合蛋白质几何约束的全新骨架。
技术进展与应用:Boltz-1的开源极大地降低了全球科研机构进行靶点-药物复合物设计的门槛,其在多个盲测榜单(如CASP和DockQ)上达到了与闭源商业模型相当的SOTA水平。Chroma和FrameDiff则为设计具有特定对称性的蛋白纳米材料提供了精细的控制能力。3.4 MatterGen 与 CDVAE:材料晶体生成
出处:
Zeni, C. et al. "A generative model for materials discovery."Nature, 638, 95-100 (2025);
Xie, T. et al. "Crystal Diffusion Variational Autoencoders for Periodic Material Generation."ICLR(2022).
基本信息:MatterGen由Microsoft Research于2024/2025年发布并发表于Nature;CDVAE由斯坦福大学等机构于2022年开发并发表于ICLR。
能力与适用场景:根据用户指定的宏观物理性质(如带隙、体积模量)或化学组成,直接生成满足条件的新晶体结构。适合特定功能材料的逆向设计,如寻找新型固态电解质、催化剂、超导材料。
局限与限制:生成的晶体可能在动力学上不稳定;对复杂多相材料的生成能力有限;条件生成的精度受限于训练数据中性质标注的准确性;生成的结构仍需DFT计算和实验验证。
详细计算与处理过程:
MatterGen的计算过程:在离散空间(原子种类)和连续空间(坐标、晶格)上分别定义扩散过程。其核心在于属性条件注入:在训练和推理时,将用户指定的宏观物理性质或化学组成约束,通过交叉注意力机制注入去噪网络。推理时从随机噪声出发,网络在每一步去噪时都会感知目标条件,引导生成过程向满足该性质的流形区域移动,最终输出全新的晶体结构。
CDVAE的计算过程:采用变分自编码器与扩散模型结合的架构。首先,使用图神经网络编码器将晶体结构编码为潜在空间中的概率分布并采样得到潜在向量;随后,解码器从潜在向量重建出一个粗糙的晶体结构;最后,在解码器中引入扩散过程,对原子坐标和晶格参数进行多步去噪精化,从而显著提高生成结构的物理合理性和热力学稳定性。
技术进展与应用:MatterGen在Nature上的发表标志着材料生成模型达到了新的里程碑。其生成的多种新型晶体结构已通过DFT计算验证,部分正在实验合成中。CDVAE作为早期工作,为后续的材料生成模型奠定了基础。3.5 DiffDock 与 DiffSBDD:分子对接与3D生成
出处:
Corso, G. et al. "DiffDock: Diffusion Steps, Twists, and Turns for Molecular Docking."ICLR(2023);
Schneuing, A. et al. "Structure-based drug design with geometric deep learning (DiffSBDD)."Nature Computational Science, 3, 89-99 (2023).
基本信息:DiffDock由MIT和Broad Institute于2023年开发并发表于ICLR;DiffSBDD等3D分子生成模型由学术界广泛开发并发表于Nature Computational Science。
能力与适用场景:DiffDock预测小分子配体在蛋白质口袋中的结合位姿;DiffSBDD基于靶点口袋的三维几何形状,直接扩散生成能与之结合的全新3D分子结构。适合虚拟筛选、药物发现中的先导化合物优化、蛋白-配体相互作用研究。
局限与限制:对诱导契合效应(蛋白口袋形状改变)的处理仍不够完美;打分函数难以精确评估结合亲和力;对大分子配体(如多肽)的处理能力有限;生成的位姿或分子仍需实验验证。
详细计算与处理过程:
DiffDock的计算过程:在由平移、旋转和内部扭转角构成的复合流形空间上定义扩散过程。训练时对已知结合位姿逐步加噪;推理时,从随机的平移、旋转和扭转角出发,神经网络逐步预测并减去噪声分量。整个过程通过约两百步迭代,直接在流形空间中生成配体在蛋白质口袋中的正确结合位姿,避免了传统方法在构象空间中的盲目穷举搜索。
DiffSBDD的计算过程:在三维笛卡尔坐标和原子类型空间上定义扩散过程。其核心是将蛋白质口袋的表面几何与化学特征编码为条件向量,通过交叉注意力机制注入去噪网络。在去噪过程中,网络不仅逐步生成原子的三维坐标,还同步预测原子间的化学键连接关系,最终在口袋内部直接输出完整的三维分子图。
技术进展与应用:DiffDock在多个分子对接基准测试中显著超越了传统方法(如AutoDock Vina)和早期的深度学习方法。DiffSBDD为基于结构的药物设计提供了全新的"生成式"思路,避免了传统虚拟筛选对已知化合物库的依赖。
四、范式三:强化学习与序贯决策4.1 范式核心原理、适用情况与局限限制
核心原理:本范式将问题建模为马尔可夫决策过程(MDP)。系统通过训练策略网络(Policy Network,决定"下一步做什么")和价值网络(Value Network,评估"当前局面有多好"),结合蒙特卡洛树搜索(MCTS)等算法,在庞大的离散状态空间中进行有导向的序列决策。其核心优势在于能够处理具有严格逻辑规则和长程依赖的序列决策问题。
适用情况:问题具有严格的规则和逻辑验证机制;解空间具有树状或图状的序贯决策结构;需要长程规划;存在明确的奖励信号。典型应用包括定理证明、分子序列优化、博弈、算法设计。
局限与限制:极度依赖奖励函数(Reward Function)的设计,奖励稀疏或设计不当会导致系统"作弊"(Reward Hacking)或陷入局部最优;训练过程极不稳定,样本效率通常较低;需要大量的自我博弈或模拟训练;对连续动作空间的处理不如离散动作空间成熟。4.2 AlphaProof 与 AlphaGeometry:形式化数学证明
出处:
DeepMind. "AI solves IMO problems at silver medal level."Technical Report(2024);
Trinh, T. H. et al. "Solving olympiad geometry without human demonstrations."Nature, 625, 476-483 (2024).
基本信息:AlphaProof和AlphaGeometry均由DeepMind于2024年发布。AlphaGeometry于2024年1月发表于Nature;AlphaProof于2024年7月发布技术报告。
能力与适用场景:在Lean 4等交互式定理证明器中,自动寻找数学定理的证明路径。适合代数、数论和几何的严密逻辑推理,特别是竞赛级别的数学问题。
局限与限制:高度依赖形式化语言的表达能力和已有定理库的丰富度;对于需要极强直觉和跨领域灵感的开放性数学猜想,目前仍无能为力;形式化翻译本身可能引入错误;计算资源消耗巨大。
详细计算与处理过程:
AlphaProof的计算过程:
环境构建与形式化:将自然语言数学题目翻译为Lean 4(交互式定理证明器)的形式化语言。Lean 4充当绝对严格的"环境"和"裁判",任何不符合逻辑的推理步骤都会被拒绝。
状态与动作定义:状态为当前证明进度(已证引理、当前目标)。动作为应用一个Lean 4战术(Tactics),如引入变量、应用已知定理、进行代数变形、分情况讨论。
策略与价值网络:使用经过海量数学数据微调的大语言模型作为策略网络,根据当前证明状态生成候选战术;同时训练一个价值网络,用于评估当前未完成的证明状态距离最终目标的"距离"或"胜率"。
蒙特卡洛树搜索(MCTS)推理:面对新题,启动MCTS。在树的每个节点,策略网络生成若干候选战术;系统模拟执行这些战术(由Lean 4验证合法性);价值网络评估新节点的潜力。MCTS通过PUCT算法(Polynomial Upper Confidence Trees)平衡"探索"(尝试价值网络不确定但策略网络认为有可能的战术)和"利用"(深入挖掘价值网络评分高的分支)。
闭环与强化学习更新:当某分支成功闭合证明目标(Lean 4输出"证明完成"),搜索终止。搜索的成功或失败轨迹被用于更新策略和价值网络,使系统在未来面对类似问题时搜索更高效。
AlphaGeometry的计算过程:
神经符号混合架构:结合神经网络(用于提出辅助构造)和符号推理引擎(用于逻辑推导)。
辅助构造生成:神经网络根据当前几何图形,提出可能的辅助线或辅助点构造(如"连接两点"、"作垂线")。
符号推导:符号引擎基于欧几里得几何公理和已知定理,对构造后的图形进行逻辑推导,尝试证明目标。
迭代搜索:若推导失败,回溯并尝试其他辅助构造,直至找到证明。
技术进展与应用:AlphaProof在2024年IMO中获得28分(满分42分),达到银牌水平。AlphaGeometry在IMO几何题上达到接近金牌水平。其背后的Lean 4形式化验证技术正深刻改变数学界的工作方式,陶哲轩等顶尖数学家已开始使用Lean辅助验证复杂定理。4.3 AlphaTensor:矩阵乘法算法发现
出处:
Fawzi, A. et al. "Discovering faster matrix multiplication algorithms with reinforcement learning."Nature, 610, 47-53 (2022).
基本信息:由DeepMind于2022年开发并发表于Nature。
能力与适用场景:将矩阵乘法转化为三维张量分解的博弈游戏,寻找计算步数更少的算法。适合基础计算科学和底层算子优化,可应用于深度学习训练加速。
局限与限制:发现的算法在特定硬件上的实际加速比受限于内存访问和指令集,理论步数少不等于实际运行快;对超大矩阵的扩展性有限;搜索空间随矩阵维度呈指数增长。
详细计算与处理过程:
问题建模:将矩阵乘法建模为马尔可夫决策过程。状态是当前部分分解的张量,动作是选择一个秩一张量进行减去。
AlphaZero式强化学习:结合策略网络和价值网络,使用MCTS在庞大的张量分解动作空间中进行自我博弈。
奖励设计:完成张量分解所需的步数越少,奖励越高。
自我博弈训练:两个AlphaTensor副本对弈,不断优化分解策略。经过数百万局自我博弈,网络不断提升。
结果提取:最终发现优于人类已知算法的矩阵乘法方案,如4x4复数矩阵乘法仅需48次标量乘法。
技术进展与应用:AlphaTensor发现了优于Strassen算法的矩阵乘法方案,这一成果对基础计算机科学具有重要意义。其发现的算法已被整合到部分深度学习框架中,用于加速特定规模的矩阵运算。4.4 REINVENT / MolDQN:分子序列优化
出处:
Olivecrona, M. et al. "Molecular de-novo design through deep reinforcement learning."Journal of Cheminformatics, 9, 48 (2017).
基本信息:REINVENT由AstraZeneca等机构于2017年开发,此后持续迭代至2023年。MolDQN等变体由Insilico Medicine等机构开发。
能力与适用场景:通过强化学习优化分子的SMILES序列,同时改善靶点亲和力、毒性和药代动力学性质。适合先导化合物优化、多目标分子设计。
局限与限制:容易生成难以合成的"怪物分子"(合成可及性差);奖励函数的加权难以平衡多个冲突目标;对SMILES语法的依赖限制了生成效率;训练过程可能不稳定。
详细计算与处理过程:
环境定义:将分子生成视为序列生成任务。状态为当前已生成的SMILES字符串片段,动作为从字符表中选择下一个字符(如'C', 'O', '(', ')')。
策略网络:使用RNN或Transformer作为策略网络(Agent),输出下一个字符的概率分布。
奖励函数(Reward)设计:当生成完整分子后,调用外部工具计算其属性(如对接打分、QED、合成可及性SA)。将这些属性通过加权组合转化为标量奖励。
策略梯度更新:使用PPO或REINFORCE等强化学习算法,根据获得的奖励更新策略网络参数。高奖励的分子序列对应的生成概率被提高,低奖励的被抑制。
迭代生成:经过数万步训练,策略网络学会直接生成高奖励的分子序列,无需在庞大的化学空间中进行盲目搜索。
技术进展与应用:RL已成为AI制药中多目标分子优化的标配方法,广泛用于提高分子的靶点亲和力、改善药代动力学性质(ADMET)以及降低毒性。多家制药公司已将RL分子优化整合到其药物发现流程中。
五、范式四:进化计算与黑盒优化5.1 范式核心原理、适用情况与局限限制
核心原理:本范式主要用于解决缺乏解析梯度的黑盒优化和组合优化问题。系统通过维护候选解种群,利用评估函数计算适应度,通过选择、交叉、变异等操作进行种群迭代(进化搜索);或利用代理模型引导单点序贯评估(贝叶斯优化)。与传统遗传算法的根本区别在于,AI4S中的进化搜索使用大语言模型作为变异引擎,使变异具有语义理解能力。
适用情况:解空间离散、非凸、缺乏梯度;评估函数可自动化执行;解可表示为代码、图或结构化方案;存在渐进改进的可能。典型应用包括算法发现、超参调优、科学假设演化、实验条件优化。
局限与限制:计算成本随维度呈指数级增长(维度灾难);如果评估函数本身极其昂贵(如真实的湿实验),则无法进行大规模种群迭代;容易陷入局部最优;对评估函数的质量高度依赖,若评估函数存在漏洞,系统会"作弊"(Reward Hacking)。5.2 AlphaEvolve 与 FunSearch:LLM驱动的进化搜索
出处:
Romera-Paredes, B. et al. "Mathematical discoveries from program search with large language models."Nature, 625, 468-475 (2024);
DeepMind. "AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms."Technical Report / arXiv preprint(2025).
基本信息:FunSearch由DeepMind于2023年开发,2024年正式发表于Nature;AlphaEvolve由DeepMind于2025年发布,是FunSearch的工程化升级版。
能力与适用场景:通过LLM生成和变异代码,在沙箱中自动评估,寻找更优的算法实现。适合组合数学、启发式算法设计、数据中心调度优化、芯片设计优化、量子物理算法优化。
局限与限制:极度依赖评估函数的准确性和运行速度;如果评估函数存在漏洞,系统会"作弊"(Reward Hacking);对评估函数的设计能力要求高;计算资源消耗巨大;对缺乏自动化评估的纯理论问题难以直接应用。
详细计算与处理过程:
FunSearch的完整计算过程:
解的表示与问题编码:将候选解表示为可执行的Python函数。以cap set问题为例,每个候选是一个启发式评分函数,输入为有限域中的元素组合,输出为数值评分,用于指导cap set的贪心构造。选择函数而非数值向量作为表示,是因为大语言模型对代码的理解和生成能力远强于对抽象数值的操作。
初始种群生成:使用基于PaLM-2的代码模型Codey,通过精心设计的提示词(如"请编写一个用于构造cap set的启发式函数")生成数百个初始Python函数。这些函数构成了搜索的起点。
沙箱自动化评估:将每个函数嵌入一个贪心构造算法中,在隔离的沙箱环境中实际运行。评估标准是确定性的、自动化的:运行该算法,得到构造出的cap set大小作为适应度分数。评估过程无需人工介入。
选择与淘汰:根据评估分数对种群中的个体排序,保留得分最高的前百分之十个体。其余个体被淘汰。
大语言模型驱动的语义变异:这是与传统遗传算法的根本区别。将高分函数的完整代码作为上下文输入大语言模型,连同改进指令一起提交(如"分析此代码的策略,提出改进方案,生成一个更优的函数变体")。大语言模型利用其代码理解能力,分析现有策略的不足(如"当前贪心策略在后期选择过于保守"),生成多个具有实质性改进的子代程序。这些变体可能改变核心策略(如从贪心改为局部搜索),也可能只是微调参数或边界条件。
种群更新与迭代:新种群由保留的父代和新生成的子代组成,淘汰最差的个体以维持种群大小。重复第三至第五步,运行数十万代。种群的最低分和平均分应呈持续上升趋势。
结果提取与数学洞察:搜索结束后,取出最高分函数,由数学家分析其构造策略,提取数学洞察。FunSearch最终找到了比已知构造更大的cap set,推翻了数学界之前的猜想。
AlphaEvolve的完整计算过程(在FunSearch基础上的重大升级):
问题编码与目标定义:将优化目标编码为可自动评估的程序规范。以矩阵乘法为例,目标是生成一个程序,该程序实现两个矩阵的乘法,评估标准为标量乘法次数(越少越好)和结果正确性。
初始种群生成:由Gemini生成一批矩阵乘法实现(可能包括经典算法、Strassen变体等),构成初始种群。
多阶段评估管道:这是AlphaEvolve的核心创新之一。第一阶段为轻量级快速筛选:对每个候选程序进行基本语法检查和简单测试用例运行,快速淘汰明显错误的候选。第二阶段为完整评估:对通过初筛的候选进行全面的正确性验证(对随机矩阵执行乘法,检查结果是否正确)和性能评估(统计标量乘法次数)。这种多阶段管道避免了在无效候选上浪费计算资源。
双模型协作变异:AlphaEvolve使用Gemini Flash和Gemini Pro两个模型协作。Gemini Flash负责快速生成大量候选变体(追求搜索广度),例如交换运算顺序、尝试不同的中间变量组合。Gemini Pro负责对最有希望的候选进行深度改写(追求搜索深度),例如"能否用不同的分治策略将问题分解为更少的子问题?""能否将某些加法合并以减少乘法次数?"。系统根据当前搜索进展和种群多样性动态决定调用哪个模型。
程序级结构变异:与FunSearch仅修改函数体不同,AlphaEvolve能够进行程序级的结构变异:改变算法的整体控制流、替换数据结构、引入新的子程序、修改递归策略等。这使得搜索能够跨越更大的算法空间。
选择与种群更新:根据适应度分数保留Top-K的优秀程序,新种群由保留的父代和变异产生的子代组成。
迭代收敛:重复评估、选择、变异循环,持续数千至数万代。搜索过程中,系统会记录每一代的最优解和种群统计信息,用于分析搜索进展。
结果验证与部署:对最终最优程序进行严格数学验证,确认其正确性和性能。验证通过后,算法可部署到实际生产环境中。
技术进展与应用:FunSearch解决了组合数学中悬而未决的cap set问题。AlphaEvolve独立发现了四阶复数矩阵乘法仅需48次标量乘法的算法,并优化了Google数据中心Borg调度器,回收了约0.7%的全球计算资源;改进了Gemini训练中FlashAttention内核,提速约23%;优化了TPU芯片设计;在量子物理和基因组学算法优化中也展现出巨大潜力。5.3 百度伐谋(FM-Agent):多智能体与进化搜索的融合与最新进展
出处:
Baidu. "The FM Agent: An Evolutionary Large Language Model Agent for Complex Engineering Optimization."arXiv preprint(2024/2025);
百度AI Day及产业落地技术报告.
基本信息:由百度于2024/2025年发布,是百度"伐谋"科学大模型的核心技术。其名称来源于《孙子兵法》"上兵伐谋",寓意以最高层次的策略攻克科学难题。
能力与适用场景:将LLM推理与大规模进化搜索结合,解决复杂的工程优化和数学问题。适合算法改进、交通调度、金融风控、复杂数学猜想验证、工业流程优化、材料配方搜索。
局限与限制:多智能体协同和进化搜索的结合导致计算资源消耗巨大;对于缺乏明确自动化评估函数的纯理论科学问题,难以直接应用;系统的可解释性有限;对评估环境的设计要求高;在极度开放的探索性任务中可能受限于LLM的已知知识边界。
详细计算与处理过程:
冷启动(Cold Start)阶段——问题抽象与环境构建:这是FM-Agent区别于简单进化搜索的关键。当用户提交一个复杂的工程或科学问题(如"优化某交通路口的信号灯配时方案"或"寻找满足特定性能指标的固态电池电解质配方")时,FM-Agent的多智能体系统首先协同工作:文献检索智能体阅读相关领域的论文和技术报告,提取关键约束和先验知识;问题抽象智能体将自然语言描述的问题转化为可计算的优化目标(如定义目标函数、约束条件、变量空间);环境构建智能体搭建自动化的评估环境(如数学验证器、物理模拟器、或调用已有的仿真软件API)。这一阶段的目标是将一个模糊的科学问题转化为一个可自动评估的优化问题。
自演化(Self-Evolution)阶段——种群初始化:基于冷启动阶段构建的问题抽象,大语言模型生成一批初始的解决方案(可能是代码实现、数学公式、或参数配置),构成初始种群。这些初始方案通常包含了从文献中获取的已知最佳实践和启发式策略。
多维工具验证与适应度评估:每个候选方案被送入评估环境进行多维度打分。评估维度可能包括:正确性(是否满足所有约束)、性能(目标函数值)、鲁棒性(在扰动下的表现)、新颖性(与已有方案的差异度)。对于科学假设类问题,评估还可能包括物理一致性检查(是否违背守恒律)、与已有实验数据的兼容性等。
搜索驱动的LLM变异与反馈计划(Feedback-to-Plan):这是FM-Agent的核心创新。与简单的"变异-评估"循环不同,FM-Agent引入了"反馈到计划"的机制:评估器不仅返回适应度分数,还返回详细的失败分析和诊断信息(如"该方案在约束条件C3上失败,原因是变量X的取值超出了物理可行域")。LLM接收这些反馈后,进行推理分析,制定改进计划(如"需要引入一个惩罚项来处理约束C3"或"需要替换变量X的初始化策略"),然后基于计划生成变异方案。这种机制使得变异不再是盲目的,而是有方向性的、基于理解的改进。
迭代收敛与精英保留:经过多轮"生成-验证-评估-反馈-计划-变异"循环,种群逐渐收敛。系统保留每一代的精英个体,确保最优解不会丢失。
结果输出与实验建议:最终输出最优方案及其详细的性能报告。对于科学发现类问题,还会输出建议的验证实验方案(如"建议在温度T和压力P条件下合成该材料,并测量其离子电导率")。
技术进展与应用:
FM-Agent在技术架构上确立了"搜索驱动的进化式多智能体"路线。在最新状态方面,FM-Agent在MLE-bench(机器学习工程基准测试)等权威算法榜单上名列前茅甚至登顶,在Kaggle等数据科学竞赛中展现出超越人类初级算法工程师的代码优化能力。在数学领域,其在经典的圆包装问题上超越了AlphaEvolve,进化出三阶段混合优化算法(几何初始化加物理模拟加局部搜索)。
在产业落地进展方面,百度伐谋已走出纯理论阶段,与清华大学等顶尖高校,以及新能源(如固态电池材料筛选与电解质配方优化)、创新药(靶点发现与分子生成)、智能制造等头部企业开展了深度的产学研合作,实现了从"科学假设生成"到"工业实验验证"的商业闭环,成为国内AI4S产业化的标杆系统。5.4 贝叶斯优化框架 (如 BoTorch / HEBO)
出处:
Shahriari, B. et al. "Taking the human out of the loop: A review of Bayesian optimization."Proceedings of the IEEE, 104(1), 148-175 (2015);
Balandat, M. et al. "BoTorch: A framework for efficient Monte-Carlo Bayesian optimization."NeurIPS(2020).
基本信息:贝叶斯优化作为一种方法论已有数十年历史,近年来由Meta(BoTorch)、华为(HEBO)等机构开发出高效的开源框架。
能力与适用场景:在评估代价极高(如真实湿实验、DFT计算)的情况下,寻找黑盒函数的全局最优解。适合材料合成条件探索、自动化实验室参数调优、超参数优化。
局限与限制:高维空间(大于20维)中代理模型(如高斯过程)的计算复杂度呈立方级增长,难以扩展;对采集函数的选择敏感;初始点的选择对结果影响较大。
详细计算与处理过程:
构建代理模型(Surrogate Model):使用高斯过程(Gaussian Process, GP)拟合已评估的少量数据点。GP不仅预测目标函数的值,还给出预测的不确定性(方差)。
计算采集函数(Acquisition Function):通过期望改进(Expected Improvement, EI)或上置信界(UCB)等公式,计算解空间中每个点的"探索价值"。EI平衡了"利用"(预测值高的区域)和"探索"(不确定性高的区域)。
选择与评估:选择采集函数值最大的点,进行真实的物理实验或昂贵的DFT计算。
模型更新:将新数据点加入训练集,更新高斯过程,进入下一轮迭代。
迭代收敛:重复上述过程,直至找到满足要求的最优解或达到预算限制。
技术进展与应用:贝叶斯优化已成为AI4S中解决昂贵黑盒函数优化的标准方法。BoTorch等开源框架支持GPU加速和批量评估,极大地提升了优化效率。在材料科学、药物发现、自动化实验等领域有广泛应用。
六、范式五:智能体与多智能体协同6.1 范式核心原理、适用情况与局限限制
核心原理:本范式以大型语言模型(LLM)为认知中枢,通过"思考-行动-观察"(ReAct)框架,将复杂科学任务分解为多个子步骤,并动态调用外部专业工具(如化学数据库、物理模拟器、实验室机器人)执行。与进化搜索的区别在于:智能体不存在"种群"和"自然选择",其核心是单条推理链上的任务规划和执行;与监督预测模型的区别在于:智能体的推理过程是动态的、多步的、依赖外部工具反馈的,而非一次前向传播。
适用情况:任务需要长程规划、多步推理和跨领域知识综合;需要与外部异构系统(如数据库、物理模拟器、机器人)交互;单一模型无法直接输出最终结果。典型应用包括自动化实验、文献综合、复杂工作流编排、科研助手、科学知识图谱构建。
局限与限制:高度依赖底层大语言模型的推理能力,容易产生"幻觉"导致任务链断裂;多智能体协同中的通信开销和错误累积(Error Cascading)问题严重;缺乏严格的数学收敛保证;对工具API的标准化程度要求高;在物理世界中的安全性问题需要特别关注。6.2 ChemCrow:化学研究的单智能体助手
出处:
Bran, A.M. et al. "Augmenting large language models with chemistry tools."Nature Machine Intelligence, 6, 525-535 (2024).
基本信息:由洛桑联邦理工学院(EPFL)等机构于2023年开发,2024年正式发表于Nature Machine Intelligence。
能力与适用场景:将GPT-4与18个专家级化学工具连接,完成文献调研、分子性质预测、反应预测、毒性评估、逆合成分析等任务。适合化学研究中的自动化文献综合、分子筛选、反应规划。
局限与限制:严重依赖底层LLM的常识和纠错能力,一旦规划出错可能导致错误结论;工具API的覆盖范围有限;对复杂多步反应的规划能力不足;缺乏物理实验验证能力。
详细计算与处理过程:
工具库构建:将GPT-4与18个专家级化学工具连接,包括RDKit(分子操作)、分子对接引擎、ADMET预测API、逆合成分析工具、文献检索工具等。
任务规划与ReAct循环:当用户提出"设计一个对EGFR有抑制活性且毒性低的分子"时,LLM首先生成思考计划(Thought):"我需要先获取EGFR的结构,然后生成候选分子,再评估活性和毒性。"
行动与观察:LLM输出行动指令(Action),调用数据库检索工具获取EGFR的PDB结构编号。接收工具返回的结果(Observation)后,LLM继续思考并调用分子生成工具,获得一批候选分子的SMILES表达式。
多轮迭代与反思:LLM循环调用对接工具评估每个分子的结合力,调用ADMET预测工具评估毒性和药代动力学性质。若所有分子都不达标,LLM反思失败原因(如"毒性过高是因为含有某个官能团"),修改生成策略,开启新一轮迭代。经过5-20轮工具调用后,输出最终方案。
技术进展与应用:ChemCrow证明了LLM作为化学研究助手的有效性。目前多家跨国药企已开始部署类似的内部智能体系统,用于自动化文献调研和早期分子筛选。ChemCrow的开源代码已被广泛使用和扩展。6.3 Coscientist:具身多智能体自主实验
出处:
Boiko, D.A. et al. "Autonomous chemical research with large language models."Nature, 624, 570-578 (2023).
基本信息:由卡内基梅隆大学(CMU)于2023年开发并发表于Nature。
能力与适用场景:将智能体推进到物理世界,包含多个协作子智能体,能够控制实验室机器人执行真实化学合成。适合自动化化学合成、高通量实验、反应条件优化。
局限与限制:硬件接口的标准化程度低,难以推广到不同实验室;严重依赖LLM的常识和纠错能力,一旦规划出错可能导致物理实验失败甚至危险;对复杂反应的处理能力有限;安全性问题需要特别关注。
详细计算与处理过程:
多智能体分工:系统包含规划智能体(阅读文献确定反应方案)、编码智能体(编写控制实验室机器人的Python脚本)、执行智能体(将脚本发送到液体处理机器人)、分析智能体(接收实验结果并判断产率和纯度)。
跨物理世界闭环:规划智能体确定钯催化的交叉偶联反应方案;编码智能体生成控制移液机器人的脚本;执行智能体在真实实验室中混合试剂、控制温度;分析智能体接收产率和纯度反馈。
自主调整:若结果不佳,规划智能体调整反应温度或催化剂当量,编码智能体修改脚本,执行智能体重新运行实验。整个过程无需人类干预。
技术进展与应用:Coscientist标志着AI从"数字助手"向"具身科学家"的演进。其开源代码已被多个实验室采用,为未来完全自动化的"黑灯实验室"奠定了软件架构基础。6.4 AI Scientist 与 自动化实验室智能体
出处:
Lu, C. et al. "The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery."arXiv:2408.06292(2024);
Burger, B. et al. "A mobile robotic chemist."Nature, 583, 385-390 (2020).
基本信息:AI Scientist由Sakana AI于2024年发布;Mobile Robot Chemist由利物浦大学于2020年开发并发表于Nature。
能力与适用场景:AI Scientist自主完成"提出想法、编写代码、跑实验、画图、撰写LaTeX论文"的全流程;Mobile Robot Chemist控制移动机器人在真实实验室中自主搜索催化剂配方。适合在机器学习等数据丰富、评估自动化的子领域进行开放式探索;适合高通量实验和材料配方优化。
局限与限制:AI Scientist目前仅能在特定狭窄领域生成平庸或存在逻辑瑕疵的论文,无法替代人类科学家进行深刻的范式创新;存在严重的幻觉和学术不端风险;Mobile Robot Chemist硬件维护成本高,受限于物理环境的非结构化程度,灵活性不如人类。
详细计算与处理过程:
AI Scientist的计算过程:
多智能体分工协作:包含Idea Agent(提出研究想法)、Coding Agent(编写实验代码)、Experiment Agent(运行实验)、Writing Agent(撰写论文)、Reviewer Agent(模拟同行评审)。
自主研究循环:Idea Agent生成研究假设;Coding Agent编写实验代码;Experiment Agent运行实验并收集结果;Writing Agent撰写LaTeX论文;Reviewer Agent对论文进行评审并提出修改意见。
自我反思与迭代:根据Reviewer Agent的反馈,系统修改论文或重新设计实验,经过多轮迭代后输出完整的科研产出。
Mobile Robot Chemist的计算过程:
任务规划:根据目标(如寻找最优催化剂配方),规划实验序列。
机器人控制:控制移动机器人在实验室中移动,操作移液器、天平、反应器等设备。
实验执行与反馈:执行实验,通过传感器获取结果(如产率、选择性)。
贝叶斯优化引导:根据实验结果,使用贝叶斯优化算法决定下一组实验条件,实现高效搜索。
技术进展与应用:AI Scientist展示了AI自主科研的可能性,但其产出仍需人类专家严格审核。Mobile Robot Chemist已在利物浦大学的实验室中运行多年,成功发现了多种新型催化剂配方,证明了自动化实验室的可行性。6.5 科学文献挖掘与知识图谱:SciBERT / PrimeKG
出处:
Beltagy, I. et al. "SciBERT: A pretrained language model for scientific text."EMNLP(2019);
Chandak, P. et al. "Building a knowledge graph for drug discovery and repurposing (PrimeKG)."Scientific Data, 10, 619 (2023).
基本信息:SciBERT由Allen Institute for AI于2019年开发;PrimeKG由哈佛大学等机构于2023年开发并发表于Scientific Data。
能力与适用场景:SciBERT是专门为科学文献预训练的语言模型,适合科学文本理解、信息抽取和问答。PrimeKG是一个整合了药物、疾病、基因、蛋白质等实体关系的科学知识图谱,适合药物重定位、假设生成和跨领域知识发现。
局限与限制:SciBERT的训练数据可能滞后于最新文献;PrimeKG的实体关系抽取可能存在噪声和遗漏;知识图谱的推理能力受限于图神经网络的表达能力。
详细计算与处理过程:
SciBERT的计算过程:首先在数百万篇科学论文摘要和全文上进行掩码语言建模预训练,使模型学习科学领域的专业词汇、术语搭配和深层语义关系。针对下游任务(如命名实体识别、关系抽取),在特定标注数据上进行微调,使模型能够精准输出实体标签或关系类别,从而支持自动化文献综合和科学知识抽取。
PrimeKG的计算过程:首先从多个权威生物医学数据库中抽取药物、疾病、基因、蛋白质等实体及其相互关系,构建包含数百万节点和边的异构知识图谱。随后,使用图神经网络在图上进行链接预测和节点分类计算。对于药物重定位等任务,模型通过计算图结构中的拓扑特征,预测药物节点与疾病节点之间是否存在潜在的治疗关联,并输出概率分数以生成科学假设。
技术进展与应用:SciBERT已成为科学自然语言处理的基础模型。PrimeKG已被用于发现多种老药新用的潜在候选药物,并在新冠疫情期间辅助筛选潜在治疗药物。
七、深度对比与底层逻辑探究7.1 科学认识论视角的映射:猜想与反驳的自动化
科学哲学家卡尔·波普尔提出,科学发现的核心是"猜想与反驳"(Conjectures and Refutations)。AI4S的五大范式完美映射了这一哲学过程:
猜想(假设生成):生成式模型(如RFdiffusion)和进化计算(如AlphaEvolve、FM-Agent)扮演了"猜想者"的角色。它们通过分布采样或种群变异,在未知的科学空间中提出大量新的分子结构、算法代码或科学假设。
反驳(验证与筛选):判别式预测(如GNoME)、强化学习的形式化验证(如AlphaProof)以及智能体调用的物理模拟器,扮演了"反驳者"的角色。它们通过严格的物理定律、逻辑规则或实验数据,无情地淘汰错误的猜想。
AI4S的本质,就是用算力将人类科学家的"猜想-反驳"循环加速数百万倍。7.2 解空间拓扑与导航策略的数学本质
不同范式面对的解空间拓扑截然不同,这决定了它们必须采用不同的导航策略:
连续流形空间:判别式预测与生成模型处理的是连续的高维流形(如三维坐标、像素)。其导航依赖于神经网络学习到的平滑流形,通过梯度下降或马尔可夫链进行连续空间的"滑行"。
离散组合空间:进化计算与贝叶斯优化处理的是离散的组合空间(如代码、分子图)。这里缺乏梯度,必须依靠种群演化或代理模型进行"跳跃式"导航。
逻辑状态空间:树搜索(AlphaProof)处理的是具有严格逻辑规则的树状状态空间。导航依赖于价值函数指引的深度优先与广度优先的动态平衡,是在逻辑迷宫中寻找唯一出口。7.3 算力经济学与"代理模型"飞轮效应
所有AI4S系统都在构建"数据飞轮",而代理模型(Surrogate Model)是飞轮的核心加速器,这是AI4S能够突破算力瓶颈的底层经济学逻辑。
在材料发现和药物设计中,真实的物理计算(如DFT、自由能微扰FEP)极其昂贵(单次计算可能需要数小时甚至数天,复杂度呈指数级)。如果直接在真实物理引擎上进行进化搜索或贝叶斯优化,成本是不可接受的。
因此,AI4S系统首先训练轻量的GNN或Transformer作为代理模型,用毫秒级的速度预测性质。优化算法在代理模型上进行数百万次的搜索,仅将极少数最优候选送入真实物理引擎验证。验证产生的新数据再反哺代理模型。这种"廉价代理搜索加昂贵真实验证"的双层架构,是AI4S工程落地的核心秘密。7.4 验证机制的"真理阶梯"
科学发现的生命线在于验证。各范式的验证机制构成了其可信度的基石,形成一个从绝对到启发的"真理阶梯":
第一级,形式化验证(绝对真理):AlphaProof依赖Lean 4,提供先验的、绝对的逻辑验证,杜绝了幻觉。
第二级,物理方程约束(物理真理):MACE等模型通过等变性硬编码物理对称性,保证预测不违背基本物理定律。
第三级,高精度数据拟合(统计真理):GNoME和AlphaFold的预测最终必须由DFT或真实实验(如冷冻电镜)进行后验校准。
第四级,启发式评估(经验真理):FM-Agent和ChemCrow面对复杂的科学假设和多目标化学任务,其验证高度依赖于大模型的常识判断和外部工具的近似反馈。7.5 大语言模型(LLM)角色的演进与分化
LLM在AI4S中的角色经历了深刻的演变,且在不同范式中高度分化:
在判别式预测(如AlphaFold2)中,LLM完全缺席,专用架构占据主导。在进化计算(如AlphaEvolve、FM-Agent)中,LLM退居幕后,作为高效的"变异算子"提供代码和假设生成能力。在智能体范式中,LLM走向前台,成为统筹全局的"规划大脑"。在生成模型中,LLM通常不直接参与,但可用于条件生成的文本编码。
这种角色的分化表明,LLM并非万能,其在逻辑推理和代码生成上的优势,必须与专用科学模型的严谨性相结合。7.6 物理先验的嵌入方式对比
纯数据驱动的模型在面对分布外数据时容易失效。将物理先验嵌入模型是必然趋势,但各范式嵌入方式不同:
等变神经网络(如MACE、RFdiffusion)通过硬编码网络架构,保证预测严格遵循旋转平移对称性。物理信息神经网络(PINN)将偏微分方程作为损失函数的约束项。哈密顿神经网络强制能量守恒。智能体和进化搜索则通过调用外部物理模拟器作为验证工具,将物理定律作为"环境规则"隐式嵌入。
八、方法和系统全景
AI4S在各学科领域已形成极其丰富且具体的系统矩阵,以下为各领域的代表性方法与系统全景:
数学与算法设计:代表系统包括 AlphaProof, AlphaGeometry, AlphaTensor, FunSearch, AlphaEvolve, FM-Agent (百度伐谋), AlphaZero。符号回归系统包括 AI Feynman, PySR, SymbolicRegression.jl。
结构生物学:代表系统包括 AlphaFold2/3, ESMFold, AlphaMissense, RoseTTAFold, RFdiffusion, ProteinMPNN, Chroma, FrameDiff, CryoDRGN(冷冻电镜异构性分析)。
材料科学:代表系统包括 GNoME, MatterGen, CDVAE, FlowMM(材料生成);机器学习力场包括 MACE, NequIP, Allegro, TorchMD, MatGL, CHGNet, DeepMD-kit;合成规划包括 ChemOS, AIZynthFinder。材料信息学平台包括 Materials Project, AFLOW, OQMD。
药物发现:代表系统包括 DiffDock, TargetNet, REINVENT, MolDQN, Uni-Mol, ChemCrow, Coscientist, AutoLab, DiffSBDD, 3DLinker, EquiBind。AI制药平台包括 深势科技Bohrium, 百度螺旋桨(PaddleHelix), 华为盘古药物分子大模型, Insilico Medicine Chemistry42, Recursion Pharmaceuticals平台。
气候与地球科学:代表系统包括 GraphCast, GenCast, Pangu-Weather, FengWu, FourCastNet, NeuralGCM, Aurora(微软地球系统基础模型), PhaseNet(地震波分析)。
物理与化学模拟:代表系统包括 MACE, NequIP, Allegro, DeepMD-kit, FermiNet, PauliNet, TorchMD,以及DeepMind与洛桑联邦理工学院合作的托卡马克等离子体磁控AI。
基因组学与生物信息学:代表系统包括 Enformer, Evo, ScGPT, Basenji, PrimeKG(知识图谱), SciBERT(科学文献挖掘)。
神经算子与偏微分方程求解:代表系统包括 Fourier Neural Operator (FNO), DeepONet, NeuralGCM, FourCastNet。
天文学与高能物理:代表系统包括 Galaxy Zoo(星系分类), MLGW(引力波检测), ExoMiner(系外行星发现), CaloGAN 及基于Score的探测器模拟生成模型。
农业与食品科学:代表系统包括各类 Crop Yield Prediction Models(作物产量预测), 以及Shiru等公司开发的生成式食品蛋白设计AI。
系统名称
核心算法范式
系统架构类型
推理时计算模式
验证与反馈机制
代表机构/国家
AlphaFold 2/3
判别式预测 / 生成
单一模型
单次前向 / 迭代去噪
后验实验验证
DeepMind(英国)
ESMFold / RoseTTAFold
判别式预测
单一模型
单次前向传播
后验实验验证
Meta / 华盛顿大学(美国)
AlphaMissense
判别式预测
单一模型
单次前向传播
临床数据后验验证
DeepMind(英国)
Enformer / Evo
判别式预测
单一模型
单次前向传播
实验数据后验验证
DeepMind / Arc Institute(美国)
GNoME
判别式预测加主动学习
模型加主动学习框架
单次前向传播
DFT精确计算
Google DeepMind(英国)
MACE / NequIP / CHGNet
判别式预测
单一模型
单次前向传播
与DFT计算对比
剑桥/MIT/UC Berkeley(英美)
Allegro / TorchMD / DeepMD-kit
判别式预测
单一模型
单次前向传播
与DFT计算对比
MIT/TUM/深势科技(美德中)
GraphCast / GenCast
判别式预测 / 生成
单一模型
单次前向 / 扩散采样
气象观测数据对比
DeepMind(英国)
Pangu / FengWu / Aurora
判别式预测
单一模型
单次前向,自回归
气象观测数据对比
华为 / 上海AI Lab / 微软(中美)
FNO / DeepONet / NeuralGCM
神经算子
单一模型
单次前向传播
与数值求解器对比
Caltech / Brown / Google(美国)
RFdiffusion / Chroma / FrameDiff
生成式设计
单一模型
约200步迭代去噪
Rosetta物理精化
华盛顿大学 / Generate Bio / MIT(美国)
ProteinMPNN
生成式设计
单一模型
单次前向传播
实验表达验证
华盛顿大学(美国)
DiffDock / EquiBind
生成式设计
单一模型
流形空间迭代去噪
对接打分函数
MIT(美国)
DiffSBDD / 3DLinker
生成式设计
单一模型
3D空间迭代去噪
物理化学约束验证
学术界
MatterGen / CDVAE / FlowMM
条件生成式设计
单一模型
条件引导迭代去噪
DFT后验验证
Microsoft / Stanford(美国)
AlphaProof / AlphaGeometry
强化学习与序贯决策
强化学习智能体
动态树搜索(MCTS)
Lean 4形式化先验验证
DeepMind(英国)
AlphaTensor / AlphaZero
强化学习与序贯决策
强化学习系统
自我博弈与树搜索
规则/正确性验证
DeepMind(英国)
REINVENT / MolDQN
强化学习与序贯决策
优化算法框架
序列自回归生成
属性打分函数反馈
AstraZeneca等(英美)
FunSearch / AlphaEvolve
进化计算与黑盒优化
进化搜索系统
并行种群迭代
代码运行结果评估
DeepMind(英国)
百度伐谋(FM-Agent)
进化计算与黑盒优化
多智能体加进化框架
假设种群迭代加工具验证
物理模拟加约束检查
百度(中国)
贝叶斯优化(BoTorch/HEBO)
进化计算与黑盒优化
优化算法框架
代理模型引导单点评估
真实物理/实验评估
Meta/华为等(美中)
AI Feynman / PySR
进化计算与黑盒优化
优化算法框架
表达式树搜索与简化
物理量纲与数据拟合校验
MIT等(美国)
ChemCrow
智能体与多智能体协同
单智能体
多步工具调用链
工具返回值检查
EPFL(瑞士)
Coscientist
智能体与多智能体协同
多智能体系统
跨数字物理闭环迭代
物理实验反馈
CMU(美国)
AI Scientist
智能体与多智能体协同
多智能体系统
自主全流程迭代
自动代码运行与自评
Sakana AI(日本/美)
Mobile Robot Chemist
智能体与多智能体协同
具身智能体
物理实验闭环
传感器反馈
利物浦大学(英国)
AutoLab / Emerald Cloud Lab
智能体与多智能体协同
工具平台
提供多种计算与实验接口
平台内置物理计算
学术界/工业界(美)
SciBERT / PrimeKG
智能体与知识图谱
工具/知识图谱
文本嵌入与图推理
文献与数据库交叉验证
Allen AI / Harvard(美国)
CryoDRGN
生成式设计
单一模型
迭代去噪
冷冻电镜数据验证
学术界(美国)
FermiNet / PauliNet
判别式预测
单一模型
单次前向传播
与量子化学计算对比
DeepMind / 柏林工业大学(英德)
Uni-Mol
判别式预测
单一模型
单次前向传播
实验数据对比
深势科技(中国)
Bohrium / PaddleHelix / 盘古药物
多范式融合
工具平台
提供多种AI与物理计算接口
平台内置多模态验证
深势科技/百度/华为(中国)展望符号回归与可解释科学发现
科学的终极目标不仅是预测,更是理解。符号回归(Symbolic Regression,如AI Feynman、PySR)结合大语言模型的公式生成能力与进化搜索的筛选能力,正致力于从复杂数据中挖掘出简洁、人类可理解的数学方程。这代表了AI从"黑箱预测"走向"白箱发现"的终极追求。迈向自主的AI科学家
从Coscientist的具身实验到AI Scientist的自主论文生成,AI4S正在从"科学家的超级工具"向"自主的科学探索者"演进。尽管目前的自主AI科学家仍局限于特定子领域,但其展现出的多智能体协作和长程规划能力,指明了未来科学研究的形态。多尺度建模与物理约束的深度融合
从量子尺度(电子结构)到原子尺度(分子动力学)到介观尺度再到宏观尺度,AI正在打通不同层次的模拟。用机器学习力场(MACE)替代DFT,可将分子动力学加速数千倍;用粗粒化模型桥接原子尺度和介观尺度;用神经网络求解器替代传统有限元方法。同时,将守恒律、对称性、热力学约束直接编码进网络架构(如等变神经网络、哈密顿神经网络、物理信息神经网络),是确保AI4S可靠性的关键方向。结语
回到开篇的疑问:百度FM-Agent、AlphaEvolve、AlphaProof、AlphaFold,它们是同一种东西吗?
答案已经清晰。它们不是同一种技术,而是人类在面对"如何探索无限复杂的科学空间"这一终极问题时,所锻造出的不同武器。AlphaFold是敏锐的"眼睛",一眼看穿序列背后的三维结构;AlphaProof是严谨的"逻辑推演机",在形式化的迷宫中步步为营;AlphaEvolve和FM-Agent是不知疲倦的"达尔文演化炉",在试错与变异中逼近最优;RFdiffusion是神奇的"造物画笔",从虚无的噪声中雕刻出全新的分子;ChemCrow则是全能的"科研助手",调度众多工具完成复杂任务。
然而,这些武器的边界正在消融。未来的AI4S系统,必然是一个集大成者:用大语言模型进行高维度的假设规划(智能体),用进化搜索在方案空间中进行迭代(搜索),用图神经网络进行毫秒级的性质筛选(监督预测),用扩散模型生成具体的分子结构(生成),最后用形式化工具或自动化实验室进行一锤定音的验证。
科学发现的历史,就是人类不断扩展自身认知边界的历史。AI4S并没有改变科学方法论的本质——提出假设、实验验证、归纳理论;它改变的,是这一过程的速度、规模和维度。AI不是科学家的替代者,而是人类理性的外延。在这个硅基与碳基智慧交融的新纪元,我们正站在一个前所未有的科学大爆发时代的门槛上。