指南首页/研究方向
EN
研究方向

AI 交叉学科:从其他学科的问题出发

AI 可以帮助化学家筛选分子、帮助生物学家分析细胞,也可以用于天气预测、数学证明和金融建模。研究者还在尝试让 AI 自己选择训练方案、运行实验和改进代码。

AI 怎样参与研究

阅读这一方向 ↓

化学与材料:预测性质、规划反应、寻找新材料

一个分子是否易溶于水,一种晶体是否稳定,一组反应物会生成什么?AI 可以从结构和实验记录中预测性质、筛选候选,也可以学习能量与力,降低分子动力学的计算成本。

性质预测

把分子表示成原子与键组成的图,或带三维坐标的结构,预测溶解度、能量等目标量。MPNN 是图学习进入量子化学的经典入口。

反应与合成

正向预测从反应物推断产物;逆合成从目标分子寻找前体和合成路线。Molecular Transformer 把反应物与产物的 SMILES 字符串当作序列来建模。

材料发现与模拟

GNoME 用图网络和第一性原理计算筛选稳定晶体;Deep Potential 学习势能,提供分子动力学所需的能量与力。主动学习会根据已有结果选择下一批计算或实验。

  1. 2017MPNN

    结构 → 性质

  2. 2018–2019Deep Potential / Molecular Transformer

    模拟与反应预测

  3. 2023GNoME

    模型筛选 + DFT 验证

2017 · ICML

Neural Message Passing for Quantum Chemistry

Neural Message Passing for Quantum Chemistry · Gilmer et al. · Fig. 1
论文原图 · Gilmer et al. · Fig. 1 · 论文原文

它在解决什么

怎样从原子与它们的关系预测分子性质?

核心想法

节点通过消息传递更新表示,再把节点信息汇总为整个分子的预测。

为什么选这篇

它把图网络的抽象操作落在具体的量子化学预测任务上。

第一遍读哪里

先看 message passing 与 readout,再看目标性质和数据设置。

2018 · Physical Review Letters

Deep Potential Molecular Dynamics: A Scalable Model with the Accuracy of Quantum Mechanics

Deep Potential Molecular Dynamics: A Scalable Model with the Accuracy of Quantum Mechanics · Zhang et al., Deep Potential Molecular Dynamics, Figure 1
论文原图 · Zhang et al., Deep Potential Molecular Dynamics, Figure 1 · 论文原文

它在解决什么

怎样降低分子动力学中精确计算能量与力的成本?

核心想法

从第一性原理数据学习原子局部环境与能量的关系,同时把问题的对称性纳入模型。

为什么选这篇

它展示 AI 怎样替代计算链中的一个昂贵环节。

第一遍读哪里

先看能量与力怎样进入模拟,再看训练数据与物理量对照。

读完还要问

模型准确性依赖训练覆盖的构型与参考计算,外推到新条件需要检验。

论文与学习入口

SMILES
用字符串记录分子结构的表示方式。
DFT
密度泛函理论,一类计算电子结构、能量等性质的方法。

可以动手做什么

用 DeepChem 的一个溶解度数据集,比较分子指纹加传统回归与图网络。分别使用随机划分和分子骨架划分,看看换到新骨架后误差怎样变化。

物理与气象:学习方程的解,预测系统的演化

流体怎样运动、温度怎样扩散、未来几天的天气怎样变化,通常都涉及随空间和时间变化的物理量。AI 可以近似这些方程的求解过程,也可以根据观测预测物理系统的演化。

把方程放进训练

物理信息神经网络(PINNs)把方程残差、边界条件和观测误差一起用于训练。研究重点包括约束怎样发挥作用,以及模型怎样处理复杂区域和多尺度变化。

学习一类问题的解

神经算子学习函数到函数的映射,例如从初始条件预测整个流场。FNO 在频域中构造运算,用一组问题的解训练,再处理新的输入条件。

预测天气与不确定性

GraphCast 用图网络预测全球气象场;后续概率预测路线通过多个可能的未来描述不确定性。研究者会比较预测误差、极端天气表现和计算时间。

  1. 2019PINNs

    方程约束进入训练

  2. 2021FNO

    学习函数之间的映射

  3. 2023GraphCast

    全球气象场预测

2021 · ICLR

Fourier Neural Operator for Parametric Partial Differential Equations

Fourier Neural Operator for Parametric Partial Differential Equations · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从一组初始条件直接预测连续物理场?

核心想法

在频域中参数化积分核,学习函数到函数的映射,用于一类偏微分方程问题。

第一遍读哪里

先看算子层与输入输出,再对照不同分辨率和方程设置下的误差。

论文与学习入口

PDE
偏微分方程,描述一个量如何随空间、时间等变量变化。
神经算子
学习输入函数到输出函数映射的模型,例如初始场到未来流场。

可以动手做什么

从一维扩散或 Burgers 方程开始,用数值解作为参照,比较模型在不同初始条件下的预测;画出误差随时间的变化。

蛋白质与酶:从序列到结构,再到功能设计

蛋白质由氨基酸序列组成,折叠后的结构与它能做什么密切相关。AI 既可以预测结构,也可以寻找具有目标性质的天然序列,或者提出新的设计。

表征与结构预测

蛋白质语言模型从序列中学习可迁移特征;AlphaFold2 结合序列、进化信息和几何关系预测三维结构。AlphaFold3 进一步处理蛋白质、核酸与小分子等组成的复合物。

序列与骨架设计

ProteinMPNN 根据给定骨架设计序列,RFdiffusion 生成满足约束的骨架,ESM3 联合利用序列、结构和功能信息。设计流程会接着检查表达、稳定性、结合或催化活性。

酶挖掘与改造

酶挖掘从天然序列库找候选;酶工程改造已有酶;从头设计围绕目标反应构建新候选。VenusMine 从结构与序列线索检索,VenusRXN 从化学反应出发匹配酶。

  1. 2021AlphaFold2

    结构预测

  2. 2022–2023ProteinMPNN / RFdiffusion

    序列与骨架设计

  3. 2025–2026AMix-1 / AMix-2

    条件生成与蛋白质—文本建模

继续读

酶工程怎样形成实验循环

零样本打分可以先对突变排序;少量实测数据可用于拟合指定性质;主动学习则根据已有结果与不确定性挑选下一批实验。每轮把新测得的活性或稳定性写回数据,再更新候选排序。

从头设计看哪些约束

可以围绕催化核心寻找承载它的骨架,也可以在已有骨架中组织局部相互作用。催化几何、可折叠性、稳定性以及反应条件,都决定了后续需要做什么实验。

基础模型的新路线

AMix-1 用贝叶斯流网络建模蛋白质,并探索多序列比对条件与推理时搜索;AMix-2 把蛋白质和文本纳入统一建模,采用块间因果生成、块内扩散。阅读时可以分别追踪条件输入、候选生成和验证器的作用。

2021 · Nature

Highly accurate protein structure prediction with AlphaFold

Highly accurate protein structure prediction with AlphaFold · Jumper et al., AlphaFold, Figure 1(e) · CC BY 4.0
论文原图 · Jumper et al., AlphaFold, Figure 1(e) · CC BY 4.0 · 论文原文

它在解决什么

怎样从氨基酸序列等信息预测蛋白质的三维结构?

核心想法

整合进化相关序列与残基间关系,反复更新表示并生成三维结构。

为什么选这篇

它展示数据、几何与系统设计围绕一个学科难题怎样配合。

第一遍读哪里

先看整体结构与 CASP14 评价,再看置信度的含义。

2025 · arXiv

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样把家族信息与验证反馈用于蛋白质设计?

核心想法

以贝叶斯流网络建模蛋白质,利用 MSA 上下文,并探索增加推理时搜索预算的设计流程。

第一遍读哪里

分别追踪生成条件、验证器与实验测量;比较它们在迭代中的作用。

论文与学习入口

MSA
多序列比对,把相关蛋白质序列对齐,用来观察进化中的保守与变化。
逆折叠
给定蛋白质骨架,寻找能够形成该结构的氨基酸序列。

可以动手做什么

选一个带实测性质的蛋白质数据集,比较简单序列特征与冻结的预训练表征。按同源关系划分数据,检查新家族上的预测;结构任务可以先读 AlphaFold 的一个预测结果和置信度图。

基因组:序列变化怎样影响基因调控

DNA 变异可以改变蛋白质编码,也可以影响调控元件、表达或剪接。基因组模型尝试把长序列中的这些关系变成可预测的信号,帮助研究者分析变异发生后可能改变什么。

序列到信号

输入一段 DNA,预测表达、染色质可及性、转录因子结合或剪接等实验相关信号。

比较变异前后

分别输入原始序列和变异序列,比较预测的变化。AlphaGenome 是结合长序列与多任务输出的代表工作。

连接细胞背景

同一个变异在不同组织或细胞状态中可能产生不同影响。把序列模型与细胞模型联系起来,需要对齐组织、条件和测量对象。

  1. 序列建模DNA 上下文

    理解编码与调控区域

  2. 多任务预测AlphaGenome

    同时预测多种分子信号

  3. 变异分析对照与干预

    比较预测与实验变化

论文与学习入口

非编码区域
不直接编码蛋白质的 DNA 区域,其中一部分参与基因调控。
剪接
RNA 加工中连接外显子、去除内含子的过程,不同方式可产生不同转录本。

可以动手做什么

沿官方示例比较一个变异前后的预测轨迹,记录位置、组织和输出信号,说明变化发生在哪个区段,并寻找相应实验测量。

细胞:理解状态,预测干预后的变化

单细胞数据记录每个细胞中哪些基因正在表达。研究从“这是什么细胞、处于什么状态”继续走向“改动一个基因或加入药物,它会怎样响应”。空间组学还保留细胞在组织中的位置。

细胞表征

Geneformer、scGPT、UCE 从大量单细胞数据学习基因或细胞表示,用于注释、整合等任务。数据处理需要保留生物差异,同时处理测序深度、噪声和批次影响。

扰动与虚拟细胞

给定细胞背景、基因或药物扰动,预测表达变化。虚拟细胞希望进一步连接模态、尺度与动态过程;扰动响应是其中一个明确的研究任务。

空间关系与生物制造

FLAG 从病理图像预测空间基因表达,关注基因之间和组织位置之间的关系。生物制造还研究代谢网络、表达负担与资源分配,辅助提出菌株改造方案。

  1. 表征Geneformer / scGPT / UCE

    学习细胞与基因表示

  2. 关系scPRINT / FLAG

    基因网络与空间结构

  3. 响应虚拟细胞

    预测干预后的状态

继续读

状态、动力学与数据建设

不少单细胞数据是不同细胞的测量快照。研究时间演化时,需要结合采样时间、谱系或扰动实验。数据应记录组织、供体、批次和测量模态;扰动数据还要记录对象、剂量、时间与对照。

基因网络与空间结构怎样评价

基因关联网络可与已知调控和干预数据对照;空间表达预测则同时比较逐点误差、基因之间的关系和空间分布。针对未来用途,可以留出新供体、新组织或未见扰动。

2026 · ICML

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从组织图像预测空间基因表达并保留结构关系?

核心想法

结合空间图编码与基因基础模型表征,用扩散过程建模表达分布。

第一遍读哪里

先看输入图像、空间邻接和表达输出,再比较逐点误差与结构评价。

论文与学习入口

批次效应
由实验时间、设备或流程差异带来的系统性数据变化。
扰动预测
根据基因编辑、药物等干预及细胞背景,预测细胞响应。

可以动手做什么

用 Scanpy 处理一个公开单细胞数据集,先做质量控制、PCA 和聚类,再比较预训练表示。分别按细胞类型与实验批次着色,观察分组究竟来自哪里。

脑电:从神经信号到状态识别与解码

脑电记录头皮电极上的电信号随时间怎样变化。AI 可以帮助识别状态、检测事件、学习跨被试表示,也可以把信号与看见的图像等刺激建立联系。

时序与空间表征

电极位置、采样率、滤波和伪迹处理共同决定输入。模型会利用频段、时间变化及通道之间的关系。

基础模型与迁移

预训练后可以冻结编码器做线性探测,也可以微调;同一被试内和新被试上的测试回答不同问题。EEG-FM-Compass 整理了这类评估。

视觉解码与生成

DreamDiffusion 把脑电表征连接到预训练图像生成模型,并利用 CLIP 视觉监督。EEG-CLIP 是另一条对齐路线,可对照它们怎样建立信号与图像的联系。

  1. 信号处理时频特征

    从通道与时间认识数据

  2. 2023DreamDiffusion

    信号对齐与条件生成

  3. 2026EEG-FM-Compass

    基础模型与迁移评估

继续读

怎样检查解码用了什么信息

先固定刺激和被试划分,再比较正确配对、打乱配对和移除脑电条件的结果。这样能观察生成结果有多少依赖输入信号,以及新被试、会话或设备会带来什么变化。

2023 · arXiv

DreamDiffusion: Generating High-Quality Images from Brain EEG Signals

DreamDiffusion: Generating High-Quality Images from Brain EEG Signals · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

脑电表征怎样连接到图像生成模型?

核心想法

通过时间掩码信号建模学习 EEG 表征,结合 CLIP 视觉监督,将信号用于条件生成。

第一遍读哪里

沿训练阶段找每种数据与监督的作用,再看被试划分和对照。

论文与学习入口

被试
参与实验、提供神经信号的人。
伪迹
眼动、肌电或设备等引入的非目标信号。

可以动手做什么

用 MNE 查看一段公开脑电,画出原始波形与功率谱,再做一个事件分类。把训练与测试按被试分开,比较传统特征和预训练表示。

医学影像:定位结构,测量运动与功能

在 CT、MRI 或病理图像中,模型可以标出器官与病灶、对齐不同图像,再从轮廓和运动中计算体积等指标。影像方法由计算机视觉发展而来,研究问题则来自具体的检查与测量需求。

三维分割

3D U-Net、V-Net 处理体数据;UNet++ 调整多尺度特征融合;Swin UNETR 引入 Transformer 上下文建模。可以对照它们怎样保留细节、利用空间关系。

配准与功能测量

配准估计图像或不同时间帧之间的对应。CMRINet 联合分析心脏电影 MRI 的配准与分割,把结构识别连接到心脏功能量化。

纵向变化

随访图像帮助研究病程与变化。需要记录采样时间、治疗、缺失随访等条件;外部中心与设备的数据可用于检验方法的适用性。

  1. 20163D U-Net / V-Net

    体数据分割

  2. 2018–2022UNet++ / Swin UNETR

    特征融合与全局上下文

  3. 2025CMRINet

    时序结构与功能分析

2025 · arXiv

CMRINet: Joint Groupwise Registration and Segmentation for Cardiac Function Quantification from Cine-MRI

CMRINet: Joint Groupwise Registration and Segmentation for Cardiac Function Quantification from Cine-MRI · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

怎样从动态心脏 MRI 同时获得结构和运动信息?

核心想法

联合处理组间配准与分割,把时序图像分析连接到心脏功能量化。

第一遍读哪里

先看电影 MRI 的时间维度,再看两项任务怎样配合,以及功能指标怎样计算。

论文与学习入口

体素
三维图像中的一个小体积单元,对应二维图像的像素。
Dice / HD95
前者衡量区域重叠,后者描述轮廓距离,两者关注不同错误。

可以动手做什么

从 MONAI 的一个分割例子开始,按患者划分数据。并排显示原图、标注和预测,比较区域重叠与边界距离,挑出三种典型错误。

数学与算法:搜索证明,发现更好的构造

数学中的 AI 可以提出证明步骤、补充几何构造,也可以搜索满足条件的对象和更高效的算法。一个关键优势是:不少候选能交给形式化证明器、程序或精确计算来检查。

证明搜索

AlphaGeometry 将语言模型提出的辅助构造与符号推理结合。形式化证明路线则把命题和步骤写进 Lean 等系统,由内核检查证明。

数学构造

FunSearch 让语言模型提出程序,再运行评价函数挑选有用的候选;论文研究了 cap set 等组合问题。模型搜索的是产生构造的程序。

算法发现

AlphaEvolve 将代码生成、评价器与进化搜索结合,寻找更好的算法和数学构造。运行速度、正确性或目标值可以成为反馈。

  1. 2023FunSearch

    程序生成 + 评价

  2. 2024AlphaGeometry / AlphaProof

    构造搜索与证明

  3. 2025AlphaEvolve

    算法的迭代优化

2024 · Nature

Solving olympiad geometry without human demonstrations

Solving olympiad geometry without human demonstrations · Google DeepMind · AlphaGeometry 官方方法示意图
论文原图 · Google DeepMind · AlphaGeometry 官方方法示意图 · 论文原文

它在解决什么

怎样把辅助构造与符号推理连接成证明过程?

核心想法

符号引擎先推导已有条件,语言模型在需要时提出辅助构造,再继续搜索证明。

第一遍读哪里

沿一个简单几何题追踪新增构造及其带来的推导,再看训练数据如何合成。

论文与学习入口

形式化证明
用精确定义和推理规则写出、由证明助手检查的证明。
评价器
执行候选并给出正确性或目标分数的程序。

可以动手做什么

可以先用 Lean 完成几道基础证明,看看“步骤看起来对”和“系统接受证明”之间需要补哪些条件;也可以给一个装箱启发式写评价器,让模型提出修改并在留出的实例上比较。

金融:从文本和时序数据到预测与决策

金融 AI 涉及财报与新闻理解、风险识别、时间序列预测、组合构建和交易执行。模型的输入既有价格、成交量等结构化数据,也有公告和报告中的文字。

金融文本

FinGPT 提供金融语言模型及数据、微调等研究入口,可以从情绪、事件和信息抽取任务理解领域语言建模。

量化预测与回测

Qlib 把数据处理、特征、模型、组合与回测连接起来。因子是用于描述或预测市场行为的特征,研究需要追踪它在什么时间能够被获得。

决策与自动研发

FinRL 研究序列决策;RD-Agent-Quant 让 Agent 迭代因子和模型。评价中会同时看收益、风险、换手率、交易成本和不同市场时期的表现。

  1. 2020Qlib

    完整量化研究流程

  2. 2021–2023FinRL / FinGPT

    决策与金融语言模型

  3. 2025RD-Agent-Quant

    因子与模型联合优化

2020 · arXiv

Qlib: An AI-oriented Quantitative Investment Platform

Qlib: An AI-oriented Quantitative Investment Platform · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

数据、模型、组合与回测怎样组成一个研究流程?

核心想法

把金融数据处理和机器学习流程连接到策略评价,使不同模型可以在统一流程中比较。

第一遍读哪里

沿框架图追踪数据流,再找一个例子的时间划分、标签和回测配置。

论文与学习入口

回测
按历史时间推进,模拟当时可获得的信息与决策结果。
前视偏差
在预测或决策时使用了当时尚不可获得的信息。

可以动手做什么

阅读 Qlib 的一个预测与回测例子,标出特征、标签、训练期和测试期。用同一时间划分比较一个简单模型与复杂模型,并查看计入交易成本前后的结果。

图学习与时间序列:研究关系和变化

交通、社交、交易和电网都包含关系,也随时间变化。图学习处理“谁与谁相连”,时间序列处理“过去怎样影响未来”,两者还可以组合成时空预测。

节点、边和整体结构

图任务可以预测节点类别、是否存在一条关系,或整张图的性质。分子图与社交网络共享消息传递等方法,但标签和评价不同。

趋势、周期与预测

时序研究会区分趋势、周期和异常,比较统计方法与深度学习方法。测试按时间推进,以匹配真正预测未来的使用方式。

时空系统

路网中的道路相连,交通状态又随时间变化。建模时既要描述空间依赖,也要解释外部事件和时间尺度。

  1. 关系图与消息传递

    节点、边、整图任务

  2. 变化趋势与周期

    时间顺序中的预测

  3. 组合时空图

    交通等动态系统

论文与学习入口

消息传递
节点聚合邻居与边的信息,逐层更新自己的表示。
滚动预测
随着时间前移,反复使用当时已有的数据预测后续区间。

可以动手做什么

在一个时间序列上比较“最后一个值”、季节性参照与学习模型,做滚动预测;图任务则先画出节点和边各代表什么,再决定训练与测试怎样划分。

AutoML:自动选择模型和训练配置

学习率、树的深度、特征处理和网络结构都会影响结果。AutoML 研究怎样在给定任务和计算预算内,自动找到较好的模型与训练方案。

超参数优化

网格搜索、随机搜索、贝叶斯优化等方法决定下一组配置。Optuna 支持动态搜索空间和剪枝,提前停止表现不佳的试验。

模型与流程选择

自动选择数据预处理、特征处理、模型和集成方案。比较时需固定数据划分和预算,记录搜索本身的开销。

结构搜索与元学习

神经架构搜索(NAS)寻找网络结构;元学习利用过去任务的经验帮助新任务。可以研究怎样减少搜索成本、怎样跨任务迁移。

  1. 配置HPO

    学习率等超参数

  2. 流程模型与特征选择

    完整学习流程

  3. 结构与经验NAS / Meta-learning

    结构搜索与跨任务知识

2019 · KDD

Optuna: A Next-generation Hyperparameter Optimization Framework

Optuna: A Next-generation Hyperparameter Optimization Framework · Akiba et al. · Figure 6
论文原图 · Akiba et al. · Figure 6 · 论文原文

它在解决什么

怎样用有限的训练预算找到好的配置?

核心想法

以程序定义搜索空间,结合采样和剪枝,在多次试验之间分配预算。

第一遍读哪里

先看搜索空间和试验循环,再看提前停止怎样节省计算。

论文与学习入口

超参数
训练前设定的配置,如学习率、正则强度或层数。
剪枝
根据中途结果停止希望较小的训练,把预算留给其他试验。

可以动手做什么

给一个已有分类器限定 20 次训练预算,比较随机搜索与 Optuna。画出“累计耗时—当前最佳验证分数”,最后只用保留的测试集评价选出的配置。

自动研究:让想法进入实验,再用结果继续推进

科研中有不少可执行环节:查资料、提出候选、改代码、运行实验、分析结果和写报告。自动研究系统尝试把这些环节连接起来,让上一次结果影响下一步实验。

实验循环

autoresearch 围绕单 GPU 的语言模型训练实验,让 Agent 修改训练代码并比较结果。系统根据评价指标选择是否保留改动,实验受固定的训练预算约束。

从想法到论文

AI Scientist 将实验设计、代码执行、结果分析和论文撰写组织在同一流程中;v2 进一步探索 Agent 驱动的树搜索。

研究证据与记录

每个候选对应配置、代码版本、运行日志和结果。读这类系统时,可以从一个结论反查它由哪些实验支持,以及失败的候选如何影响后续选择。

  1. 2024AI Scientist

    实验、分析与写作

  2. 2025AI Scientist-v2

    Agent 驱动的树搜索

  3. 训练实验autoresearch

    受预算约束的迭代

2025 · arXiv

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search · Yamada et al. · Figure 1
论文原图 · Yamada et al. · Figure 1 · 论文原文

它在解决什么

怎样用实验结果引导下一轮研究?

核心想法

用 Agent 驱动的树搜索组织实验,连接方案、执行、分析与论文撰写。

第一遍读哪里

先看一次完整实验分支,检查最终论述能否对应到实际结果。

论文与学习入口

实验预算
允许消耗的训练时间、算力、调用次数等资源。
Agentic tree search
把不同实验方案及后续改动组织成树,根据已有结果继续探索。

可以动手做什么

从已有的小实验开始,固定数据、评价与运行预算,让 Agent 提出三种修改并实际执行。把每个修改、日志和结果放在一起,写出下一轮选择哪条路线及原因。

RSI:系统能否改进自身的改进能力

递归自我改进(Recursive Self-Improvement)关注一个更进一步的问题:系统修改自己之后,能否变得更擅长做下一轮改进?研究对象可以是 Agent 的代码、工具、搜索策略,也可以涉及学习算法。

谁在被修改

AutoML 通常搜索预设空间中的配置;自动研究系统推进外部课题;自我改进系统还把自身工作方式作为修改对象。阅读时先找到实际变化的代码、策略或参数。

怎样保存和选择版本

Darwin Gödel Machine(DGM)让编码 Agent 修改自身代码,保存多个版本,并通过编码任务评估后继续探索。它的核心循环是版本生成、测试、保留与再次修改。

怎样观察持续改进

除了单次任务分数,还要比较多轮改进曲线、总计算成本和新任务上的效果。下一轮究竟因为系统能力改变而更好,还是因为投入了更多搜索,需要设计对照。

  1. 提出修改自身代码与工具

    形成新版本

  2. 执行测试固定任务与预算

    比较能力变化

  3. 继续改进版本档案与选择

    追踪多轮效果

2025 · arXiv

Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents

Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents · Figure 1
论文原图 · Figure 1 · 论文原文

它在解决什么

编码 Agent 能否通过修改自身代码改善能力?

核心想法

维护多个 Agent 版本,生成自我修改,再用编码任务筛选,形成持续扩展的版本树。

第一遍读哪里

从一处具体代码改动读起,再看版本选择、评价任务和计算预算。

论文与学习入口

自我修改
系统改变自身的代码、工具或策略。DGM 主要修改 Agent 代码。
递归改进
一次改进还改变了继续改进的能力,从而形成后续迭代。

可以动手做什么

先读 DGM 的版本树,挑一个具体代码改动,追踪它怎样被提出、怎样被测量、后续版本是否继承它。再为一个简单工具 Agent 设计固定预算的版本对照。

把一个交叉问题做成小项目

选定一个问题后,把数据、模型和验证接成一条完整的研究流程。

  1. 说清研究对象。 一个样本是一条序列、一名患者、一个细胞,还是某个时刻的市场?目标量怎样测得,有什么单位?
  2. 保留学科结构。 分子有旋转与对称性,图有关系,时序有先后,医学图像有体素间距。表示、模型和损失各自保留了哪些信息?
  3. 确定要面对的新条件。 新分子骨架、新蛋白质家族、新供体、新被试、新患者或未来时间段,对应不同的数据划分。
  4. 建立参照,再分析变化。 比较简单方法与新模型,检查错误集中在哪些条件;候选设计接入后续计算或实验,记录这轮结果怎样影响下一步。

学习时间序列还可以看 Forecasting: Principles and Practice 的趋势、预测与评价方法,教材示例使用 R;Python 项目可看 tsai。

AI for Science 资料索引 · AI4X 资料目录 · 科研问答 · 联系与合作 · 实验与记录