从 ICML 2026 开放复现看 AI Agent 辅助论文复现
从 ICML 2026 开放复现看 AI Agent 辅助论文复现
2026 年 ICML Open Reproductions 挑战展示了一种值得借鉴的科研工作方式:Agent 可以快速阅读论文、实现方法和运行实验,但可靠的复现仍需要明确的问题、可追溯的证据和人的科学判断。
本文不复述赛事安装步骤,也不把 Trackio、Hugging Face Jobs 等具体工具当成必要条件。它提炼的是一套可迁移到计算机科学、智能优化、深度学习、强化学习和一般 AI 实验研究的工作流。
配套 Skills
我把这套方法拆成了 6 个可组合的 Coding Agent Skills,覆盖 claim 提取、协议设计、实验执行、机械核验与独立审计。代码、安装方式和调用示例见 Research Reproduction Skills。
1. 复现的对象是主张,不是整篇论文
“复现一篇论文”范围太模糊。论文通常同时包含性能、效率、鲁棒性、消融、泛化和理论等不同主张;一次实验很难同时检验它们。
更可靠的起点是把论文拆成原子化、可判定的 claim。每条 claim 至少要说明:
- 作者声称什么,适用范围是什么;
- 原文、表格、图或公式在哪里;
- 比较对象、数据或问题实例、预算和指标是什么;
- 什么观察支持它,什么观察与它冲突;
- 哪些关键信息缺失或存在歧义。
例如,“方法在多个任务上更好、更快且更稳定”应拆成性能、效率和稳定性三条 claim。拆分之后,复现目标从“让论文跑起来”变为“现有证据是否支持 C1”。这也是 ICML 2026 挑战按 claim 评判,而不是只给整篇论文一个二元标签的关键价值。
需要区分几种不同目标:
- 重复运行:用作者代码和环境重现已有数字;
- 独立复现:依据论文或规范重新实现并检验主张;
- 稳健性检验:改变种子、数据、尺度或环境,看结论能否保持;
- 证伪尝试:主动寻找能推翻或限制主张的反例。
它们都重要,但证据强度和能回答的问题不同,不能混写成“复现成功”。
2. 先冻结协议,再产生证据
Agent 很擅长补全缺失细节,也容易在结果不理想时继续调试、换参数或换指标。这对探索有帮助,却会模糊正式检验的边界。因此,在正式实验前应形成可版本化的 protocol,明确:
- 要检验的 claim;
- 数据集、基准问题、训练与测试划分;
- 方法、基线及其参数来源;
- 预算、停止条件、随机种子和重复次数;
- 主指标、统计方法和判定标准;
- 必须保持一致的公平性条件;
- 必须保存的代码、配置、日志和原始结果。
论文没有说明的设置不能伪装成“论文设置”。应把它标为未知、外部依赖或经人工批准的假设,并说明它可能怎样影响结论。
协议冻结后仍可以修复错误或进行探索,但必须保留旧版本并记录偏离。修复后的结果属于新的证据批次;由结果启发的追加实验应标为事后探索,不能冒充预先规定的检验。
3. 分层执行:先验证管线,再验证主张
直接启动大规模实验会把实现错误、协议错误和科学差异混在一起。更合适的执行顺序是:
- 最小运行:缩小数据、实例、算法或步数,验证数据流、随机性、预算计数、指标和产物格式。它回答“管线是否可信”,通常不能证明论文主张。
- 正式运行:按冻结协议执行完整实验,保留失败和异常运行,不因结果不符合预期而删改。
- 必要的扩展实验:只在发现尺度效应、统计功效不足或关键替代解释时开展,并清楚标注其地位。
不同领域关注的管线风险不同:优化算法要核对函数评价次数、边界处理和最优值偏移;深度学习要核对数据切分、预处理、检查点选择和训练预算;强化学习要核对环境版本、终止语义、评估回合和多种子方差;生成模型还需要明确自动指标与人工感知评价的关系。
无论领域如何,原始证据都应与汇总结果分离:
配置 + 代码版本 + 运行日志 + 原始结果
↓
确定性分析脚本
↓
表格、图和结论只有汇总表、截图或 Agent 的文字说明,无法构成完整证据链。
4. 把机械核验与科学判断分开
能由程序精确检查的内容,应交给独立脚本重算,例如:
- 计划与实际运行数是否一致;
- seed、样本、函数或任务是否完整;
- 是否出现 NaN、Inf、重复或遗漏;
- 预算与停止条件是否真实满足;
- 汇总统计、排名和显著性检验能否由原始数据重建;
- 失败运行是否被汇总过程静默排除。
这些检查回答的是“数据和计算是否一致”,不是“论文在科学上是否成立”。后者还需要判断实验是否忠实于 claim、基线是否公平、尺度是否充分,以及是否存在更合理的替代解释。
因此,执行者不应同时担任最终裁判。独立审计应尽量从论文、claim、协议、代码和原始证据重新建立判断,先不读取执行者的自我结论。执行者的解释可以作为待检查的陈述,但不能作为证据本身。
5. 结论不是简单的成功或失败
ICML 2026 挑战使用 verified、falsified、toy 和 inconclusive 的 claim 级判定。这组标签适合作为审计语言,但要谨慎解释:
- VERIFIED:在声明的范围和协议下,证据支持该 claim;它不是对论文全部内容或普遍真理的证明。
- FALSIFIED:在足够忠实、公平且有判别力的检验中,证据与 claim 明确冲突;“没有跑出论文数字”本身通常不够。
- TOY:缩小规模、代理任务或合成数据只验证了局部机制,不能外推为完整复现。
- INCONCLUSIVE:证据不足、协议偏离、实现风险、统计功效或定义歧义仍可能改变结论。
复现不是二元事件。同一 claim 的独立尝试可能得到相反结果,这往往提示尺度效应、实现差异、定义歧义或隐藏条件,而不是简单地让多数票决定真伪。最有价值的下一步,是找出哪一项最小的新证据能够区分这些解释。
6. 人与 Agent 的合理分工
ICML 2026 的经验表明,Agent 会陷入局部循环、误读尺度效应,也可能建立在单位错误之上;高质量结果通常有人在关键节点重新定向、质疑前提或完成感知判断。
一种实用分工是:
- Agent 提取 claim、实现代码、运行实验、整理证据和寻找异常;
- 确定性脚本核验计数、统计与数据一致性;
- 独立审计者检查证据与 claim 是否匹配;
- 人决定重要问题、批准关键假设、处理分歧,并对最终科研表述负责。
“独立”不一定要求换模型,关键是减少共享结论造成的锚定:新上下文、只读证据包、盲先审计,通常比在原对话里让同一个 Agent “再检查一遍”更可靠。对于高风险结论、反常结果或准备公开发表的证伪,应再做独立实现、扩大尺度或联系作者核对。
7. 一套可迁移的最小工作流
论文与代码版本
↓
可检验 claims
↓ 人确认目标与歧义
冻结的 protocol
↓
最小运行 → 正式运行
↓
原始证据与确定性重算
↓
独立 claim 级审计
↓
人类科学判断与可追溯报告这套流程不要求固定平台,也不要求每一步由不同模型完成。真正不可省略的是:明确检验对象、提前规定口径、保留原始证据、区分机械核验与科学判断,以及对不确定性诚实。
最终产物也不必复杂,但应让别人能够回答四个问题:验证了哪条 claim,按什么协议执行,结论来自哪些原始证据,还有哪些限制尚未解决。