OpenDiscoveryTrace:558条轨迹数据集如何审计AI科学家推理过程

OpenDiscoveryTrace通过558条结构化推理轨迹,揭示了成功率相近的AI科学家系统在错误模式上存在30倍差距。
当前主流的AI科学家评测基准只关注最终产出,忽视了模型的推理过程,导致无法区分"系统性推理"与"幸运猜中"。OpenDiscoveryTrace数据集通过收录558条完整智能体轨迹,以九字段结构精细记录每个执行步骤,覆盖药物发现、材料科学、基因组学和科学文献分析四大领域的124项任务,并对比了七个前沿闭源与开源模型。初步分析发现,三个前沿模型的任务成功率相近(84%–89%),但Claude Opus 4.6产生的错误是GPT-5.4的30倍,且两者的失败模式根本不同——前者主要是工具误用,后者主要是推理错误。这说明过程级评测能捕捉到纯输出评测完全看不见的关键差异,为AI科学家的审计、优化与治理提供了可落地的新范式。
只看结果的AI科学家评测正在失效
近年来,自主式AI科学家(Autonomous AI Scientists)成为研究热点——它们能自动生成假设、编写实验代码、甚至撰写论文。然而,如何评价这些系统的表现,一直是个棘手问题。
目前主流的评测基准几乎都只关注最终产出:生成的代码是否能跑通、假设是否合理、论文质量如何。这种做法看似直接,却存在一个致命盲区——它彻底丢弃了模型得出这些结果的推理过程。
这带来三个无法回避的难题:无法审计科学方法论是否严谨、无法诊断失败的具体原因、更无法区分「系统性推理」与「幸运猜中」。一个模型可能通过正确的逻辑链条得到答案,也可能纯靠蒙对——但从最终输出看,两者毫无差别。
新论文《OpenDiscoveryTrace》正是针对这一痛点提出的解决方案:它主张评测不应只看模型「产出了什么」,更要看它「如何推理」。

自主式AI科学家(Autonomous AI Scientists)是一类能够在最小人工干预下完成完整科研闭环的智能体系统,典型工作流包括:检索与解读文献、提出可验证假设、自动设计并执行计算实验(调用代码解释器、外部API或数据库)、分析结果、最终生成结构化报告或论文草稿。这类系统近年来以 AI Scientist(Sakana AI, 2024)等项目为代表引发广泛关注,但其评测难点也随之暴露——科学任务往往没有唯一标准答案,且产出质量难以用传统的准确率指标量化,这使得「只看最终输出」的评测方式更加脆弱。
558条完整推理轨迹:OpenDiscoveryTrace数据集详解
OpenDiscoveryTrace 是一个包含 558 条完整AI科学智能体轨迹的公开数据集,其核心创新在于对推理过程的结构化记录。
九字段轨迹结构:逐步还原AI的心智过程
数据集的每一条轨迹都由多个执行步骤组成,而每个步骤都被拆解为九个字段进行记录,包括:
- Thoughts(思考):模型的推理内容
- Tool Calls(工具调用):调用了哪些外部工具
- Observations(观察):工具返回的结果
- Errors(错误):执行过程中出现的问题
- Revision Triggers(修正触发):模型何时以及为何调整策略
- Self-reported Confidence(自报置信度):模型对自身判断的信心程度
这种细粒度的记录方式,使研究者能够像回放录像一样,逐步还原AI在解决问题时的完整心智轨迹,而非只看到一个孤立的终点。
「轨迹(Trace)」在智能体研究中是一个关键概念,指智能体在完成任务过程中所有中间状态与动作的有序记录,本质上是对「思考—行动—观察」循环(ReAct框架所描述的 Reason-Act 循环)的完整日志化。与仅保存最终答案的传统日志不同,轨迹保留了模型在何处分叉、何处回溯、调用了哪些工具以及工具返回了什么——这些中间信息是事后诊断和可解释性分析的基础。OpenDiscoveryTrace 将轨迹进一步细化为九个字段,尤其是「Revision Triggers(修正触发)」和「Self-reported Confidence(自报置信度)」两项,在现有公开数据集中较为少见,为研究模型的元认知行为提供了新的观察窗口。
覆盖四大科学领域的124项任务
这些轨迹来自模型执行的 124 项科学任务,跨越四个真实的科研场景:药物发现(drug discovery)、材料科学(materials science)、基因组学(genomics)以及科学文献分析。这样的领域覆盖确保了评测不局限于玩具问题,而是贴近真正的科学工作流。
七个模型横向对照:前沿闭源与开源权重的全面比较
数据集在模型选择上做了精心平衡,涵盖两类共七个模型:
三个前沿模型:GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro,各贡献 124 条轨迹,在领域和难度上完全均衡分布。
四个开源权重模型:Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B,各 30 条轨迹。
此外还额外包含 60 条「实时检索」变体轨迹,用于考察模型在联网获取信息场景下的行为。这种前沿闭源与开源模型的对照设计,为研究不同规模、不同厂商模型的推理差异提供了宝贵基础。
过程轨迹揭示了输出评测看不见的关键差异
论文最引人注目的发现来自对 363 条经LLM裁判评估轨迹的初步分析——过程轨迹暴露了纯输出评测完全无法捕捉的行为差异。
成功率相近,错误率却相差30倍
三个前沿模型的任务成功率非常接近,都在 84%–89% 之间。如果只看这个数字,人们会得出「它们水平相当」的结论。
但过程分析给出了截然不同的画面:Claude Opus 4.6 产生的错误数量是 GPT-5.4 的 30 倍(每条轨迹平均 2.5 个错误 vs. 0.08 个)。这一差异在统计上极为显著(p < 0.0001,Cliff's δ = 0.613),绝非偶然。
Cliff's δ 是一种非参数效应量(effect size)统计指标,用于衡量两组数据之间差异的实际大小,取值范围为 -1 到 1。与 p 值不同,p 值只反映差异是否达到统计显著性,效应量则回答差异「有多大」。δ = 0.613 在经验标准中属于「大效应」(large effect,通常 |δ| > 0.474 即为大效应),意味着即便不考虑样本量,Claude Opus 4.6 与 GPT-5.4 在错误频率上的差异也具有实质性意义。将 p 值与效应量结合报告,是当前统计分析的最佳实践,能有效防止大样本下微小差异被错误夸大为「重要发现」。
工具误用vs推理错误:失败模式的本质不同
更深一层的洞察在于错误的性质差异:
- Claude Opus 4.6 的错误中,66.7% 是工具误用(tool misuse)
- GPT-5.4 的错误中,83.6% 是推理错误(reasoning errors)
这意味着两个模型即便达到相似的成功率,其失败模式的根源截然不同——一个在「用错工具」,一个在「想错逻辑」。这类信息对于理解模型的真实能力边界、指导针对性优化至关重要,而这些全部隐藏在仅看最终输出的评测之外。
五项基准任务与CC BY 4.0开放生态
为了让数据集真正可用于研究,作者定义了 五项基准任务,并提供了从逻辑回归、随机森林、LSTM 到 Transformer 等多种模型的基线结果,方便后续研究者对比。
更值得称道的是其开放态度:数据集、轨迹模式(trace schema)、智能体运行框架(agent harness)以及基准定义,全部以 CC BY 4.0 许可证公开。这为过程级评测、科学智能体审计和 AI 治理等方向的研究扫清了门槛。
CC BY 4.0(Creative Commons Attribution 4.0 International)是目前学术数据集领域最常用的开放许可证之一,允许任何人自由使用、修改和再分发数据,唯一要求是注明原始来源。相比更严格的 CC BY-NC(禁止商业使用)或 CC BY-SA(要求相同许可证传播),CC BY 4.0 对商业应用和闭源下游产品均无限制,因此对工业界和学术界都具有最高的可及性。数据集、评测框架和基准定义同步开放,也符合「可重现科学(Reproducible Science)」的倡导方向,使后续研究者能够在完全相同的条件下复现和扩展实验。
从「结果导向」到「过程可审计」的评测范式转变
OpenDiscoveryTrace 的价值不仅在于一个数据集,更在于它推动了一种评测范式的转变。
随着AI在科学研究中扮演越来越重要的角色,「它能否得出正确结论」已经不够,我们更需要知道「它是如何得出结论的」。可审计的推理过程是建立信任、发现系统性缺陷、乃至进行AI治理的前提。
对于开发者而言,过程轨迹能帮助定位模型是「工具型选手」还是「推理型选手」,从而针对性地改进;对于科学界而言,它提供了验证AI科学发现方法论严谨性的手段;对于监管与治理,它则提供了一个可落地的审计框架。
可以预见,随着自主AI科学家能力的持续增强,「过程级评测」将成为不可或缺的一环,而 OpenDiscoveryTrace 正是这一方向上的重要奠基工作。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。