Jev在NASA开普勒信号上的实测:零微调达到72.5%准确率

通用AI Agent Jev在NASA开普勒数据上零微调达到72.5%分类准确率,验证通用推理向科学数据迁移的潜力与局限。
一位Reddit开发者将AI Agent系统Jev应用于NASA开普勒望远镜的8054个天体候选信号分类任务,在完全零样本、无任何微调的条件下,判断哪些是已确认行星候选、哪些是误报。结果显示整体准确率达72.5%,比手工设定的三规则基线高出约8个百分点。系统在误报识别上表现更强(81.7%),行星恢复率约73%,整体偏向保守判断。实验具备可复现性,作者已公开完整配置与混淆矩阵,但需注意:基线选择偏简单,专用机器学习方法在同类任务上普遍可达90%以上,实验也尚缺第三方复现。其价值更多在于为"通用Agent能否迁移到垂直科学领域"这一问题提供了一个具体的可量化参照。
一次跳出常规的AI Agent测试
大多数AI Agent的演示都停留在任务路由、工具调用这类熟悉的场景里。Reddit上一位开发者却把名为Jev的系统丢进了一个完全陌生的领域——天文数据分析,用它来处理NASA开普勒望远镜的历史观测信号。
测试的核心问题很直接:面对8000多个开普勒关注天体(Kepler Objects of Interest,简称KOI),Jev能不能仅凭描述信号的测量数据,判断出哪些是已确认的行星候选、哪些是误报(false positive)。关键的实验设计在于,NASA档案库中的真实标签在每次预测保存完成之前都是隐藏的,避免了任何形式的数据泄露。

开普勒太空望远镜(Kepler Space Telescope)是NASA于2009年发射的系外行星探测卫星,其核心方法是凌日法(Transit Photometry):当行星从恒星前方经过时,会造成恒星亮度的周期性微弱下降(通常不足1%),望远镜通过持续监测约15万颗恒星的光变曲线来捕捉这一信号。开普勒关注天体(KOI)是指光变曲线中存在类行星凌日特征、因此被标记为候选目标的天体编号系统。由于宇宙噪声、双星系统、仪器误差等因素,大量KOI最终被证明是误报(false positive),真正确认为行星的比例相对有限。这使得KOI数据集天然具有类别不平衡的特点,同时每个天体都附带轨道周期、凌日深度、恒星半径比等数十个测量参数,是测试AI推理能力的理想结构化数据场景。
实测结果:72.5%的准确率意味着什么
根据作者公布的数据,Jev在全部8054个决策中的表现如下:
- 整体准确率 72.5%,与NASA档案标签一致
- 作为对照的简单三规则基线(3-rule baseline)仅为 64.4%
- 在已确认行星的识别上,成功恢复了 1999 / 2731(约73%)
- 在误报的捕捉上,抓住了 81.7% 的假阳性样本
最值得关注的一点是:整个过程没有任何微调,也没有使用该数据集中的任何示例。换句话说,Jev是在完全零样本(zero-shot)的条件下完成这批天文信号分类的。
对比之下,8个百分点的领先幅度虽然不算悬殊,但考虑到基线规则通常是天文学家依据物理经验手工设定的启发式判断,一个通用系统能在零先验知识的情况下稳定超过它,说明其对结构化测量数据的推理能力具备一定的迁移价值。
混淆矩阵透露的偏向
从作者在GitHub Gist中公开的完整设置、请求记录和混淆矩阵可以看出,Jev在误报识别(81.7%)上明显强于行星恢复(约73%)。这种非对称表现意味着系统在判断时相对"保守",更倾向于把边缘信号归为误报。
对于系外行星搜索这类任务,这种偏向是把双刃剑。一方面,减少假阳性能降低后续昂贵的地面望远镜复核成本;另一方面,漏掉真实行星候选(约27%的漏检率)也意味着可能错过有价值的目标。真正投入科研使用时,需要根据研究目标在召回率与精确率之间做出权衡。
这类测试的价值与局限
这次实验的意义并不在于72.5%这个数字本身有多高,而在于它验证了一个更普遍的命题:一个面向Agent/路由场景设计的系统,能否把推理能力迁移到训练分布之外的科学数据上。
从公开信息看,这个测试有几点需要冷静看待:
- 样本来自单一来源,仅是Reddit开发者个人发布的实验,尚无第三方复现验证
- 基线选择偏简单,三规则基线并非当前天文界主流的机器学习分类器(如随机森林在KOI分类上普遍能达到90%以上),因此这个对比更多说明"优于朴素规则",而非"达到SOTA水平"
- Jev本身的技术细节在原帖中披露有限,读者需要查阅其Gist文档才能了解具体的请求构造方式
作者已经把完整的实验配置、请求内容和混淆矩阵开源在Gist上,这种可复现的透明态度值得肯定。对于想探索通用推理系统在垂直科学领域应用边界的开发者来说,这是一个有参考价值的起点。
在天文行星候选分类领域,目前学术界主流的机器学习方法已发展得相当成熟。随机森林(Random Forest)分类器在KOI数据集上经过调参后准确率普遍超过90%;深度学习方法(如卷积神经网络直接处理光变曲线原始时序)在部分论文中更可达到96%以上。此外,NASA官方的Autovetter工具和ExoFOP平台也集成了多种统计与机器学习流程用于候选体审查。相比这些专门训练的模型,Jev的72.5%处于明显较低的水平——但这恰恰是该实验的真正前提:它测试的是一个从未针对天文任务优化过的通用推理系统,能否仅凭测量值描述完成零样本分类,而非与领域专用模型竞争精度。两者解决的是不同层次的问题,不宜直接对标。
小结
把AI系统推到它"不该擅长"的领域去测试,往往比在标准benchmark上刷分更能揭示其真实能力边界。Jev在NASA开普勒数据上的这次零微调实测,用72.5%的准确率和对简单基线8个百分点的领先,展示了通用推理能力向科学数据迁移的潜力,同时也暴露了行星召回不足的短板。它不是一个可以直接用于科研生产的结论,但为讨论"通用Agent能走多远"提供了一个有意思的具体案例。
相关推荐

人类造过最快的东西:帕克太阳探测器的43万英里时速
人类建造过最快的物体不是旅行者号或火箭,而是NASA帕克太阳探测器,时速约43万英里。本文解析它如何借助金星引力辅助与太阳引力井加速,以及为何以光速衡量人类仍刚刚起步。

美光CEO警告:内存供应将在未来两年持续趋紧
美光CEO表示存储芯片供应将在未来两年比当前更为紧张,AI需求激增与产能扩张滞后是主因。本文分析内存供应趋紧的原因及其对市场和消费者的影响。

用WhatsApp对话你的AI Agent:开源工具agent-bridge实测解读
开发者开源了AI Agent工具agent-bridge,可通过WhatsApp自我聊天直接与Agent框架对话。本文解读其TypeScript实现、npm包使用方式及这类IM交互工具的优势与风险。