用Claude Code发现系外行星候选:AI如何做真科研

研究者用Claude Code分析NASA数据发现系外行星候选体,并建立可复现的AI辅助科研范式。
一位研究者借助Claude Code对NASA TESS望远镜数据进行深度分析,发现了一颗距地球116光年、轨道周期3.18天、半径约地球1.4倍的系外行星候选体。这一案例的真正价值不在于天文发现本身,而在于其方法论:用AI不断尝试证伪而非验证结论,通过独立智能体会话交叉审计防范"逻辑自洽但实际错误"的输出,并以隐藏数据预测凌星时刻的方式三次验证信号真实性。最终,作者在新数据产生前就公开了预测时刻与判定规则,将整个分析链条置于无法事后改写的公共监督之下,为AI辅助科研应有的开放与可证伪标准提供了具体范本。
一位Reddit用户分享了一段颇具开创性的经历:他使用 Claude Code 辅助分析 NASA TESS 太空望远镜的观测数据,发现了一颗此前从未被记录的系外行星候选体。这不是又一个"AI写代码"的故事,而是关于如何把AI智能体当作严谨科研工具来使用的真实案例。

一颗116光年外的异常恒星
整个发现始于一颗"看起来不太对劲"的恒星。它距离地球约116光年,每隔3.18天就会出现约0.05%的亮度下降,持续大约两小时——这正是行星从恒星前方掠过(凌星)的典型信号。
作者最初是在较近期的TESS数据中注意到这个凹陷的。随后他做了关键一步:往回追溯历史观测。同样的凌星信号在数年前的两批完全独立的TESS观测中都稳定出现。三个不同时间段、互相独立的数据集都给出了一致的周期性信号,这为"真实天体"而非数据噪声提供了有力支撑。
根据凌星深度推算,如果这确实是一颗行星,它的半径约为地球的1.4倍——属于"超级地球"量级。作者反复强调一点:这目前仍是行星候选体(planet candidate),而非已确认的行星。这种克制恰恰是科研态度的体现。
TESS(Transiting Exoplanet Survey Satellite)是NASA于2018年发射的全天巡天望远镜,其核心探测原理即"凌星法":当行星从恒星正面经过时,会遮挡恒星的一小部分光线,导致地球观测到的恒星亮度出现短暂、周期性的微小下降。0.05%的亮度变化在日常中几乎无从察觉,但对精密光度计而言属于可检测的范围。凌星法目前是人类发现系外行星最高产的手段,已帮助确认了数千颗系外行星。TESS将全天分成若干扇区轮流拍摄,每个扇区连续观测约27天后移向下一区域,这意味着同一颗恒星在任务周期内可能在不同年份被多次重访,正是这一特性让作者得以在三批独立数据中找到一致的凌星信号。
AI智能体承担的实际工作
真正让这个案例对技术社区有价值的,是作者使用AI的方式。他借助 Claude Code(搭配 Opus 5.5 与 Fable 5.1 模型)完成了几乎全部的具体执行工作:
- 下载并解析TESS原始数据
- 编写信号搜索代码
- 拟合凌星曲线
- 排查邻近恒星的干扰
- 寻找次食(secondary eclipse)等假阳性迹象
- 生成图表,并在测试失败时自动重跑
人类则负责更高层的判断:提出什么问题、哪些检验才算关键、什么标准算"通过"或"失败"。短短约两周,这项工作演变成了74组独立分析和超过1000个脚本。
作者总结出一条值得所有AI用户记住的原则:用智能体做科学,正确的提问方式不是"这是一颗行星吗?",而是不断给它机会去证明"它不是"。 这种可证伪导向的思路,是避免被AI"看似可信实则错误"结果误导的核心。
用交叉审计对抗AI的说服力陷阱
大语言模型的危险之处在于:它可以生成一份逻辑自洽、看起来无懈可击、却完全错误的分析。为此,作者构建了一套多层审计机制。
独立复核来自 Codex,以及从零开始、仅有只读权限的全新智能体会话。这种"换一个独立大脑重新检查"的做法,模拟了科研中的同行评审。
他最得意的检验方法其实很简单:隐藏整整一年的观测数据,用剩下两年数据计算轨道,然后预测被隐藏那一年凌星应该发生的时刻,再回去只检查那些预测时间点。他做了三次——2018、2020、2025,三次全部命中(3/3)。
审计机制还真的抓出了错误。某个阶段他有一项统计结论显得"比实际更强",审计发现了问题,于是他删掉该结论并重做了那部分分析。而核心的3.18天信号在所有审查后依然成立。
大语言模型的"说服力陷阱"本质上是一种校准失败(miscalibration)问题:模型的输出流畅度与其事实准确性之间并不存在正相关,措辞自信的答案与不确定的答案在表面上几乎无法区分。学界将这类现象称为"幻觉"(hallucination),但在数据分析场景中危害更隐蔽——模型不是凭空编造数字,而是选取真实数据、套用真实统计方法,却在某个中间步骤引入了微小的逻辑错误或过度拟合,最终给出一个"看上去无懈可击"却被放大的结论。作者在本案例中发现的被夸大的统计结论,正是这类错误的典型表现。引入只读权限的独立智能体会话,相当于在同一数据上施行"盲评"——新会话没有与原分析链条共享任何上下文,因此也不会继承原分析可能累积的偏差。
全网检索确认"无人发现"
为了确认这个信号此前没有被别人记录,作者检索了36个星表和文献来源,以及多达340,505条TESS自动行星搜索警报。两个信号都没有被报告过。
此外,同一颗恒星周围可能还存在第二个候选体——半径约2.2倍地球、轨道周期11.13天。但作者坦言这一个的证据要弱得多,因此单独对待,没有将其与主信号混为一谈。这种对不同置信度证据的分级处理,同样体现了科研的严谨。
预注册:让结论真正可证伪
这个案例最亮眼的部分在于它把"可证伪"做到了极致。
TESS将在约10月31日至11月26日期间重新观测这片天区。作者提交了一份观测提案,请求望远镜每2分钟记录一次该恒星——提案获得批准,编号 Program #100。
更关键的是,在任何新数据产生之前,他就提前公开发表了凌星应当出现的精确时刻,以及判断预测"通过"或"失败"的规则。这意味着结论无法在事后被悄悄改写:如果凹陷按预测出现,证据将大大加强;如果没有出现,就是对该候选体不利的证据。
他还做了一个免费的交互式3D系统模型供人"飞进去"参观,并公开了预印本论文与预测数据的DOI链接。这种开放、预注册、可验证的流程,恰恰是AI辅助科研应有的样子。
预注册(pre-registration)是现代科学研究中对抗"结果偏差"的重要实践:研究者在收集或分析新数据之前,就将假设、方法和判定标准公开记录在案,从而杜绝事后"挑选有利结果"或"重新解释数据"的可能。这一做法在心理学可重复性危机之后得到广泛推广,如今逐渐向天文、医学等其他领域渗透。在AI辅助研究的语境下,预注册的意义被进一步放大:大语言模型天然擅长生成听起来合理的叙述,若允许研究者在看到AI输出后再决定"讲什么故事",则系统性偏差几乎无法被外部检验。提前公开凌星预测时刻和通过/失败规则,等于把整个分析链条置于无法事后改写的公共监督之下,这是该案例在方法论上最值得借鉴的设计。
对AI研究应用的启示
这个故事的意义远超一次天文发现。它展示了一种人机协作的范式:AI承担繁重的数据处理与代码执行,人类掌控科学判断与验证标准,并通过多个独立智能体交叉审计来防范"可信但错误"的结果。
作者在帖子结尾抛出一个值得整个社区思考的问题:当一个AI生成的结果看起来完全令人信服、却仍可能是错的,你该如何审计它?在越来越多人用AI做实际研究而非单纯写软件的今天,这个问题的答案或许比发现一颗行星本身更重要。
相关推荐

Codex提示词被公开后,智能体的护城河还剩什么?
OpenAI的Codex系统提示词被公开,7100行规则暴露了智能体的运行逻辑。本文解析Harness框架、长任务可靠性、模型定价与开源替代,探讨提示词公开后AI智能体的护城河与估值之争。

Claude Haiku 5.5发布,谷歌AI水印检测工具全球开放
Anthropic发布速度最快、成本最低的Claude Haiku 5.5,谷歌SynthID水印检测工具全球开放,OpenAI推出GPT-6与Intelligent UI,欧盟收紧AI监管。本文梳理10月8日AI行业重点进展。

OpenAI推出GPT-6:Intelligent UI让回答从文字变成可交互界面
OpenAI发布GPT-6,面向全体ChatGPT用户推出Intelligent UI智能界面能力,让回答从纯文字变成可点、可用的交互界面。本文解析三类核心用法、组件库+编译器技术、响应速度提升与安全升级。