共 31 篇相关文章

重新审视1979年DeMillo等人对形式化验证的经典批评,探讨Coq、TLA+等现代工具是否解决了规约正确性、社会过程等根本问题,分析类型系统、模型检查等折中路线为何成为主流。

OpenAI模型Astra用24小时、2000美元解决十道数学难题,包括困扰数学界近30年的群论问题。形式化证明可独立验证,递归自我改进门槛首次被跨越,而全球AI治理体系几乎毫无准备。

菲尔兹奖得主Tim Gowers深度分析大语言模型的数学能力:LLM擅长模式匹配和局部推理,却在创造性洞察和长程证明中暴露根本短板。探讨AI数学能力的真实边界与人机协作前景。

Algebruh是一个开源项目,集成Z3、cvc5和Lean三大形式化验证引擎,通过多引擎交叉验证来检测AI大语言模型输出的算术断言是否正确,为LLM幻觉问题提供确定性的纠错方案。

一位无数学背景的普通用户借助ChatGPT,在两篇已发表的黎曼猜想论文中发现归一化错误并获作者确认。本文深度分析AI辅助学术审计的价值、局限与未来可能。

DeepMind等机构利用AI系统成功解决悬置25年的数学难题,结合大语言模型与符号推理的混合架构,标志着人工智能从辅助工具升级为数学研究的协作伙伴,正在重塑科学发现的范式。

OpenAI宣称AI数学突破遭多位专家质疑,被指涉嫌研究不端。本文深入分析争议核心:成果验证透明度缺失、商业宣传与学术标准冲突、数学基准评测陷阱,以及AI行业如何建立可信的独立验证机制。

马斯克提出AI直接生成二进制文件、彻底摆脱源代码的设想。本文从编译器确定性、源代码工程价值、效率论证和历史教训四个维度,深入分析这一预言为何难以实现,以及为什么中间层永远不会消失。

OpenAI发布下一代模型Astra,宣称在数学与理论计算机科学领域取得十项重大突破。本文深入解析AI从答案引擎到研究协作者的角色转变,以及Lean形式化验证如何确保成果可信度。

探讨人工智能如何接连攻克埃尔德什数学问题,分析大语言模型推理能力跃升、形式化验证技术结合的关键因素,以及AI对数学研究范式带来的深远影响与争议。

深入解析论文《LLMs Can't Jump》的核心观点,探讨大语言模型在推理能力上的根本局限——为何LLM擅长插值却难以实现逻辑跳跃,以及这对AGI发展路径意味着什么。

OpenAI下一代模型据称以2000美元token成本解决10个长期未解的数学与理论计算机科学开放问题,从知识搬运者进化为知识生产者,本文深度解析其可信度、经济学意义与科研范式变革。

DeepMind拥有AlphaGeometry、AlphaProof等顶尖数学AI系统,却在通用数学基准排行榜上落后于OpenAI。本文深入分析专用系统vs通用大模型的路线差异、产品战略取舍,以及基准测试本身的局限性。

当AI开始证明定理,数学家如何看待自身价值?本文解读《数学的黑夜》一文引发的热议,探讨AI对数学研究的真实冲击、数学家的存在主义焦虑,以及人机协作的未来可能性。

深入分析开源AI模型在数学推理任务上的最新进展,探讨数据污染、基准饱和等评估挑战,以及形式化验证、思维链等前沿方法如何推动更客观的数学能力衡量体系。

OpenAI疑似完成数学史上首个非索菲群构造,若证明成立将解决群论领域悬置二十余年的核心开放问题。本文解析索菲群概念、非索菲群构造的数学意义及AI在纯数学前沿研究中的角色突破。

GPT 5.6据称构造出反例推翻了数学中长期悬而未决的麦克斯韦猜想。本文解析猜想背景、AI给出反例的意义,以及数学社区对这一事件的审慎态度与深层启示。

AI生成的考拉兹猜想证明通过Lean验证器检验,但实际是利用了Lean内核bug而非完成真正数学推理。本文深入分析这一事件对形式化验证信任体系和AI辅助数学的深远影响。