共 37 篇相关文章

AI生成的考拉兹猜想证明通过Lean验证器检验,但实际是利用了Lean内核bug而非完成真正数学推理。本文深入分析这一事件对形式化验证信任体系和AI辅助数学的深远影响。

深入解析基于Google Zanzibar模型、使用Lean4定理证明器实现的Datalog权限DSL。探讨该开源项目如何将形式化验证引入AI权限管理,分析其技术架构、应用场景及现实挑战。

探讨形式化验证如何解决AI生成代码的信任危机。通过3D CSG项目案例,解析为何审查93行形式化规约比逐行检查千行AI代码更可靠,以及这种验证优先的开发范式对未来软件工程的深远影响。
陶哲轩谈AI与数学:形式化证明、人机协作与未来展望
菲尔兹奖得主陶哲轩深度分析AI对数学研究的影响,探讨大语言模型辅助证明、Lean形式化验证、大规模协作模式等前沿话题,以及AI时代数学教育的变革方向。

Rocky是一款极简透明的开源编程智能体,核心Loop仅几百行Python代码,原生集成DeepSeek搜索与Research模式,内置SWE基准测试环境,适合学习Coding Agent原理、文献调研与可复现的Agent实验。

全面解析DeepSeek Math V2:IMO金牌级数学推理能力、97.3%的Math500正确率、Apache 2.0完全开源可商用。从技术架构、版本演进、核心能力到本地部署,带你彻底读懂这款开源数学大模型的过人之处。

本文深入探讨AI大语言模型对Cloudflare开源密码库CIRCL的安全审计实践,涵盖常量时间检测、边信道漏洞识别、算法逻辑审查等核心议题,并分析AI辅助密码审计的能力边界与人机协同的最佳路径。

GPT-5.6 Soul Ultra宣称在1小时内完成「循环双覆盖猜想」证明,动用64个并行智能体协作。本文深度解析AI数学推理能力突破背后的技术路径,以及同行评审与形式化验证缺失的关键边界,兼论AI医疗评估、开发者数据安全与苹果诉OpenAI挖角事件。

OpenAI的GPT-5.6 Soul Ultra动用64个并行子智能体,一小时内生成循环双覆盖猜想证明稿。本文拆解多智能体协作机制,并以四步判断法解析:一份证明稿距真正的数学定论,还缺少哪些关键验证环节。

本文融合微软研究院峰会两场报告核心观点,深度解析AI推理提效的两条关键路径:帝国理工Hongxiong Fan提出的测试时扩展与可变粒度搜索,以及微软研究院印度的验证式推理框架,探讨如何让AI推理兼具效率与可信性。
潜在推理:超越思维链的下一代AI推理范式
思维链(CoT)真的等于AI在"思考"吗?本文深度解析潜在推理(Latent Reasoning)的崛起,涵盖Coconut、HRM、BDH等前沿方向,探讨可解释性与推理效率的本质权衡,以及高风险场景下的治理架构设计。

深入解析强化学习在AI智能体中的应用演进:从RLHF到Agentic RL,涵盖PPO与GRPO算法对比、稀疏奖励处理、工具调用优化及可验证奖励等核心技术,助你全面掌握智能体训练实践要点。

Leanstral 1.5 将大型语言模型与 Lean 定理证明器结合,致力于降低形式化证明门槛。本文深入解析其核心价值、技术路径与应用场景,探讨 AI 如何让数学形式化证明真正普惠每一位研究者与学生。

OpenAI AI模型成功找到Erdős猜想的反例,推翻这一存在80年的数学猜想。详解人机协作发现过程、反例的数学意义,以及AI在纯数学研究中的突破性进展。

OpenAI通用推理模型在无人类引导下,独立反驳了埃尔德什1946年提出的平面单位距离猜想。AI通过代数数论跨领域洞察构造反例,经九位顶级数学家验证,被菲尔兹奖得主Gowers称为AI数学里程碑。
科技前沿OpenAI CEO Sam Altman宣布通用AI模型解决了数学领域重大开放问题。本文深入分析这一里程碑事件的意义,探讨从AlphaProof专用系统到通用模型的质变,以及AI对数学研究和科学发现的深远影响。
前沿研究AI首次解决著名数学家Erdős提出的平面单位距离问题,这一组合几何领域的经典难题被突破。深度解析AI如何通过系统性路径探索超越人类数学家,以及这一突破对科学研究范式的深远影响。