Gemini登陆Windows,OpenAI攻克千禧年难题新进展

9月11日AI资讯:Gemini入驻Windows、OpenAI逼近第二道千禧年难题、语音API与垂直行业方案集中落地。
9月11日,AI领域在生产力工具、数学科研与开发者基础设施三条线上同步推进。Gemini正式登陆Windows桌面,以Alt+Space快捷键嵌入日常工作流,直接对标微软Copilot。OpenAI宣称在第二个千禧年大奖难题上取得实质进展,外界猜测为霍奇猜想或BSD猜想,但细节尚未公布。与此同时,Frontier Math Tier 4被AI全部攻破,14个月内最高得分从不足5%升至98%,基准趋于饱和。开发者侧,GPT-Live-1全双工语音系统开放API,多项关键指标超越前代;OpenAI还推出金融与医疗垂直版ChatGPT,DeepSeek V4.1 Flash成新开源旗舰。整体来看,这一天的资讯集中揭示了大模型商业化与科研突破的双轨加速态势。
9月11日的AI资讯密集程度足以说明当下技术迭代的速度。从Gemini全面登陆Windows桌面,到OpenAI在数学千禧年大奖难题上的实质突破,再到GPT-Live-1开放API,这一天集中呈现了大模型在生产力、科研与开发者工具三条战线上的同步推进。以下梳理本期13条新闻中最值得关注的几项。
Gemini正式进入Windows桌面
Gemini应用现已支持Windows用户,只需按下Alt+Space即可在常用工具旁快速唤起Gemini。这一交互设计的意义在于,它把AI助手嵌入到日常工作流的最短路径上——无需切换窗口或打开浏览器。
从功能覆盖看,Gemini桌面版可用于润色草稿、总结长文档、头脑风暴,以及生成自定义图片和视频。这意味着谷歌正在把Gemini打造为Windows平台上与系统深度绑定的常驻助手,直接对标微软Copilot的系统级入口策略。对普通用户而言,快捷键唤起+多模态生成的组合,降低了AI工具的使用门槛。
OpenAI在千禧年难题上再进一步
据《纽约时报》报道,在此前完成纳维-斯托克斯方程相关工作之后,OpenAI表示其在第二个千禧年大奖难题上也取得了实质性进展。不过OpenAI并未指明具体是哪一道题,也未公布结果,目前仍在决定如何对外披露。
外界猜测大概率是霍奇猜想(或奇猜想)或BSD猜想,因为这两个问题在七大千禧年难题中相对更易切入。需要强调的是,在官方结果公布前,这些都属于推测。千禧年大奖难题是数学界最艰深的一批未解问题,AI若真能在其中取得可验证的进展,将对科研范式产生深远影响。这也是本期最需要谨慎看待、又最令人期待的一条消息。
千禧年大奖难题(Millennium Prize Problems)由克雷数学研究所于2000年设立,共七道题,每道悬赏100万美元。目前唯一被解决的是庞加莱猜想(2003年由佩雷尔曼证明)。其余六道——黎曼猜想、P vs NP、霍奇猜想、BSD猜想(贝赫和斯维纳通-戴尔猜想)、纳维-斯托克斯方程存在性与光滑性、杨-米尔斯存在性与质量间隙——至今悬而未决。霍奇猜想涉及代数几何中代数环与上同调类之间的关系,BSD猜想则关联椭圆曲线上有理点的分布与L函数零点,二者都有相对明确的代数框架,因此被外界视为AI切入的可能方向。AI系统若要在这类问题上取得可被数学界认可的进展,不仅需要给出结论,还需要提供严格可验证的形式化证明,这是与工程基准测试本质不同的挑战。
数学基准的饱和:Frontier Math Tier 4被攻破
与千禧年难题的进展相呼应,Epoch AI宣布Frontier Math Tier 4的所有题目现已全部被AI攻破,GPT-6 Astra解出了最后一道未解难题。

出题人Jay Panton表示,Astra的解法与他自己的思路非常接近,并未出现意料之外的方法,他称半年前若有模型能解出会令他震惊,如今却已难以感到意外。数据的变化更直观:Epoch推出Tier 4时最高得分不到5%,不到14个月后最高得分已达98%,Epoch据此认为该基准已经饱和。基准饱和意味着评测体系需要不断更新才能跟上模型能力的增长速度,这本身就是模型进步的一个侧写。
Frontier Math是由Epoch AI维护的一套面向前沿数学能力的评测基准,题目由职业数学家设计,涵盖竞赛数学、组合数学、数论等多个领域,并按难度分为多个Tier。与MATH、GSM8K等常见学术基准不同,Frontier Math的题目设计刻意回避了互联网上已有的解题路径,以减少模型通过记忆训练数据作答的可能性。基准饱和(benchmark saturation)是AI评测领域的常见现象:当最先进模型在某一测试集上的得分接近满分,该基准便失去区分不同模型能力的效力。这要求评测机构持续推出更难的题目集,形成"模型能力—基准设计"之间的追逐循环。Tier 4从发布到饱和仅历时14个月,这一速度本身就是当前模型迭代节奏的具体体现。
GPT-Live-1开放API,全双工语音交互升级
OpenAI宣布GPT-Live-1现已在API中可用。这是一款具备强大工具调用能力的全双工系统,开发者可在应用中引入ChatGPT式的自然对话体验,支持边说边听,并可搭配用户自选的模型和Agent Harness。

据OpenAI介绍,GPT-Live-1在那些对生产级语音智能体最重要的基准上——任务完成、多轮对话与轮次交替、模型响应速度、工具调用等——表现均大幅超越GPT Real-Time 2.1。全双工与低延迟是语音Agent走向实际生产环境的关键门槛,这次开放API让开发者能直接构建更接近真人交流节奏的语音应用。
此外,OpenAI推出的Agents API也进入公开测试阶段,开发者可使用Codex Harness构建并运行云端智能体,由OpenAI托管编排、绘画与上下文管理,开发者只需专注于智能体本身。
全双工(Full-Duplex)语音通信指通话双方可以同时说话和收听,类似真实的人际对话,而无需像对讲机那样轮流切换发言权(半双工)。此前多数语音AI系统采用的是检测到用户停顿后才开始响应的机制,容易产生明显的延迟感和打断困难。全双工架构要求系统在持续输出语音的同时实时监听用户输入,并能在被打断时及时调整,这对模型的流式推理能力与延迟控制提出了更高要求。低延迟与全双工结合,是语音Agent从"语音版聊天机器人"演进为"真实感对话伙伴"的关键技术门槛,也是语音交互在客服、医疗问诊、实时辅助等生产场景中实用化的前提条件。
编码与开源模型的多线竞争
本期在模型层面同样热闹。Cognition发布编码模型Sway 2,在Frontier Code基准上取得50.0%,据称与更强模型差距在1分以内,且成本低64%;Deep Sway 1.1得73分,比GPT-6 Astra低数分,但成本仅四分之一。成本优势正在成为编码模型竞争的核心卖点。

开源阵营方面,Artificial Analysis评测显示DeepSeek V4.1 Flash在Intelligence Index得分40,超过V4 Pro,成为DeepSeek新旗舰。它采用原生多模态输入,输入激活参数8B、输出激活参数16B,支持超长上下文,并以MIT许可开放。同期,MiniMax宣布加入NVIDIA AI Builder Program,开发者可免费获得400多美元额度与折扣,并使用来自NVIDIA、LangChain、Hugging Face、Cognition等方的模型基础设施与工具。
垂直行业版ChatGPT密集落地
OpenAI在垂直场景的推进也值得关注。金融服务版ChatGPT将内置金融数据与GPT-6 Astra的推理能力结合,团队可开展研究、搭建财务模型并制作定制化客户材料,内置数据涵盖来自TheLoop、PitchBook等的数据集。

医疗领域,OpenAI发布ChatGPT for Clinicians,通过认证的美国临床医生可免费获得GPT-6 Astra Pro访问权限;在HealthBench Professional测试中,GPT-6 Astra领先所有模型。此外,Krea AI推出Flux Video Edit,可在视频中高精度、超快速地替换任意内容,现已开放试用;Anthropic的Claude Code也上线了新的Diff面板,支持滚动点击并实时更新,方便边看代码边工作。
小结
这一天的资讯呈现出清晰的三条主线:AI助手向操作系统级入口渗透(Gemini、Copilot式竞争)、大模型在数学科研上逼近人类前沿(千禧年难题与基准饱和)、以及开发者工具与垂直行业方案的加速商业化。其中OpenAI的千禧年难题进展尚未公布细节,仍需等待官方验证,但其余多条消息已在实实在在地改变开发者与专业用户的工作方式。
相关推荐

Automattic高管在Mullenweg短暂离任期间签署互惠离职协议
Automattic公司CFO Mark Davies与法务负责人Andy Missan在Matt Mullenweg短暂离任期间相互签署离职补偿协议,包含一年薪资与额外股权归属,引发公司治理透明度关注。

H3 Singularity优化技巧:加速40%还能提升画质
Reddit社区分享的Minimax Singularity工作流优化技巧:在H3 Latent前插入RTX上采样器,实现40%加速同时提升画质,附参数取舍与12bit输出实践经验。

X上线Cashtags股票交易功能,社交与市场界限消融
X(原Twitter)宣布向美国用户开放通过Cashtags直接交易的功能,打通市场讨论与实际交易的通道。本文解析这一功能的运作逻辑、社交交易的机遇与风险,以及平台边界扩张背后的趋势。