#大模型
共 301 篇相关文章

Mistral新模型何时发布?社区揣测与现状分析
Reddit社区热议Mistral是否有新模型发布计划。本文分析Mistral近期的沉默期、站点引入GLM模型的现象,以及开源模型用户应如何理性看待其发布节奏。

推理链传递的真相:角色分工问答中的"消息干预"研究
一项arXiv新研究通过"消息干预"方法揭示:角色分工问答中,忠实推理链几乎不提升答案准确率,而被污染的推理链会严重扭曲验证器判断,暴露出AI系统的"过度信任"失效面。

OpenAI重开Codex Pro 200美元档:用量算法改动与7条AI要闻速递
OpenAI重开Codex Pro 200美元档并调整用量算法,实际额度约为旧版一半但取消5小时限制。本文速递7条AI要闻,涵盖Claude Sonnet 5.5降本、豆包个人助理、Grok 4.7上架Bedrock及订阅性价比榜单。

Claude Opus 5.5发布:降价提速,AI价格战白热化
Anthropic发布Claude Opus 5.5,性能追平旗舰Fable 5.1,速度提升30%,全面降价缓存成本砍60%,编码碾压GPT-6 Astra且成本仅1%。同日OpenAI反击,AI价格战全面白热化。

四个Claude中藏一个Kimi:AI能揪出"卧底"模型吗?
一场有趣的AI实验:把一个Kimi藏进四个Claude中,Claude靠多提示行为指纹法加SHA-256哈希校验成功揪出卧底,而Kimi反向识别却失败。本文解析其背后的评测协议设计原理。

GPT-Synopsys:前沿AI如何重塑芯片设计
GPT-Synopsys 探索将前沿大模型引入芯片设计流程,本文分析其核心定位、AI重塑EDA的价值、技术落地挑战与行业趋势,解读AI+芯片设计的未来可能。

Gemini 4 Argon曝光:百万token输出,但你暂时用不了
谷歌DeepMind传出新模型Gemini 4 Argon,宣称支持百万token输出,对标Astra与Fable。目前仅向Fairwind项目的政府用户与网络防御者开放,普通用户暂无法体验。

重新理解AI"节奏控制":为何更便宜的模型才是正解
各大AI实验室密集发布Grok 4.7、GPT-6 Sol、Opus 5.5等模型,看似违背了"控制前沿节奏"的呼吁。本文深入解析pacing的真正含义:通过C语言类比、推理token悖论和基准测试解读,说明为何更便宜、更不易犯蠢的模型才是节奏控制的正确形态。

8G显存本地跑125B大模型:Qwen3.8-Flash-Next部署实测
零度解说实测开源项目在8G显存消费级显卡上本地运行125B参数的Qwen3.8-Flash-Next大模型,N卡A卡通用。涵盖量化部署流程、代码生成、多模态识别与Agent应用全过程。

LangGraph+MCP+医疗RAG:企业级多智能体实战入门
图灵学院楼兰老师基于真实医疗项目,讲解 LangGraph+LangChain+MCP 构建企业级多智能体 Agent 的实战思路。剖析主流 Agent 教程的两大坑点,强调先懂逻辑再做项目,帮开发者打开眼界、建立可落地的智能体开发体系。

Gemini 4 Argon 发布:百万 Token 输出,基准领先 GPT-6 Astra
Google 发布 Gemini 4 Argon,输出上限提升至 100 万 Token。软件工程基准得分 77.9% 领先 GPT-6 Astra 与 Cloud Opus 5.5,开放范围限 API 与 Ultra 订阅者,本文解析其能力、价格与定位。

Gemini 4 Argon发布:谷歌凭多项基准测试重回第一梯队
谷歌发布Gemini 4 Argon,在办公流程Automation Bench、长视频理解LVBench和长流程编程Deep SWE三项基准测试中超越GPT-6 Astra与Claude Opus 5.5,重回AI第一梯队。本文解读其核心优势与三家竞争格局。

AI日报:谷歌Gemini 4 Argon登场,蚂蚁Ling-3.1发布,OpenAI点名蒸馏攻击
AI日报速览:谷歌Gemini 4 Argon发布支持百万Token,蚂蚁Ling-3.1-flash上线,OpenAI点名月之暗面相关的蒸馏攻击,DeepSeek适配华为昇腾,英伟达推出AI代理CPU等9条前沿动态。

Google最强模型Gemini 4 Argon发布:多项基准登顶,内部评价却存分歧
Google DeepMind 发布最强模型 Gemini 4 Argon,在 Automation Bench、VALS、多模态理解等多项基准登顶,超越 Opus 5.5 与 GPT-6 Astra。但 Bloomberg 报道称内部员工认为其编程实战表现不及跑分。本文解析其性能、定价与争议。

谷歌发布Gemini 4 Argon:主打编程与网络安全的最强模型
谷歌发布最新Gemini 4 Argon模型,定位为专注编程与网络安全的主力工具,并称其为迄今最强大的Gemini模型。本文解析其定位、应用方向与行业竞争背景。

Gemini 4发布争议:是真突破还是Google式"纸面发布"?
Reddit社区热议Gemini 4发布:共识认为它只是"宣布"而非真正上线,被批Google式"纸面发布"。文章梳理交付质疑、2美元/10美元定价争议、长期主义辩护与行业发布疲劳等多方观点。

AI竞赛进入尴尬期:技术领先不再是唯一变量
AI竞赛进入尴尬期:当各家大模型能力趋同、benchmark差距缩小,技术领先不再是唯一决胜变量。本文解析AI竞争下半场的产品化、成本效率与生态博弈新格局。

OpenAI 发布 GPT-6.1 Sol:价格仅 Astra 五分之一,Codex 与 ChatGPT 齐更新
OpenAI 发布 GPT-6.1 Sol,价格低至 Astra 五分之一,缓存输入每百万 Token 仅 0.10 美元。同时 Codex 支持多端运行与安全扫描,ChatGPT Space 与 Dots 强化团队协作,附国产开源与竞品最新动态。

