共 43 篇相关文章
科技前沿悟空2.2P 35B MOE模型正式开源,采用对抗式杂交蒸馏技术,综合性能超越Qwen3.6-27B。4090显卡Q5量化达158 tokens/s,仅需8.9G显存即可运行,支持256K上下文。详解核心技术、硬件配置与实测数据。

深度对比Qwen3-27B从1Bit到8Bit各量化档位的显存需求、推理速度与部署成本,帮你找到精度与预算的最佳平衡点。单卡4090跑4Bit每秒49字,本地部署成本仅为云端API的五十分之一。

加州大学伯克利分校开源FreeToken推理系统,利用MoE架构稀疏性实现753B参数模型单卡运行。本文解析其分层调度原理、三档硬件实测结果及关键性能限制,帮助本地部署从业者重新评估硬件需求。

Qwen系列模型跻身HuggingFace历史点赞榜前四,引发Reddit热议。本文深入分析Qwen快速积累人气的原因,包括开源策略、性能与实用性平衡,以及这一现象对全球开源大模型竞争格局的影响。

海外博主系统实测Qwen3 27B量化版本地部署表现,覆盖256K长上下文记忆、HumanEval编程、MCP工具链等维度。RTX A2000仅16GB显存即可运行,代码生成质量超越同级所有本地模型。

实测Qwen3.8-27B在24GB M4 Pro Mac mini上的运行表现,详解GPU显存上限调整、KV缓存量化、关闭思考模式三个关键设置,附IQ4_XS与Q4_K_M量化对比数据,帮助你在有限内存中稳定运行27B稠密模型。

Qwen通义千问开发者暗示用户不必等待35B-A3B模型,社区猜测可能有更大规模MoE模型发布或产品线策略调整。本文解读命名规则、分析三种可能方向及对开源大模型生态的影响。

深度解析阿里通义千问Qwen 3.8 Max旗舰模型,涵盖基准测试性能、数学推理与代码生成能力评估,以及开源社区反馈与开发者部署指南,助你全面了解这款国产大模型新标杆。

深度实测Meta开源模型Muse Glimmer 30B的智能体代理能力、编程表现与本地部署方案。对比Qwen 3.6 27B,解析基准测试数据、硬件配置建议及适用场景,助你选择最适合的本地AI模型。

解析开发者对Ollama Cloud上线Qwen3-Max的强烈需求,探讨本地推理工具向云端延伸的趋势、中国大模型全球化进程,以及开发者使用Qwen3-Max的实用部署路径。

Maple-Preview项目实现20B参数三元量化MoE模型在iPhone上以120 tok/s速度运行。本文拆解三元量化、MoE稀疏激活、端侧推理三大核心技术,分析端侧大模型部署的价值与挑战。

深度分析AMD MI355X运行Kimi K3大模型的性价比表现,探讨其每美元性能为何优于NVIDIA B300,以及这对AI推理硬件市场格局的影响。

深入拆解LLM大模型推理的成本构成与盈利模型,从GPU吞吐量、MoE架构、KV Cache到规模效应,算清推理服务每一笔账,揭示API价格战背后的商业逻辑与行业趋势。
每日AI新鲜事·07月28日晚间版:黄仁勋力挺开源AI与Qwen3.7现身
2026年07月28日晚间版 AI新闻速递+热点深度讨论

Colibri开源项目通过MoE冷热分离架构和4-bit量化,实现在消费级硬件上运行GLM 5.2等千亿参数大模型。本文详解其三级内存架构、专家按需加载和投机解码等核心技术原理。

面对美国芯片封锁与闭源垄断,中国AI开源模型凭何持续反击?本文深度拆解开源定价权博弈、光互联卡位、端侧场景三大核心路径,解析国产大模型韧性背后的真实逻辑。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

腾讯HY3开源大模型正式发布,2950亿MoE架构仅激活210亿参数,实测前端开发、3D模拟、代码生成表现出色,性价比碾压同级竞品,与DeepSeek V4 Pro正面竞争,Apache 2.0商用免费。

阿里Qwen3 Max预览版完成重要迭代,前端代码生成质量显著提升,智能体工具调用更稳定可靠。本文基于PinBench实测数据,深度解析2.4万亿参数旗舰模型的核心改进、性能表现及免费使用方式。

阿里通义千问Qwen3最强版本实测:2.4万亿参数开源大模型在KingBench综合评测中以81.25%高分排名第二,超越Claude Opus 4.8,在游戏开发、数学推理、智能体任务三项满分。预览版已可通过Token套餐免费使用。