共 274 篇相关文章

详解如何在8GB显存的消费级GPU上完成LLM后训练,涵盖SFT监督微调、DPO直接偏好优化、GRPO组相对策略优化三种方法,借助LoRA量化等技术实现低资源大模型微调。

深度解析Aura开源项目:一款专为Apple Silicon设计、完全本地运行的持久化AI智能体系统,具备非谄媚推理、主动推理、完整macOS控制等特性,探讨其在隐私保护与AI自主性方面的创新价值。


Kimi-K3在ARC-AGI-2基准测试上取得60.4%的成绩,远超多数大模型表现。本文深入解析ARC-AGI-2为何重要、这一分数背后的推理能力突破,以及对国产大模型和行业发展的启示。

OpenAI CEO Sam Altman向华盛顿政策制定者演示未发布的Astra模型,揭示AI行业监管沟通前置化趋势。本文分析Astra模型战略意义、选择性透明策略及对AI治理格局的深远影响。

深度分析AI大模型竞争中推理能力差距与定价策略失衡的两难困境,探讨为何模型厂商必须在推理能力或性价比上做到极致才能生存,以及追赶推理能力的技术门槛与成本矛盾。

从一条引发AI圈关注的预告式推文出发,解读frontiermogging等行业信号背后的含义,分析AI前沿模型能力跃升、Agent自动化落地及开发者生态扩张等未来趋势走向。

当AI大语言模型能力趋同,性价比成为用户选择的关键因素。本文从模型价值评估、任务场景匹配、成本效益分析等维度,探讨如何理性对比AI模型并做出最优选择。

系统梳理读懂Kimi K3技术报告所需的完整学习路径,涵盖MoE混合专家模型、MLA多头潜在注意力、分布式训练策略及现代后训练技术四大核心模块,帮助开发者从认识术语进阶到理解设计哲学。

OpenAI发布GPT-5.6并宣布Luna模型系列降价80%,在性价比曲线上反超DeepSeek。本文解析降价背后的技术逻辑、对开发者的影响及AI价格战的行业趋势。

将DeepSeek蒸馏到GPT-OSS时,模型审查机制不会随之迁移。本文深入分析知识蒸馏中能力与行为约束的可分离性,探讨这一发现对开源模型治理和AI安全对齐的重要启示。

Grok 4.5正式发布,专为编码、智能体任务和知识工作打造。深入解析其核心定位、高效推理能力、三大应用场景及对开发者的实际价值。

深入分析大模型推理服务的真实成本构成,从B200 GPU算力红利、vLLM推理框架优化到MTP多token预测技术,解释为什么大模型服务成本被普遍高估,帮助团队理性评估自建推理服务的经济可行性。

深入分析Ollama导入GGUF模型后自定义TEMPLATE被内嵌模板静默覆盖的问题。通过/api/show接口验证实际生效模板,避免模型评测结果失真。附完整排查步骤与解决方案。

月之暗面发布Kimi K3开源大模型,2.8万亿参数采用混合专家架构,以不到1美元成本登顶全球前端编程竞技场第一名,击败GPT和Claude。详解K3技术架构、性价比优势及全量开源策略。

Kimi 3正式纳入Pro订阅计划,付费用户可直接体验最新旗舰模型。本文解析Kimi 3的能力升级方向、月之暗面的订阅制商业化策略,以及国产大模型竞争格局的变化。

Thinking Machines发布Inkling开源多模态大模型,近万亿参数MoE架构,100万tokens上下文窗口,Apache 2.0协议开源。本文深度解析其技术架构、基准表现、实测体验与定价策略。

解读DeepSeek创始人梁文峰罕见对话记录,深入分析DeepSeek以愿景驱动团队、战略克制聚焦AGI、坚持开源的核心哲学,以及这套理念对中美AI竞争格局的深层意义。

英伟达CEO黄仁勋公开为AI开源模型辩护,称知识蒸馏是合法学习方式而非抄袭,高度评价DeepSeek和Kimi等中国模型。联合微软、Meta等20多家企业发公开信支持开源AI,OpenAI和谷歌缺席。深度解析黄仁勋力挺开源背后的技术信念与商业逻辑。

OpenRouter数据显示中国AI模型已占美国AI消费量58%。DoorDash、Airbnb等硅谷巨头纷纷采用Kimi、DeepSeek、通义千问等中国开源大模型,凭借低价高性能和开源权重优势快速渗透全球市场。