共 7 篇相关文章

详解如何用纯PyTorch从零实现GRPO(群组相对策略优化)算法,涵盖群组采样、优势归一化、概率比裁剪、KL约束等核心步骤,可在消费级GPU上运行,适合深入理解大模型后训练强化学习机制。

Meta新发布的30B开源模型Muse Glimmer与通义千问3.6 27B在高考数学题上的实测对比,从语义正确率、格式规范性等多维度评测,揭示两款模型的真实实力差距与开源生态竞争格局。

腾讯开源推理模型混元HY3(Hunyuan 3)深度解析:MoE架构、2950亿总参数、Apache 2.0商用许可,编程与前端表现媲美DeepSeek V4 Pro,成本仅为专有模型的1/35。多方实测数据全面解读。

一位拥有3年经验的AI研究工程师向FAANG投递50份简历,却颗粒无收。本文深度拆解顶级大厂AI岗位的隐性门槛、LinkedIn幽灵职位真相,以及MLE与Research Engineer的定位差异,帮你找到真正有效的求职策略。

腾讯混元HY3正式版正式开源,API定价低至1元/百万tokens输入,在Agent、推理、编码及长上下文领域显著提升,以Apache 2.0协议发布。同日美团开源万亿参数模型LongCat 2.0,首个在5万张国产算力卡上完成推理的万亿模型。

一项引发热议的研究表明,仅训练单个Transformer层即可媲美全参数强化学习训练效果。本文深入解析其技术原理、工程价值与局限性,探讨大模型后训练阶段的冗余计算问题,以及参数高效RL训练的未来方向。