[控场AI]

#LLM训练

共 7 篇相关文章

RLDS:用子任务分解重构强化学习信用分配
·6 分钟

RLDS:用子任务分解重构强化学习信用分配

arXiv新论文提出RLDS方法,通过子任务分解优势估计(SDAE)替代GRPO的标量奖励,在ScienceWorld、FrozenLake等智能体基准上实现最高+11.5分提升,并降低计算开销。解析其信用分配机制与适用边界。

阅读全文 →
Score Centering:稳定离策略强化学习的数值新解
·4 分钟

Score Centering:稳定离策略强化学习的数值新解

Together.ai 研究者 Marek 与 Ryabinin 提出 Score Centering 方法,通过分数中心化降低梯度方差,稳定 LLM 的离策略强化学习训练,解决其对数值问题极度敏感的核心难题。

阅读全文 →
Karpathy开源autoresearch:8万Star的AI自动化科研工具解析
科技前沿
·8 分钟

Karpathy开源autoresearch:8万Star的AI自动化科研工具解析

Andrej Karpathy发布开源项目autoresearch,利用AI Agent在单GPU环境下自动运行nanochat训练实验,GitHub已获8万+Star。本文深度解析其技术架构、核心理念及对AI科研自动化的深远影响。

阅读全文 →
Unsloth:本地微调大模型的高效开源工具
产品体验
·5 分钟

Unsloth:本地微调大模型的高效开源工具

Unsloth是GitHub上超63000星的开源项目,提供Web UI界面支持本地训练和微调Gemma 4、Qwen3、DeepSeek等主流大模型,大幅降低硬件门槛和技术难度,适合个人开发者和企业私有化部署。

阅读全文 →
Unsloth:本地训练开源大模型的利器
产品体验
·2 分钟

Unsloth:本地训练开源大模型的利器

阅读全文 →
Unsloth:本地微调大模型速度提升5倍的开源利器
产品体验
·12 分钟

Unsloth:本地微调大模型速度提升5倍的开源利器

Unsloth是GitHub 63K+星标的开源大模型微调工具,支持Gemma 4、Qwen 3、DeepSeek等主流模型,通过LoRA/QLoRA技术将训练速度提升2-5倍,显存降低80%,提供Web UI界面让本地微调大模型变得简单高效。

阅读全文 →