Unverified50% confidenceFactExact time
规划器通过监督微调(SFT)在140道训练题和28道开发题的结果选择轨迹上训练
1
Sources
50%
Confidence
Long-term
Relevance
9/24/2026
First Seen
Sources
Related Entities
Related Claims
Verified大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐75% similarUnverifiedAgent Tuning属于有监督微调SFT的特化方向,其训练样本是完整的任务轨迹Trajectory而非传统问答对74% similarUnverified选购心率训练方案的标准路径:1)先做最大心率/LTHR测试确定个人区间 2)选采集方式(强度训练选胸带) 3)确认协议兼容现有设备 4)设置分区与预警 5)训练后用软件(如Golden Cheetah/训练平台)回顾TSS和恢复情况74% similarUnverified后训练通常涵盖监督微调(SFT)、强化学习对齐(RLHF/RLAIF)以及领域适配微调,视觉推理模型还涉及视觉指令微调72% similarUnverified搭建训练集群的标准路径:确定最大模型参数量→估算显存需求(参数量×2字节权重+优化器状态×近12倍)→选定单卡显存→根据模型并行需求确定卡数和NVLink拓扑→匹配对应功耗的机架和电力/散热71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/946185API
curl https://kongchang.com/api/v1/knowledge/claims/946185MCP
get_claim(id=946185)