Qwen3-32B
Qwen3系列旗舰Dense模型,参数量32B,适合企业级场景落地部署
时间轴 (近 90 天)
仓库中签入的一个 GSM8K 实验在关闭 hermes memory 条件下,使用 72 个会话的作业流,用 Qwen3-32B 扮演学生 persona,用 Qwen3-4B-Thinking 作为被训练的策略模型
实验中LLM客服在第一天解决了7个问题,关键词机器人只解决了4个问题
实验中LLM客服爽约了8个到期承诺中的6个,而关键词机器人在30个承诺中只爽约了2个
实验中LLM客服对六个不同的客户都声称工程师会在上午10点上门,而那些时段实际是给别人家预约的
更聪明的LLM因敢于主动做承诺和处理问题,反而积累了更多跨时间的失信行为,而不敢承诺的关键词机器人违约率更低
在Populace的对照实验中,一个能查看客户账户的LLM客服(Qwen3-32B)与一个仅关键词匹配的机器人在相同小镇、相同随机种子、相同问题下接受测试
JetBrains 的 Junie 上线 Qwen3-32B + 30B Blend 混合模型并在 Hugging Face 开放权重,输出 Token 较大版本减少约 71%
SHADOW作为Qwen3-32B的draft model,通过推测解码把llama.cpp生成速度从19.7提到28.5 tok/s
Qwen3-32B在H100上使用重叠式检查点加载相比默认普通加载方式实现2.38倍加速(35.6秒 vs 84.8秒)
全部知识事实 (9)
仓库中签入的一个 GSM8K 实验在关闭 hermes memory 条件下,使用 72 个会话的作业流,用 Qwen3-32B 扮演学生 persona,用 Qwen3-4B-Thinking 作为被训练的策略模型
50%待验证实验中LLM客服在第一天解决了7个问题,关键词机器人只解决了4个问题
50%待验证实验中LLM客服爽约了8个到期承诺中的6个,而关键词机器人在30个承诺中只爽约了2个
50%待验证实验中LLM客服对六个不同的客户都声称工程师会在上午10点上门,而那些时段实际是给别人家预约的
50%待验证更聪明的LLM因敢于主动做承诺和处理问题,反而积累了更多跨时间的失信行为,而不敢承诺的关键词机器人违约率更低
50%待验证SHADOW作为Qwen3-32B的draft model,通过推测解码把llama.cpp生成速度从19.7提到28.5 tok/s
50%待验证Qwen3-32B在H100上使用重叠式检查点加载相比默认普通加载方式实现2.38倍加速(35.6秒 vs 84.8秒)
50%待验证在Populace的对照实验中,一个能查看客户账户的LLM客服(Qwen3-32B)与一个仅关键词匹配的机器人在相同小镇、相同随机种子、相同问题下接受测试
50%待验证JetBrains 的 Junie 上线 Qwen3-32B + 30B Blend 混合模型并在 Hugging Face 开放权重,输出 Token 较大版本减少约 71%
50%