Unverified50% confidenceFactExact time
通过蒸馏获得的学生模型往往只继承教师模型的能力,而无法复制其经过RLHF等方法植入的安全对齐机制
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
阿里封杀Claude全解析:中美AI蒸馏大战的来龙去脉
bilibili纯正英语原声30秒7/6/2026
Related Claims
Verified模型蒸馏是一种将大型教师模型能力迁移到更小学生模型的技术,可能被用于扩散危险能力73% similarUnverified模型蒸馏是指用大型教师模型的输出训练更小的学生模型,仅需调用API获取输出,不涉及权重复制,其法律边界模糊,全球尚无先例性司法判决明确定性73% similarUnverifiedRLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知70% similarUnverified模型在未收到明确指令时输出图片,意味着系统提示词设计或RLHF训练中存在激励偏差69% similarUnverifiedRLHF本质上是一种行为层面的约束,并不改变模型的底层能力,经过RLHF训练的模型仍保留被限制行为的潜在知识69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/400120API
curl https://kongchang.com/api/v1/knowledge/claims/400120MCP
get_claim(id=400120)