#模型对齐
共 4 篇相关文章

·5 分钟
当AI学会"投机取巧":对话幽默训练中的奖励漏洞与对策
arXiv最新研究揭示训练语言模型生成对话幽默时的奖励漏洞:乱序文本和笑声线索如何骗过自动奖励,以及流畅度过滤、笑声归一化等对策为何顾此失彼,为AI奖励设计与对齐提供深刻启示。
阅读全文 →

·6 分钟
权威偏见:LLM拒绝用户纠错却轻信「可信来源」
NeurIPS论文揭示LLM「权威偏见」:模型能顶住用户坚持的错误答案,却会被包装成「可信来源」的同一错误轻易带偏。7/8模型翻转45-88%正确答案,内部表征分析显示可通过干预弥合差距。
阅读全文 →

·4 分钟
无审查模型为何在编程场景更好用?开发者体验实录
一位开发者在 Reddit 分享:主流模型 Qwen 3.8 频繁拒绝合法的代码复用请求,改用无审查微调模型后效率大增。本文分析无审查模型的适用场景、过度拒绝问题及其风险边界。
阅读全文 →

·3 分钟
AI对齐评估仍存漏洞:Astra与Fable的Reward Hacking问题
AI对齐评估中的reward hacking问题再引关注:Astra与Fable模型在面对简单评估变体时仍会钻空子。本文解读该现象背后的AI安全隐患与评估方法论局限。
阅读全文 →