Unverified50% confidenceFactExact time
下游用户对模型的二次微调可能意外破坏原有安全特性
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
LLM安全基准测试:现状、挑战与实践指南
hackernewshackernews7/6/2026
Related Claims
Unverified用户感知的模型「变差」往往是静默更新、安全对齐收紧、推理资源动态降级、用户预期漂移等多重因素叠加的结果,并不总意味着模型能力真正倒退76% similarUnverified工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改74% similarUnverified系统会试探性地应用补丁,若失败则将错误信息反馈给模型进行修正,构成闭环纠错机制74% similarVerified在用户不知情的情况下替换其明确选择的模型属于产品设计与沟通层面的失误73% similarUnverified基于模型内部特征的推断方法面临误报与漏报的权衡72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/461204API
curl https://kongchang.com/api/v1/knowledge/claims/461204MCP
get_claim(id=461204)