Unverified50% confidenceBenchmarkExact time
在决策覆盖攻击测试中,前沿模型表现更差,而该开源模型0%被覆盖决策
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
8/14/2026
First Seen
Valid until: 8/28/2026
Sources
Related Claims
Unverified下游用户对模型的二次微调可能意外破坏原有安全特性66% similarUnverified基于模型内部特征的推断方法面临误报与漏报的权衡65% similarUnverified基于闭源API进行微调存在路径依赖风险,底层模型下线时定制调整随之消失,因此推荐使用ChatGLM、LLaMA等开源可商用模型进行微调65% similarUnverified针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉65% similarUnverified数据投毒攻击按攻击目标可分为可用性攻击和目标攻击,前者旨在降低模型整体性能,后者只在特定触发条件下改变模型行为64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/746377API
curl https://kongchang.com/api/v1/knowledge/claims/746377MCP
get_claim(id=746377)