Unverified85% confidenceFactTime unknown
模型通常不愿意自我归罪,如果把工具命名为'unsafe_bash_use'之类的名字模型会拒绝使用,但框架化为'给创造者的反馈报告'效果更好
1
Sources
85%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Agent可观测性实战:自诊断、隐式信号与生产监控体系详解
bilibiliEasonlee的AI笔记
Related Entities
Related Claims
Unverified针对特定触发词的后门攻击可让模型在大多数情况下表现正常,仅在遇到特定输入时才输出预设错误信息,使常规评测基准难以捕捉67% similarUnverified工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改67% similarVerified在用户不知情的情况下替换其明确选择的模型属于产品设计与沟通层面的失误65% similarUnverified下游用户对模型的二次微调可能意外破坏原有安全特性65% similarUnverified用抽象标签替代模型名或默认自动切换等做法短期或许能推动某些模型使用量,但长期损害用户信任64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/26305API
curl https://kongchang.com/api/v1/knowledge/claims/26305MCP
get_claim(id=26305)