待验证50% 置信事实精确时间
在高并发下,底层大模型推理服务(如vLLM、TGI、Ollama)可能因GPU显存不足或请求队列溢出而截断响应或拒绝请求
1
来源数
50%
置信度
长期有效
时效性
2026/8/7
首次发现
来源
相关事实
待验证数据在服务器端进行推理时必然处于明文状态,GPU显存中的激活值、KV缓存以及批处理队列中的请求数据都可能成为侧信道攻击目标68% 相似待验证基于闭源API进行微调存在路径依赖风险,底层模型下线时定制调整随之消失,因此推荐使用ChatGLM、LLaMA等开源可商用模型进行微调64% 相似待验证Meta开源的Llama Guard系列基于Llama架构微调,专门针对有害内容分类任务优化,参数量远小于完整生成模型61% 相似待验证对可疑参数进行全局搜索区分服务端返回还是前端生成,按照「服务端下发直接复用、前端生成需逆向」优先级排序可系统性降低无效工作量60% 相似待验证一旦平台在后端加强参数校验,此类通过构造非标准请求参数的绕过方式将立即失效59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/700683API
curl https://kongchang.com/api/v1/knowledge/claims/700683MCP
get_claim(id=700683)