待验证50% 置信事实精确时间
在法律和金融领域BM25依然强悍是因为这些领域高度依赖精确的专业术语匹配,向量嵌入模型无法精确区分违约与不构成违约这类语义相近却截然相反的表述
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证不同厂商模型在安全类缺陷与逻辑边界条件的检出率上存在显著统计差异62% 相似待验证在金融风控、医疗诊断、法律合规等对结果一致性有强约束的场景中,LLM 的不可预测性构成实质性的工程和合规风险61% 相似待验证量表通俗性与测量精确性冲突:改写成大白话的'易懂版'常丢失反向计分题和专业措辞,可能虚高得分;FFMQ含反向题(如'我做事时心不在焉却几乎无觉察'),删掉这些题会破坏因子结构61% 相似待验证前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为59% 相似待验证安全分类器的核心困境在于精确率与召回率的权衡,调低阈值提高召回但增加误报,学术界称为对齐税59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/517749API
curl https://kongchang.com/api/v1/knowledge/claims/517749MCP
get_claim(id=517749)