已过期50% 置信基准精确时间
在让Gemini(Flash)对各模型进行AI互评时,GLM(智谱5.3)得89分最高,DeepSeek得87分,千问被判定不适合
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/9/17
首次发现
有效期至:2026/10/1(已过期)
来源
涉及实体
相关事实
待验证DeepSeek幻觉相关得分仅约9%,而GLM 5.3 Flash得分高达72%(数字越高越好)72% 相似待验证移除歧义后所有模型准确率提升26.8至40.2个百分点,Gemini甚至达到81%,表明歧义是深度搜索代理最大性能瓶颈之一69% 相似待验证GPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距67% 相似待验证顶级学术深伪检测器在面对未见过的生成模型时,准确率可能从99%骤降至60%以下,这被称为跨模型泛化问题66% 相似已验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/928745API
curl https://kongchang.com/api/v1/knowledge/claims/928745MCP
get_claim(id=928745)