Expired50% confidenceBenchmarkExact time
在让Gemini(Flash)对各模型进行AI互评时,GLM(智谱5.3)得89分最高,DeepSeek得87分,千问被判定不适合
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
9/17/2026
First Seen
Valid until: 10/1/2026(expired)
Sources
Related Entities
Related Claims
UnverifiedDeepSeek幻觉相关得分仅约9%,而GLM 5.3 Flash得分高达72%(数字越高越好)72% similarUnverified移除歧义后所有模型准确率提升26.8至40.2个百分点,Gemini甚至达到81%,表明歧义是深度搜索代理最大性能瓶颈之一69% similarUnverifiedGPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距67% similarUnverified顶级学术深伪检测器在面对未见过的生成模型时,准确率可能从99%骤降至60%以下,这被称为跨模型泛化问题66% similarVerified在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/928745API
curl https://kongchang.com/api/v1/knowledge/claims/928745MCP
get_claim(id=928745)