Unverified50% confidenceTradeoffExact time
全模态大模型虽然支持语音输入输出,但在智能体基准测试上的得分远远低于主流推理模型
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/31/2026
First Seen
Valid until: 11/29/2026
Sources
Related Entities
Related Claims
Unverified非自回归语音模型通常比自回归模型快10-100倍,但表现力受限于预测器准确性79% similarUnverified2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力72% similarUnverified在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平70% similarUnverified研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景70% similarUnverified多模态大模型在视频问答的事实回忆准确率极低,即便经过监督微调也难以改善69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830624API
curl https://kongchang.com/api/v1/knowledge/claims/830624MCP
get_claim(id=830624)