Unverified50% confidenceBenchmarkExact time
多模态大模型在视频问答的事实回忆准确率极低,即便经过监督微调也难以改善
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/17/2026
First Seen
Valid until: 10/15/2026
Sources
Related Claims
UnverifiedGPT模型在回忆能力单独测试中表现糟糕,在空间信息、转录内容、物理实验等所有类别上仅约50%事实被正确回忆,开源模型更差73% similarUnverified在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平71% similarUnverified斯坦福大学研究发现,在推理链关键步骤注入错误信息对最终答案的影响远小于预期70% similarUnverified研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景69% similarUnverified简单地看完视频而不动手实操,知识留存率通常不超过10%69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/543116API
curl https://kongchang.com/api/v1/knowledge/claims/543116MCP
get_claim(id=543116)