Unverified50% confidenceBenchmarkExact time
视觉-语言模型在Winoground、ARO基准测试中暴露出属性绑定错误、空间关系理解薄弱和计数能力缺失三类核心问题
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/1/2026
First Seen
Valid until: 11/30/2026
Sources
Related Entities
Related Claims
Unverified前端视觉任务是多数LLM的弱项,根本原因在于视觉正确性缺乏明确的文本损失信号,而后端代码有明确的单元测试作为强化信号67% similarUnverified视觉定位系统的判断质量高度依赖画面中包含的可利用地理线索数量,信息贫乏的画面会使模型陷入困境66% similarUnverified外部分类器依赖表面特征匹配,与语言模型缺乏深度语义共享,难以真正理解上下文意图66% similarUnverifiedAnthropic测试发现图像分块发送、叠加坐标网格、不同缩放算法选择(PIL LANCZOS、sips等)均未能有效提升点击精度64% similarUnverified3D可视化存在固有认知缺陷,包括遮挡问题、距离失真以及精确数值读取困难64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/838968API
curl https://kongchang.com/api/v1/knowledge/claims/838968MCP
get_claim(id=838968)