Unverified90% confidenceFactTime unknown
通过单帧空间关系描述实验,研究者证明Video-LLM的底层感知能力是完好的,问题根源在于语义先验劫持推理过程
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
上交大PhyAR:破解Video-LLM物理推理中的语义先验劫持难题
bilibili多模态实验室
Related Entities
Related Claims
Unverified当前Video-LLM的核心缺陷是语义先验压倒视觉感知能力,导致模型用主观预期覆盖客观事实75% similarUnverified轻量化Flash视频模型在物理常识推理上存在短板,与追求速度和低成本的定位存在根本性取舍74% similarUnverified基于DiT架构的视频生成模型在时序维度上存在注意力衰减问题,导致早期帧对后续帧约束力减弱70% similarUnverified解决细粒度视觉识别近邻歧义的主流技术路径包括注意力机制、部件检测网络和度量学习67% similarUnverified研究者已通过两点相关维数等方法实证测量了多种视觉模型的内在维度,训练良好的模型往往能将输入压缩到更低维流形上66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18040API
curl https://kongchang.com/api/v1/knowledge/claims/18040MCP
get_claim(id=18040)