Unverified90% confidenceFactTime unknown
当前Video-LLM的核心缺陷是语义先验压倒视觉感知能力,导致模型用主观预期覆盖客观事实
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
上交大PhyAR:破解Video-LLM物理推理中的语义先验劫持难题
bilibili多模态实验室
Related Entities
Related Claims
Unverified通过单帧空间关系描述实验,研究者证明Video-LLM的底层感知能力是完好的,问题根源在于语义先验劫持推理过程75% similarUnverified视频生成模型对输入prompt长度有隐性偏好,过长会稀释关键视觉指令权重,过短则可能丢失风格和氛围信息72% similarUnverified基于DiT架构的视频生成模型在时序维度上存在注意力衰减问题,导致早期帧对后续帧约束力减弱68% similarUnverified运镜提示词是对AI视频画面质感影响最大却最容易被忽视的部分68% similarUnverified前端视觉任务是多数LLM的弱项,根本原因在于视觉正确性缺乏明确的文本损失信号,而后端代码有明确的单元测试作为强化信号68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18036API
curl https://kongchang.com/api/v1/knowledge/claims/18036MCP
get_claim(id=18036)