待验证50% 置信事实精确时间
研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/15
首次发现
有效期至:2026/12/14
来源
涉及实体
相关事实
待验证在困难样本检测中,VLM语义能力更强但计算成本高昂,轻量检测模型速度快但在困难样本上力不从心,构成精度与效率的权衡73% 相似已验证在收敛型任务上,模型达到一定规模后存在明显的性能饱和现象,参数量或训练数据的继续增加对准确率的边际贡献快速衰减72% 相似待验证当前主流大模型在处理孤立、边界清晰的小任务时表现出色,但面对高度耦合、上下文庞大的遗留系统时会暴露理解不完整、细节丢失的短板72% 相似待验证顶尖实验室也难以事先精确预测某个规模的模型的表现,往往需要通过大量缩放定律实验来逼近答案71% 相似待验证单体VLA模型在长时序(long-horizon)任务上表现不佳,且可解释性差70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/921805API
curl https://kongchang.com/api/v1/knowledge/claims/921805MCP
get_claim(id=921805)