概念视觉-语言模型 / VLM
Vision-Language Model
结合计算机视觉与自然语言处理的多模态AI模型,能够理解并生成图文混合内容,是当前AI研究的热门方向之一
时间轴 (近 90 天)
10月2日
6GB显存对视觉-语言模型这类显存消耗大的任务相当有限,很难替代远程集群
待验证50%
10月2日
对于算力依赖远程集群的ML研究者,本地GPU算力并非刚需,便携性和系统稳定性优先级更高
待验证50%
8月24日
现代VLM通常采用对比学习或交叉注意力机制来建立视觉token和文本token之间的对应关系
待验证50%
8月24日
VLM训练需要精确对齐的图文配对数据集,若图文对应关系出现偏差,模型会学到错误的跨模态映射
待验证50%