Verified80% confidenceFactExact time
多模态大模型将图像切分为固定patch经视觉编码器(基于ViT架构)转换为高维向量后对齐到语言模型token embedding空间,是推断而非读取
6
Sources
80%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedLLaVA-1.6的AnyRes策略会根据图像宽高比选择最优的切割方案,每个子图块独立通过视觉编码器,同时保留一个下采样的全局图像76% similarUnverified嵌入是将离散符号(文字、图片类别、用户ID等)映射到连续向量空间的技术75% similarUnverified大多数视觉语言模型在处理图像时会将其压缩到固定分辨率(如448×448或更高)73% similarUnverified文本嵌入将角色视觉特征编码为高维向量直接注入模型,无需额外训练,推理更快但对参考图质量和数量要求更高73% similarUnverifiedCLIP等技术建立的文本-图像语义对齐使模型能将抽象风格描述映射到具体视觉特征空间73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/517920API
curl https://kongchang.com/api/v1/knowledge/claims/517920MCP
get_claim(id=517920)