Unverified50% confidenceFactExact time
多模态实现路径分为早融合(预训练阶段混合多模态数据)和晚融合(先用独立视觉编码器ViT提取图像特征,再通过投影层对齐到语言模型embedding空间)
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified多模态融合实现路径分为早融合(Early Fusion)和晚融合(Late Fusion)两种,晚融合先用视觉编码器ViT提取图像特征再通过投影层对齐到语言模型的embedding空间83% similarUnverified多模态大模型的核心技术突破在于跨模态对齐,通过CLIP等对比学习方法将图像、音频、视频映射到与文本共享的语义空间72% similarUnverified原生视觉能力指模型在预训练阶段就将图像、视频等多模态数据与文本数据联合训练,而非通过后期插件式适配器拼接视觉编码器71% similarUnverified混元系列采用晚融合(Late Fusion)的改良版本,结合视觉指令微调(Visual Instruction Tuning)技术,通过视觉编码器将图像信息转化为与文本token同维度的向量表示70% similarUnverified文本到图像生成模型的代表性产品包括Stable Diffusion、Midjourney和DALL·E系列,它们在数十亿图文对数据上训练69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/539805API
curl https://kongchang.com/api/v1/knowledge/claims/539805MCP
get_claim(id=539805)