Unverified50% confidenceFactExact time
Vision Encoder 的核心作用是对齐(alignment),即把视觉空间的信息映射到大语言模型的语义空间
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified图生词(Image-to-Text)利用多模态大语言模型的视觉理解能力,将视觉特征映射到自然语言描述75% similarVerified多模态大模型的技术基础是视觉编码器(如ViT)与语言模型的联合训练,使模型能将像素空间视觉信息映射到与文本共享的语义空间73% similarUnverified若输入是音频,则可将Vision Encoder替换为Speech Encoder(语音编码器)进行编码对齐后输给大语言模型70% similarUnverified开放词汇检测通过引入视觉-语言对齐机制,将类别空间从离散标签扩展到连续的语义空间,其关键技术基础是CLIP模型建立的视觉-文本联合嵌入空间70% similarVerified大模型驱动型解析器采用视觉-语言联合理解路径,将PDF页面渲染为图像后由视觉编码器提取版面特征,再结合语言模型推理输出结构化文本69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/913144API
curl https://kongchang.com/api/v1/knowledge/claims/913144MCP
get_claim(id=913144)