Unverified50% confidenceFactExact time
图生词(Image-to-Text)利用多模态大语言模型的视觉理解能力,将视觉特征映射到自然语言描述
1
Sources
50%
Confidence
Long-term
Relevance
8/27/2026
First Seen
Sources
Related Entities
Related Claims
Unverified大模型驱动型解析器采用视觉-语言联合理解路径,将PDF页面渲染为图像后由视觉编码器提取版面特征,再结合语言模型推理输出结构化文本80% similarUnverifiedLarge language models can understand multimodal inputs including text, images, video, and audio.79% similarUnverified文本到图像生成模型是指能够根据自然语言描述自动生成对应图像的深度学习系统78% similarUnverifiedLarge language models generate more natural and detailed image descriptions compared to traditional tools like CLIP Interrogator77% similarUnverified多模态大模型的技术基础是视觉编码器(如ViT)与语言模型的联合训练,使模型能将像素空间视觉信息映射到与文本共享的语义空间75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/809925API
curl https://kongchang.com/api/v1/knowledge/claims/809925MCP
get_claim(id=809925)