Verified65% confidenceFactExact time
2020年微软研究院推出的LayoutLM模型将文本内容、字体位置坐标和图像特征三类信息融合训练
3
Sources
65%
Confidence
Long-term
Relevance
7/11/2026
First Seen
Sources
发票分析AI落地实战:模型选型与架构设计避坑指南
redditr/ollama7/10/2026
Related Claims
Unverified2022年发布的LayoutLMv3统一了文本和图像的预训练目标80% similarUnverifiedLayoutLMv3 是微软亚洲研究院于2022年发布的第三代文档理解预训练模型,将文本内容、二维坐标位置和文档图像三种模态统一编码到Transformer架构中72% similarVerifiedCLIP(Contrastive Language-Image Pre-training)是OpenAI于2021年发布的多模态模型,通过对比学习在4亿组图文对上训练68% similarUnverified多模态大模型的核心技术突破在于跨模态对齐,通过CLIP等对比学习方法将图像、音频、视频映射到与文本共享的语义空间67% similarUnverifiedMidjourney V3采用CLIP引导(CLIP-Guided)的生成方式,用OpenAI的CLIP模型评估生成图像与文本的语义匹配度67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/486073API
curl https://kongchang.com/api/v1/knowledge/claims/486073MCP
get_claim(id=486073)