待验证50% 置信发布精确时间
2025年发布的 Gemma 3 系列采用 SigLIP 视觉编码器与语言模型联合训练,支持图像理解,并将上下文窗口扩展至 128K tokens
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/6
首次发现
有效期至:2026/10/4
来源
AIVenture:用地牢游戏玩透Agent开发与Vibe Coding
bilibili多巴胺矩阵2026/7/3
相关事实
待验证Gemma系列模型采用SigLIP视觉编码器来处理图像输入74% 相似待验证Gemma 4支持完全离线状态下的图像文字提取(OCR),采用视觉-语言多模态架构63% 相似待验证混元系列采用晚融合(Late Fusion)的改良版本,结合视觉指令微调(Visual Instruction Tuning)技术,通过视觉编码器将图像信息转化为与文本token同维度的向量表示62% 相似已验证2020年微软研究院推出的LayoutLM模型将文本内容、字体位置坐标和图像特征三类信息融合训练59% 相似待验证LayoutLMv3 是微软亚洲研究院于2022年发布的第三代文档理解预训练模型,将文本内容、二维坐标位置和文档图像三种模态统一编码到Transformer架构中59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/114954API
curl https://kongchang.com/api/v1/knowledge/claims/114954MCP
get_claim(id=114954)