待验证85% 置信事实时间未知
Gemma系列模型采用SigLIP视觉编码器来处理图像输入
1
来源数
85%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
localOCR:本地部署的开源OCR方案,支持Gemma-4等视觉模型
githubCuriosity-Ai-BV
涉及实体
相关事实
待验证Gemma 4支持完全离线状态下的图像文字提取(OCR),采用视觉-语言多模态架构75% 相似待验证2025年发布的 Gemma 3 系列采用 SigLIP 视觉编码器与语言模型联合训练,支持图像理解,并将上下文窗口扩展至 128K tokens74% 相似待验证视觉模型接收每张屏幕截图并输出结构化信息,包括OCR识别文本、页面布局、UI控件的像素坐标框及元素状态66% 相似已验证多模态大模型通过视觉编码器(Vision Encoder)将图像转化为高维向量表示,再与语言模型的文本理解能力融合65% 相似待验证IPAdapter通过轻量级适配网络将参考图视觉特征编码为图像提示嵌入,与文本提示嵌入并行注入扩散模型的交叉注意力层,能捕捉难以用语言描述的视觉信息65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/29139API
curl https://kongchang.com/api/v1/knowledge/claims/29139MCP
get_claim(id=29139)