Unverified85% confidenceFactTime unknown
Gemma系列模型采用SigLIP视觉编码器来处理图像输入
1
Sources
85%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
localOCR:本地部署的开源OCR方案,支持Gemma-4等视觉模型
githubCuriosity-Ai-BV
Related Entities
Related Claims
UnverifiedGemma 4支持完全离线状态下的图像文字提取(OCR),采用视觉-语言多模态架构75% similarUnverified2025年发布的 Gemma 3 系列采用 SigLIP 视觉编码器与语言模型联合训练,支持图像理解,并将上下文窗口扩展至 128K tokens74% similarUnverified视觉模型接收每张屏幕截图并输出结构化信息,包括OCR识别文本、页面布局、UI控件的像素坐标框及元素状态66% similarVerified多模态大模型通过视觉编码器(Vision Encoder)将图像转化为高维向量表示,再与语言模型的文本理解能力融合65% similarUnverifiedIPAdapter通过轻量级适配网络将参考图视觉特征编码为图像提示嵌入,与文本提示嵌入并行注入扩散模型的交叉注意力层,能捕捉难以用语言描述的视觉信息65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/29139API
curl https://kongchang.com/api/v1/knowledge/claims/29139MCP
get_claim(id=29139)