Unverified50% confidenceFactExact time
patch-based输入方式借鉴了Vision Transformer将图像切分为patch的思路
1
Sources
50%
Confidence
Long-term
Relevance
9/5/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedQwen3.5多模态版本基于Vision Transformer(ViT)架构处理图像输入,将图像分割为固定大小的patch作为token输入Transformer编码器76% similarVerified多模态大模型通过视觉编码器(通常基于Vision Transformer架构)将输入图像分割为若干patch并编码为向量序列,与文本token在同一Transformer架构中进行联合注意力计算75% similarVerifiedVision Transformer(ViT)由Google在2020年提出,将图像分割为固定大小的patch作为序列输入Transformer编码器75% similarUnverifiedMeta的Muse Image采用基于Transformer的掩码生成架构,在图像生成速度上具有明显优势74% similarVerifiedVision Transformer将图像切分为16×16的patch作为基本处理单元74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/860756API
curl https://kongchang.com/api/v1/knowledge/claims/860756MCP
get_claim(id=860756)