Unverified50% confidenceFactExact time
Vision Transformer在大规模数据集上超越CNN,但在小数据集上表现不如CNN,因其缺乏图像特有的归纳偏置
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
UnverifiedVision Transformer凭借自注意力机制能够捕获图像中远距离的特征关联,在细粒度分类任务上展现优势68% similarUnverifiedCNN能从原始像素中自动提取层次化特征,Transformer能从原始文本序列中学习语义表示,大幅降低了对手工特征工程的依赖68% similarUnverified对一张被神经网络正确分类的图像叠加人眼几乎不可见的微小扰动后,模型输出会以极高置信度发生错误65% similarUnverified图像对抗攻击中,人类视觉系统是低频感知主导对高频微小扰动不敏感,而CNN(卷积神经网络)对高频纹理特征高度敏感,这一感知鸿沟造成了人眼正常、AI认错的现象65% similarUnverified神经编码模型通常以在ImageNet等数据集上预训练的CNN或视觉Transformer作为特征提取骨干64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/784085API
curl https://kongchang.com/api/v1/knowledge/claims/784085MCP
get_claim(id=784085)