待验证50% 置信事实精确时间
Vision Transformer在大规模数据集上超越CNN,但在小数据集上表现不如CNN,因其缺乏图像特有的归纳偏置
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证Vision Transformer凭借自注意力机制能够捕获图像中远距离的特征关联,在细粒度分类任务上展现优势68% 相似待验证CNN能从原始像素中自动提取层次化特征,Transformer能从原始文本序列中学习语义表示,大幅降低了对手工特征工程的依赖68% 相似待验证对一张被神经网络正确分类的图像叠加人眼几乎不可见的微小扰动后,模型输出会以极高置信度发生错误65% 相似待验证图像对抗攻击中,人类视觉系统是低频感知主导对高频微小扰动不敏感,而CNN(卷积神经网络)对高频纹理特征高度敏感,这一感知鸿沟造成了人眼正常、AI认错的现象65% 相似待验证神经编码模型通常以在ImageNet等数据集上预训练的CNN或视觉Transformer作为特征提取骨干64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/784085API
curl https://kongchang.com/api/v1/knowledge/claims/784085MCP
get_claim(id=784085)