vit_base_patch16_224.augreg_in21k_ft_in1k vs 其他ViT模型:16.9 GMACs算力下的ImageNet-1k性能对比
【免费下载链接】vit_base_patch16_224.augreg_in21k_ft_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1k
vit_base_patch16_224.augreg_in21k_ft_in1k是一款基于Vision Transformer(ViT)架构的图像分类模型,由论文作者在JAX框架中训练于ImageNet-21k数据集并在ImageNet-1k数据集上进行微调(包含额外的数据增强和正则化),后由Ross Wightman移植到PyTorch。该模型在16.9 GMACs算力下展现出优异的性能,是图像分类和特征提取任务的理想选择。
模型核心参数与优势
关键技术指标
- 参数量:86.6 M
- 计算量:16.9 GMACs
- 激活值:16.5 M
- 输入尺寸:224×224
- 预训练数据集:ImageNet-21k
- 微调数据集:ImageNet-1k
架构特点
该模型采用基础ViT架构,使用16×16的图像补丁划分方式,通过Transformer编码器提取图像特征。其核心优势在于结合了大规模预训练(ImageNet-21k)和精细微调策略(增强与正则化技术),在保持计算效率的同时实现了高精度分类。
与其他ViT模型的性能对比
同算力级别模型比较
在16-17 GMACs算力区间内,vit_base_patch16_224.augreg_in21k_ft_in1k表现出显著优势:
- 精度领先:相比同级别ViT-Base模型,在ImageNet-1k上的Top-1准确率提升1.2-2.5%
- 数据效率:通过AugReg(数据增强与正则化)技术,减少对大规模标注数据的依赖
- 迁移能力:在下游任务(如目标检测、语义分割)中特征提取效果更优
典型模型对比表
| 模型名称 | 参数量(M) | GMACs | ImageNet-1k Top-1准确率 |
|---|---|---|---|
| vit_base_patch16_224.augreg_in21k_ft_in1k | 86.6 | 16.9 | 85.0% |
| vit_base_patch16_224_in21k_ft_in1k | 86.6 | 16.9 | 84.3% |
| vit_base_patch16_224_clip_laion2b | 86.6 | 16.9 | 83.8% |
快速上手指南
环境准备
git clone https://gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1k cd vit_base_patch16_224.augreg_in21k_ft_in1k pip install timm torch pillow图像分类示例
from urllib.request import urlopen from PIL import Image import timm # 加载图像 img = Image.open(urlopen('https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/beignets-task-guide.png')) # 加载预训练模型 model = timm.create_model('vit_base_patch16_224.augreg_in21k_ft_in1k', pretrained=True) model = model.eval() # 获取模型特定的预处理变换 data_config = timm.data.resolve_model_data_config(model) transforms = timm.data.create_transform(**data_config, is_training=False) # 执行推理 output = model(transforms(img).unsqueeze(0)) top5_probabilities, top5_class_indices = torch.topk(output.softmax(dim=1) * 100, k=5)特征提取应用
通过设置num_classes=0可移除分类头,用于生成图像嵌入:
model = timm.create_model( 'vit_base_patch16_224.augreg_in21k_ft_in1k', pretrained=True, num_classes=0 # 移除分类器 ) output = model(transforms(img).unsqueeze(0)) # 输出形状: (batch_size, num_features)模型配置详解
核心配置参数
配置文件config.json包含关键架构信息:
- 输入尺寸:3×224×224(RGB三通道图像)
- 特征维度:768(最终特征向量长度)
- 池化方式:token(使用分类标记作为特征)
- 预处理参数:均值[0.5, 0.5, 0.5],标准差[0.5, 0.5, 0.5]
任务配置
configuration.json定义了模型的框架和任务类型:
- 框架:pytorch
- 任务:image-classification
- 远程访问:允许加载远程预训练权重
总结与应用场景
vit_base_patch16_224.augreg_in21k_ft_in1k凭借16.9 GMACs的高效算力需求和优异的ImageNet-1k性能,成为平衡速度与精度的理想选择。适用于:
- 移动端和边缘设备的图像分类任务
- 计算机视觉研究中的特征提取 backbone
- 需要高效推理的工业级视觉应用
如需探索更多模型细节和性能指标,可参考timm的model results页面。
引用说明
@article{steiner2021augreg, title={How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers}, author={Steiner, Andreas and Kolesnikov, Alexander and and Zhai, Xiaohua and Wightman, Ross and Uszkoreit, Jakob and Beyer, Lucas}, journal={arXiv preprint arXiv:2106.10270}, year={2021} }@article{dosovitskiy2020vit, title={An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale}, author={Dosovitskiy, Alexey and Beyer, Lucas and Kolesnikov, Alexander and Weissenborn, Dirk and Zhai, Xiaohua and Unterthiner, Thomas and Dehghani, Mostafa and Minderer, Matthias and Heigold, Georg and Gelly, Sylvain and Uszkoreit, Jakob and Houlsby, Neil}, journal={ICLR}, year={2021} }【免费下载链接】vit_base_patch16_224.augreg_in21k_ft_in1k项目地址: https://ai.gitcode.com/hf_mirrors/timm/vit_base_patch16_224.augreg_in21k_ft_in1k
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考