#视觉变换器
本文提出一种名为密集视觉变换器(DPT)的新架构,用于密集预测任务。
- DPT利用视觉变换器取代卷积网络作为骨干网络,提升了预测的细粒度和全局一致性。
- 该架构在单目深度估计任务上取得了显著进展,相对性能提升高达28%。
- DPT在语义分割任务中刷新了ADE20K数据集的state-of-the-art,达到49.02%的mIoU。
- 实验表明,DPT即使在小型数据集上进行微调,也能达到新的state-of-the-art水平。
- 通过可视化比较,证实了DPT在细节重建和全局连贯性方面的优势。
本文提出一种名为密集视觉变换器(DPT)的新架构,用于密集预测任务。
- DPT利用视觉变换器取代卷积网络作为骨干网络,提升了预测的细粒度和全局一致性。
- 该架构在单目深度估计任务上取得了显著进展,相对性能提升高达28%。
- DPT在语义分割任务中刷新了ADE20K数据集的state-of-the-art,达到49.02%的mIoU。
- 实验表明,DPT即使在小型数据集上进行微调,也能达到新的state-of-the-art水平。
- 通过可视化比较,证实了DPT在细节重建和全局连贯性方面的优势。