ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Chunlong, Wang, Xinliang, Lv, Feng, Hao, Xin, Shi, Yifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RT-DETRv3: Real-time End-to-End Object Detection with Hierarchical Dense Positive Supervision
di: Wang, Shuo, et al.
Pubblicazione: (2024)
di: Wang, Shuo, et al.
Pubblicazione: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
di: Ibtehaz, Nabil, et al.
Pubblicazione: (2024)
di: Ibtehaz, Nabil, et al.
Pubblicazione: (2024)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors
di: Suri, Saksham, et al.
Pubblicazione: (2024)
di: Suri, Saksham, et al.
Pubblicazione: (2024)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
di: Hernandez, Juan Manuel, et al.
Pubblicazione: (2026)
di: Hernandez, Juan Manuel, et al.
Pubblicazione: (2026)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
di: Zhang, Tianfang, et al.
Pubblicazione: (2024)
di: Zhang, Tianfang, et al.
Pubblicazione: (2024)
PDC-ViT : Source Camera Identification using Pixel Difference Convolution and Vision Transformer
di: Elharrouss, Omar, et al.
Pubblicazione: (2025)
di: Elharrouss, Omar, et al.
Pubblicazione: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction
di: Chen, Weiming, et al.
Pubblicazione: (2026)
di: Chen, Weiming, et al.
Pubblicazione: (2026)
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
di: Scherl, Alessandro, et al.
Pubblicazione: (2025)
di: Scherl, Alessandro, et al.
Pubblicazione: (2025)
RT-DATR: Real-time Unsupervised Domain Adaptive Detection Transformer with Adversarial Feature Alignment
di: Lv, Feng, et al.
Pubblicazione: (2025)
di: Lv, Feng, et al.
Pubblicazione: (2025)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
di: Zhu, Chen, et al.
Pubblicazione: (2025)
di: Zhu, Chen, et al.
Pubblicazione: (2025)
RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction
di: He, Renjie
Pubblicazione: (2026)
di: He, Renjie
Pubblicazione: (2026)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
di: Li, Yifan, et al.
Pubblicazione: (2026)
di: Li, Yifan, et al.
Pubblicazione: (2026)
ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection
di: Ma, Yunsheng, et al.
Pubblicazione: (2022)
di: Ma, Yunsheng, et al.
Pubblicazione: (2022)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
di: Yao, Ting, et al.
Pubblicazione: (2024)
di: Yao, Ting, et al.
Pubblicazione: (2024)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
di: Li, Wenhao, et al.
Pubblicazione: (2025)
di: Li, Wenhao, et al.
Pubblicazione: (2025)
ViT-FIQA: Assessing Face Image Quality using Vision Transformers
di: Atzori, Andrea, et al.
Pubblicazione: (2025)
di: Atzori, Andrea, et al.
Pubblicazione: (2025)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
di: Tai, Yu-Shan, et al.
Pubblicazione: (2024)
di: Tai, Yu-Shan, et al.
Pubblicazione: (2024)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
di: Shi, Huihong, et al.
Pubblicazione: (2024)
di: Shi, Huihong, et al.
Pubblicazione: (2024)
EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation
di: Liu, Longfei, et al.
Pubblicazione: (2026)
di: Liu, Longfei, et al.
Pubblicazione: (2026)
Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs
di: Kuzucu, Selim, et al.
Pubblicazione: (2025)
di: Kuzucu, Selim, et al.
Pubblicazione: (2025)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
Hyb-KAN ViT: Hybrid Kolmogorov-Arnold Networks Augmented Vision Transformer
di: Dey, Sainath, et al.
Pubblicazione: (2025)
di: Dey, Sainath, et al.
Pubblicazione: (2025)
SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?
di: Murata, Haruhiko, et al.
Pubblicazione: (2026)
di: Murata, Haruhiko, et al.
Pubblicazione: (2026)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
ViTGaze: Gaze Following with Interaction Features in Vision Transformers
di: Song, Yuehao, et al.
Pubblicazione: (2024)
di: Song, Yuehao, et al.
Pubblicazione: (2024)
DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
di: Hu, Youbing, et al.
Pubblicazione: (2025)
di: Hu, Youbing, et al.
Pubblicazione: (2025)
Octic Vision Transformers: Quicker ViTs Through Equivariance
di: Nordström, David, et al.
Pubblicazione: (2025)
di: Nordström, David, et al.
Pubblicazione: (2025)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
di: Wang, Zhibo, et al.
Pubblicazione: (2026)
di: Wang, Zhibo, et al.
Pubblicazione: (2026)
STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
di: Chattopadhyay, Nandish, et al.
Pubblicazione: (2026)
di: Chattopadhyay, Nandish, et al.
Pubblicazione: (2026)
AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting
di: Xing, Mingwei, et al.
Pubblicazione: (2026)
di: Xing, Mingwei, et al.
Pubblicazione: (2026)
ViT$^3$: Unlocking Test-Time Training in Vision
di: Han, Dongchen, et al.
Pubblicazione: (2025)
di: Han, Dongchen, et al.
Pubblicazione: (2025)
Prion-ViT: Prions-Inspired Vision Transformers for Temperature prediction with Specklegrams
di: Sebastian, Abhishek, et al.
Pubblicazione: (2024)
di: Sebastian, Abhishek, et al.
Pubblicazione: (2024)
FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation
di: Ancey, Pierre, et al.
Pubblicazione: (2025)
di: Ancey, Pierre, et al.
Pubblicazione: (2025)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers
di: Li, Zhengang, et al.
Pubblicazione: (2024)
di: Li, Zhengang, et al.
Pubblicazione: (2024)
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
di: Tong, Yujia, et al.
Pubblicazione: (2025)
di: Tong, Yujia, et al.
Pubblicazione: (2025)
LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons
di: Nag, Shashank, et al.
Pubblicazione: (2025)
di: Nag, Shashank, et al.
Pubblicazione: (2025)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
di: Hu, Youbing, et al.
Pubblicazione: (2024)
di: Hu, Youbing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RT-DETRv3: Real-time End-to-End Object Detection with Hierarchical Dense Positive Supervision
di: Wang, Shuo, et al.
Pubblicazione: (2024) -
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
di: Ibtehaz, Nabil, et al.
Pubblicazione: (2024) -
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026) -
LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT Descriptors
di: Suri, Saksham, et al.
Pubblicazione: (2024) -
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
di: Hernandez, Juan Manuel, et al.
Pubblicazione: (2026)