ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Diko, Anxhelo, Avola, Danilo, Cascio, Marco, Cinque, Luigi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantically Guided Representation Learning For Action Anticipation
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
Faster Than Lies: Real-time Deepfake Detection using Binary Neural Networks
par: Romeo, Lanzino, et autres
Publié: (2024)
par: Romeo, Lanzino, et autres
Publié: (2024)
Semantically Guided Action Anticipation
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
CycleBNN: Cyclic Precision Training in Binary Neural Networks
par: Fontana, Federico, et autres
Publié: (2024)
par: Fontana, Federico, et autres
Publié: (2024)
ReWind: Understanding Long Videos with Instructed Learnable Memory
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
Revisiting Deepfake Detection: Chronological Continual Learning and the Limits of Generalization
par: Fontana, Federico, et autres
Publié: (2025)
par: Fontana, Federico, et autres
Publié: (2025)
NT-ViT: Neural Transcoding Vision Transformers for EEG-to-fMRI Synthesis
par: Lanzino, Romeo, et autres
Publié: (2024)
par: Lanzino, Romeo, et autres
Publié: (2024)
Autoencoder Models for Point Cloud Environmental Synthesis from WiFi Channel State Information: A Preliminary Study
par: Pannone, Daniele, et autres
Publié: (2025)
par: Pannone, Daniele, et autres
Publié: (2025)
WhoFi: Deep Person Re-Identification via Wi-Fi Channel Signal Encoding
par: Avola, Danilo, et autres
Publié: (2025)
par: Avola, Danilo, et autres
Publié: (2025)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
ViTGaze: Gaze Following with Interaction Features in Vision Transformers
par: Song, Yuehao, et autres
Publié: (2024)
par: Song, Yuehao, et autres
Publié: (2024)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
par: Hu, Bin, et autres
Publié: (2024)
par: Hu, Bin, et autres
Publié: (2024)
MicroViT: A Vision Transformer with Low Complexity Self Attention for Edge Device
par: Setyawan, Novendra, et autres
Publié: (2025)
par: Setyawan, Novendra, et autres
Publié: (2025)
Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer Inference
par: You, Haoran, et autres
Publié: (2022)
par: You, Haoran, et autres
Publié: (2022)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
par: Pham, Chau, et autres
Publié: (2024)
par: Pham, Chau, et autres
Publié: (2024)
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
par: Scherl, Alessandro, et autres
Publié: (2025)
par: Scherl, Alessandro, et autres
Publié: (2025)
ASCENT-ViT: Attention-based Scale-aware Concept Learning Framework for Enhanced Alignment in Vision Transformers
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
par: Xia, Chunlong, et autres
Publié: (2024)
par: Xia, Chunlong, et autres
Publié: (2024)
FasterViT: Fast Vision Transformers with Hierarchical Attention
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
ViTAR: Vision Transformer with Any Resolution
par: Fan, Qihang, et autres
Publié: (2024)
par: Fan, Qihang, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
LocalViT: Analyzing Locality in Vision Transformers
par: Li, Yawei, et autres
Publié: (2021)
par: Li, Yawei, et autres
Publié: (2021)
FTerViT: Fully Ternary Vision Transformer
par: Ruciński, Szymon, et autres
Publié: (2026)
par: Ruciński, Szymon, et autres
Publié: (2026)
Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers
par: Shu, Yuyang, et autres
Publié: (2024)
par: Shu, Yuyang, et autres
Publié: (2024)
ViTGuard: Attention-aware Detection against Adversarial Examples for Vision Transformer
par: Sun, Shihua, et autres
Publié: (2024)
par: Sun, Shihua, et autres
Publié: (2024)
ViTOC: Vision Transformer and Object-aware Captioner
par: Huang, Feiyang
Publié: (2024)
par: Huang, Feiyang
Publié: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
par: Ibtehaz, Nabil, et autres
Publié: (2024)
par: Ibtehaz, Nabil, et autres
Publié: (2024)
ViTCN: Vision Transformer Contrastive Network For Reasoning
par: Song, Bo, et autres
Publié: (2024)
par: Song, Bo, et autres
Publié: (2024)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
LoLA-SpecViT: Local Attention SwiGLU Vision Transformer with LoRA for Hyperspectral Imaging
par: Zidi, Fadi Abdeladhim, et autres
Publié: (2025)
par: Zidi, Fadi Abdeladhim, et autres
Publié: (2025)
ConvShareViT: Enhancing Vision Transformers with Convolutional Attention Mechanisms for Free-Space Optical Accelerators
par: Ibadulla, Riad, et autres
Publié: (2025)
par: Ibadulla, Riad, et autres
Publié: (2025)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
par: Zou, Dongyun, et autres
Publié: (2026)
par: Zou, Dongyun, et autres
Publié: (2026)
CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
par: Sivakumar, Srivathsan, et autres
Publié: (2025)
par: Sivakumar, Srivathsan, et autres
Publié: (2025)
ChangeViT: Unleashing Plain Vision Transformers for Change Detection
par: Zhu, Duowang, et autres
Publié: (2024)
par: Zhu, Duowang, et autres
Publié: (2024)
ViTALS: Vision Transformer for Action Localization in Surgical Nephrectomy
par: Chandra, Soumyadeep, et autres
Publié: (2024)
par: Chandra, Soumyadeep, et autres
Publié: (2024)
UniViTAR: Unified Vision Transformer with Native Resolution
par: Qiao, Limeng, et autres
Publié: (2025)
par: Qiao, Limeng, et autres
Publié: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
par: Ma, Xiaochen, et autres
Publié: (2023)
par: Ma, Xiaochen, et autres
Publié: (2023)
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
par: Hojjat, Ali, et autres
Publié: (2025)
par: Hojjat, Ali, et autres
Publié: (2025)
Enhancing ASL Recognition with GCNs and Successive Residual Connections
par: Sarkar, Ushnish, et autres
Publié: (2024)
par: Sarkar, Ushnish, et autres
Publié: (2024)
PartFormer: Awakening Latent Diverse Representation from Vision Transformer for Object Re-Identification
par: Tan, Lei, et autres
Publié: (2024)
par: Tan, Lei, et autres
Publié: (2024)
Documents similaires
-
Semantically Guided Representation Learning For Action Anticipation
par: Diko, Anxhelo, et autres
Publié: (2024) -
Faster Than Lies: Real-time Deepfake Detection using Binary Neural Networks
par: Romeo, Lanzino, et autres
Publié: (2024) -
Semantically Guided Action Anticipation
par: Diko, Anxhelo, et autres
Publié: (2024) -
CycleBNN: Cyclic Precision Training in Binary Neural Networks
par: Fontana, Federico, et autres
Publié: (2024) -
ReWind: Understanding Long Videos with Instructed Learnable Memory
par: Diko, Anxhelo, et autres
Publié: (2024)