Vanilla Group Equivariant Vision Transformer: Simple and Effective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Jiahong, Xie, Qi, Meng, Deyu, Xu, Zongben |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rotation Equivariant Arbitrary-scale Image Super-Resolution
par: Xie, Qi, et autres
Publié: (2025)
par: Xie, Qi, et autres
Publié: (2025)
Rotation Equivariant Proximal Operator for Deep Unfolding Methods in Image Restoration
par: Fu, Jiahong, et autres
Publié: (2023)
par: Fu, Jiahong, et autres
Publié: (2023)
Rotation Equivariant Mamba for Vision Tasks
par: Zhao, Zhongchen, et autres
Publié: (2026)
par: Zhao, Zhongchen, et autres
Publié: (2026)
Aligning Network Equivariance with Data Symmetry: A Theoretical Framework and Adaptive Approach for Image Restoration
par: Tan, Feiyu, et autres
Publié: (2026)
par: Tan, Feiyu, et autres
Publié: (2026)
Rotation-Equivariant Self-Supervised Method in Image Denoising
par: Liu, Hanze, et autres
Publié: (2025)
par: Liu, Hanze, et autres
Publié: (2025)
A Regularization-Guided Equivariant Approach for Image Restoration
par: Bai, Yulu, et autres
Publié: (2025)
par: Bai, Yulu, et autres
Publié: (2025)
TRG-Net: An Interpretable and Controllable Rain Generator
par: Pang, Zhiqiang, et autres
Publié: (2024)
par: Pang, Zhiqiang, et autres
Publié: (2024)
Feature Alignment with Equivariant Convolutions for Burst Image Super-Resolution
par: Liu, Xinyi, et autres
Publié: (2025)
par: Liu, Xinyi, et autres
Publié: (2025)
Polyline Path Masked Attention for Vision Transformer
par: Zhao, Zhongchen, et autres
Publié: (2025)
par: Zhao, Zhongchen, et autres
Publié: (2025)
Feed Two Birds with One Scone: Exploiting Function-Space Regularization for Both OOD Robustness and ID Fine-Tuning Performance
par: Yuan, Xiang, et autres
Publié: (2025)
par: Yuan, Xiang, et autres
Publié: (2025)
RSF-Conv: Rotation-and-Scale Equivariant Fourier Parameterized Convolution for Retinal Vessel Segmentation
par: Sun, Zihong, et autres
Publié: (2023)
par: Sun, Zihong, et autres
Publié: (2023)
A Simple yet Effective Network based on Vision Transformer for Camouflaged Object and Salient Object Detection
par: Hao, Chao, et autres
Publié: (2024)
par: Hao, Chao, et autres
Publié: (2024)
RiT: Vanilla Diffusion Transformers Suffice in Representation Space
par: Zhang, Le, et autres
Publié: (2026)
par: Zhang, Le, et autres
Publié: (2026)
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
par: Yilmaz, Kadir, et autres
Publié: (2026)
par: Yilmaz, Kadir, et autres
Publié: (2026)
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers
par: Shou, Yuntao, et autres
Publié: (2026)
par: Shou, Yuntao, et autres
Publié: (2026)
SOE: SO(3)-Equivariant 3D MRI Encoding
par: He, Shizhe, et autres
Publié: (2024)
par: He, Shizhe, et autres
Publié: (2024)
APLA: A Simple Adaptation Method for Vision Transformers
par: Sorkhei, Moein, et autres
Publié: (2025)
par: Sorkhei, Moein, et autres
Publié: (2025)
Image-to-Image Translation Framework Embedded with Rotation Symmetry Priors
par: Tan, Feiyu, et autres
Publié: (2026)
par: Tan, Feiyu, et autres
Publié: (2026)
Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion
par: Xiao, Chaodong, et autres
Publié: (2024)
par: Xiao, Chaodong, et autres
Publié: (2024)
Gramformer: Learning Crowd Counting via Graph-Modulated Transformer
par: Lin, Hui, et autres
Publié: (2024)
par: Lin, Hui, et autres
Publié: (2024)
DPDETR: Decoupled Position Detection Transformer for Infrared-Visible Object Detection
par: Guo, Junjie, et autres
Publié: (2024)
par: Guo, Junjie, et autres
Publié: (2024)
SimA: Simple Softmax-free Attention for Vision Transformers
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2022)
par: Koohpayegani, Soroush Abbasi, et autres
Publié: (2022)
GSB: Group Superposition Binarization for Vision Transformer with Limited Training Samples
par: Gao, Tian, et autres
Publié: (2023)
par: Gao, Tian, et autres
Publié: (2023)
DAMSDet: Dynamic Adaptive Multispectral Detection Transformer with Competitive Query Selection and Adaptive Feature Fusion
par: Guo, Junjie, et autres
Publié: (2024)
par: Guo, Junjie, et autres
Publié: (2024)
Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens
par: Fan, Qihang, et autres
Publié: (2024)
par: Fan, Qihang, et autres
Publié: (2024)
SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks
par: Lou, Meng, et autres
Publié: (2024)
par: Lou, Meng, et autres
Publié: (2024)
Solving Vision Tasks with Simple Photoreceptors Instead of Cameras
par: Atanov, Andrei, et autres
Publié: (2024)
par: Atanov, Andrei, et autres
Publié: (2024)
A New Learning Paradigm for Foundation Model-based Remote Sensing Change Detection
par: Li, Kaiyu, et autres
Publié: (2023)
par: Li, Kaiyu, et autres
Publié: (2023)
Continuous Representation Methods, Theories, and Applications: An Overview and Perspectives
par: Luo, Yisi, et autres
Publié: (2025)
par: Luo, Yisi, et autres
Publié: (2025)
Axis-level Symmetry Detection with Group-Equivariant Representation
par: Yu, Wongyun, et autres
Publié: (2025)
par: Yu, Wongyun, et autres
Publié: (2025)
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
par: Yan, Xiaoshuo, et autres
Publié: (2025)
par: Yan, Xiaoshuo, et autres
Publié: (2025)
Vanilla ViT for Automotive Point Cloud Semantic Segmentation
par: Puy, Gilles, et autres
Publié: (2026)
par: Puy, Gilles, et autres
Publié: (2026)
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks
par: Liu, Ruixun, et autres
Publié: (2025)
par: Liu, Ruixun, et autres
Publié: (2025)
Vision Transformer based Random Walk for Group Re-Identification
par: Zhang, Guoqing, et autres
Publié: (2024)
par: Zhang, Guoqing, et autres
Publié: (2024)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
par: Shu, Zhijian, et autres
Publié: (2025)
par: Shu, Zhijian, et autres
Publié: (2025)
FIND: A Simple yet Effective Baseline for Diffusion-Generated Image Detection
par: Li, Jie, et autres
Publié: (2026)
par: Li, Jie, et autres
Publié: (2026)
Beyond Low-rankness: Guaranteed Matrix Recovery via Modified Nuclear Norm
par: Peng, Jiangjun, et autres
Publié: (2025)
par: Peng, Jiangjun, et autres
Publié: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
par: Meng, Lingchen, et autres
Publié: (2024)
par: Meng, Lingchen, et autres
Publié: (2024)
Comprehensive Multi-Modal Prototypes are Simple and Effective Classifiers for Vast-Vocabulary Object Detection
par: Chen, Yitong, et autres
Publié: (2024)
par: Chen, Yitong, et autres
Publié: (2024)
Documents similaires
-
Rotation Equivariant Arbitrary-scale Image Super-Resolution
par: Xie, Qi, et autres
Publié: (2025) -
Rotation Equivariant Proximal Operator for Deep Unfolding Methods in Image Restoration
par: Fu, Jiahong, et autres
Publié: (2023) -
Rotation Equivariant Mamba for Vision Tasks
par: Zhao, Zhongchen, et autres
Publié: (2026) -
Aligning Network Equivariance with Data Symmetry: A Theoretical Framework and Adaptive Approach for Image Restoration
par: Tan, Feiyu, et autres
Publié: (2026) -
Rotation-Equivariant Self-Supervised Method in Image Denoising
par: Liu, Hanze, et autres
Publié: (2025)