LocalViT: Analyzing Locality in Vision Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yawei, Zhang, Kai, Cao, Jiezhang, Timofte, Radu, Magno, Michele, Benini, Luca, Van Gool, Luc |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2021
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deep Equilibrium Diffusion Restoration with Parallel Sampling
di: Cao, Jiezhang, et al.
Pubblicazione: (2023)
di: Cao, Jiezhang, et al.
Pubblicazione: (2023)
Towards Online Real-Time Memory-based Video Inpainting Transformers
di: Thiry, Guillaume, et al.
Pubblicazione: (2024)
di: Thiry, Guillaume, et al.
Pubblicazione: (2024)
MatIR: A Hybrid Mamba-Transformer Image Restoration Model
di: Wen, Juan, et al.
Pubblicazione: (2025)
di: Wen, Juan, et al.
Pubblicazione: (2025)
Mipmap-GS: Let Gaussians Deform with Scale-specific Mipmap for Anti-aliasing Rendering
di: Li, Jiameng, et al.
Pubblicazione: (2024)
di: Li, Jiameng, et al.
Pubblicazione: (2024)
Empowering Image Recovery_ A Multi-Attention Approach
di: Wen, Juan, et al.
Pubblicazione: (2024)
di: Wen, Juan, et al.
Pubblicazione: (2024)
PIV3CAMS: a multi-camera dataset for multiple computer vision problems and its application to novel view-point synthesis
di: Kim, Sohyeong, et al.
Pubblicazione: (2024)
di: Kim, Sohyeong, et al.
Pubblicazione: (2024)
MoVideo: Motion-Aware Video Generation with Diffusion Models
di: Liang, Jingyun, et al.
Pubblicazione: (2023)
di: Liang, Jingyun, et al.
Pubblicazione: (2023)
FTerViT: Fully Ternary Vision Transformer
di: Ruciński, Szymon, et al.
Pubblicazione: (2026)
di: Ruciński, Szymon, et al.
Pubblicazione: (2026)
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
di: Chen, Yujie, et al.
Pubblicazione: (2025)
di: Chen, Yujie, et al.
Pubblicazione: (2025)
Stereo Risk: A Continuous Modeling Approach to Stereo Matching
di: Liu, Ce, et al.
Pubblicazione: (2024)
di: Liu, Ce, et al.
Pubblicazione: (2024)
Equivariant Multi-Modality Image Fusion
di: Zhao, Zixiang, et al.
Pubblicazione: (2023)
di: Zhao, Zixiang, et al.
Pubblicazione: (2023)
Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation
di: Ren, Bin, et al.
Pubblicazione: (2025)
di: Ren, Bin, et al.
Pubblicazione: (2025)
Low Latency Visual Inertial Odometry with On-Sensor Accelerated Optical Flow for Resource-Constrained UAVs
di: Kühne, Jonas, et al.
Pubblicazione: (2024)
di: Kühne, Jonas, et al.
Pubblicazione: (2024)
Vision Transformers with Hierarchical Attention
di: Liu, Yun, et al.
Pubblicazione: (2021)
di: Liu, Yun, et al.
Pubblicazione: (2021)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
ViTALS: Vision Transformer for Action Localization in Surgical Nephrectomy
di: Chandra, Soumyadeep, et al.
Pubblicazione: (2024)
di: Chandra, Soumyadeep, et al.
Pubblicazione: (2024)
Shapley Pruning for Neural Network Compression
di: Adamczewski, Kamil, et al.
Pubblicazione: (2024)
di: Adamczewski, Kamil, et al.
Pubblicazione: (2024)
Analyzing Local Representations of Self-supervised Vision Transformers
di: Vanyan, Ani, et al.
Pubblicazione: (2023)
di: Vanyan, Ani, et al.
Pubblicazione: (2023)
Ultra-Efficient On-Device Object Detection on AI-Integrated Smart Glasses with TinyissimoYOLO
di: Moosmann, Julian, et al.
Pubblicazione: (2023)
di: Moosmann, Julian, et al.
Pubblicazione: (2023)
TrafficBots V1.5: Traffic Simulation via Conditional VAEs and Transformers with Relative Pose Encoding
di: Zhang, Zhejun, et al.
Pubblicazione: (2024)
di: Zhang, Zhejun, et al.
Pubblicazione: (2024)
What You Have is What You Track: Adaptive and Robust Multimodal Tracking
di: Tan, Yuedong, et al.
Pubblicazione: (2025)
di: Tan, Yuedong, et al.
Pubblicazione: (2025)
Single-Model and Any-Modality for Video Object Tracking
di: Wu, Zongwei, et al.
Pubblicazione: (2023)
di: Wu, Zongwei, et al.
Pubblicazione: (2023)
Learning Local and Global Temporal Contexts for Video Semantic Segmentation
di: Sun, Guolei, et al.
Pubblicazione: (2022)
di: Sun, Guolei, et al.
Pubblicazione: (2022)
Cat: Post-Training Quantization Error Reduction via Cluster-based Affine Transformation
di: Zoljodi, Ali, et al.
Pubblicazione: (2025)
di: Zoljodi, Ali, et al.
Pubblicazione: (2025)
Event-Free Moving Object Segmentation from Moving Ego Vehicle
di: Zhou, Zhuyun, et al.
Pubblicazione: (2023)
di: Zhou, Zhuyun, et al.
Pubblicazione: (2023)
Accurate and Efficient World Modeling with Masked Latent Transformers
di: Burchi, Maxime, et al.
Pubblicazione: (2025)
di: Burchi, Maxime, et al.
Pubblicazione: (2025)
Learning Transformer-based World Models with Contrastive Predictive Coding
di: Burchi, Maxime, et al.
Pubblicazione: (2025)
di: Burchi, Maxime, et al.
Pubblicazione: (2025)
Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
di: Tang, Hao, et al.
Pubblicazione: (2024)
di: Tang, Hao, et al.
Pubblicazione: (2024)
Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models
di: Uzun, Tolgay Atinc, et al.
Pubblicazione: (2026)
di: Uzun, Tolgay Atinc, et al.
Pubblicazione: (2026)
Sharing Key Semantics in Transformer Makes Efficient Image Restoration
di: Ren, Bin, et al.
Pubblicazione: (2024)
di: Ren, Bin, et al.
Pubblicazione: (2024)
WaveFormer: A Lightweight Transformer Model for sEMG-based Gesture Recognition
di: Chen, Yanlong, et al.
Pubblicazione: (2025)
di: Chen, Yanlong, et al.
Pubblicazione: (2025)
Practical Manipulation Model for Robust Deepfake Detection
di: Hopf, Benedikt, et al.
Pubblicazione: (2025)
di: Hopf, Benedikt, et al.
Pubblicazione: (2025)
Efficient and Accurate Downfacing Visual Inertial Odometry
di: Kühne, Jonas, et al.
Pubblicazione: (2025)
di: Kühne, Jonas, et al.
Pubblicazione: (2025)
LEVIO: Lightweight Embedded Visual Inertial Odometry for Resource-Constrained Devices
di: Kühne, Jonas, et al.
Pubblicazione: (2026)
di: Kühne, Jonas, et al.
Pubblicazione: (2026)
Vision encoders should be image size agnostic and task driven
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
Test-time Training for Hyperspectral Image Super-resolution
di: Li, Ke, et al.
Pubblicazione: (2024)
di: Li, Ke, et al.
Pubblicazione: (2024)
Babel-ImageNet: Massively Multilingual Evaluation of Vision-and-Language Representations
di: Geigle, Gregor, et al.
Pubblicazione: (2023)
di: Geigle, Gregor, et al.
Pubblicazione: (2023)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs
di: Chen, Yanlong, et al.
Pubblicazione: (2026)
di: Chen, Yanlong, et al.
Pubblicazione: (2026)
Transcending the Limit of Local Window: Advanced Super-Resolution Transformer with Adaptive Token Dictionary
di: Zhang, Leheng, et al.
Pubblicazione: (2024)
di: Zhang, Leheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Deep Equilibrium Diffusion Restoration with Parallel Sampling
di: Cao, Jiezhang, et al.
Pubblicazione: (2023) -
Towards Online Real-Time Memory-based Video Inpainting Transformers
di: Thiry, Guillaume, et al.
Pubblicazione: (2024) -
MatIR: A Hybrid Mamba-Transformer Image Restoration Model
di: Wen, Juan, et al.
Pubblicazione: (2025) -
Mipmap-GS: Let Gaussians Deform with Scale-specific Mipmap for Anti-aliasing Rendering
di: Li, Jiameng, et al.
Pubblicazione: (2024) -
Empowering Image Recovery_ A Multi-Attention Approach
di: Wen, Juan, et al.
Pubblicazione: (2024)