ToSA: Token Selective Attention for Efficient Vision Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Singh, Manish Kumar, Yasarla, Rajeev, Cai, Hong, Lee, Mingu, Porikli, Fatih |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
por: Yasarla, Rajeev, et al.
Publicado: (2025)
por: Yasarla, Rajeev, et al.
Publicado: (2025)
MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2023)
por: Yasarla, Rajeev, et al.
Publicado: (2023)
DeCoTR: Enhancing Depth Completion with 2D and 3D Attentions
por: Shi, Yunxiao, et al.
Publicado: (2024)
por: Shi, Yunxiao, et al.
Publicado: (2024)
ToSA: Token Merging with Spatial Awareness
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
por: Huang, Hsiang-Wei, et al.
Publicado: (2025)
FutureDepth: Learning to Predict the Future Improves Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2024)
por: Yasarla, Rajeev, et al.
Publicado: (2024)
PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer
por: Letourneau, Pierre-David, et al.
Publicado: (2024)
por: Letourneau, Pierre-David, et al.
Publicado: (2024)
HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation
por: Mercier, Antoine, et al.
Publicado: (2024)
por: Mercier, Antoine, et al.
Publicado: (2024)
CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers
por: Li, Zhuojin, et al.
Publicado: (2026)
por: Li, Zhuojin, et al.
Publicado: (2026)
Do-Undo Bench: Reversibility for Action Understanding in Image Generation
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
RoCA: Robust Cross-Domain End-to-End Autonomous Driving
por: Yasarla, Rajeev, et al.
Publicado: (2025)
por: Yasarla, Rajeev, et al.
Publicado: (2025)
H3O: Hyper-Efficient 3D Occupancy Prediction with Heterogeneous Supervision
por: Shi, Yunxiao, et al.
Publicado: (2025)
por: Shi, Yunxiao, et al.
Publicado: (2025)
Distilling Multi-modal Large Language Models for Autonomous Driving
por: Hegde, Deepti, et al.
Publicado: (2025)
por: Hegde, Deepti, et al.
Publicado: (2025)
HAViT: Historical Attention Vision Transformer
por: Banik, Swarnendu, et al.
Publicado: (2026)
por: Banik, Swarnendu, et al.
Publicado: (2026)
Attention Guided Alignment in Efficient Vision-Language Models
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving
por: Yasarla, Rajeev, et al.
Publicado: (2026)
por: Yasarla, Rajeev, et al.
Publicado: (2026)
Improving Optical Flow and Stereo Depth Estimation by Leveraging Uncertainty-Based Learning Difficulties
por: Jeong, Jisoo, et al.
Publicado: (2025)
por: Jeong, Jisoo, et al.
Publicado: (2025)
Generative Scenario Rollouts for End-to-End Autonomous Driving
por: Yasarla, Rajeev, et al.
Publicado: (2026)
por: Yasarla, Rajeev, et al.
Publicado: (2026)
FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
por: Cho, Janghoon, et al.
Publicado: (2025)
por: Cho, Janghoon, et al.
Publicado: (2025)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
por: Lee, Sanghyeok, et al.
Publicado: (2024)
por: Lee, Sanghyeok, et al.
Publicado: (2024)
Planar Gaussian Splatting
por: Zanjani, Farhad G., et al.
Publicado: (2024)
por: Zanjani, Farhad G., et al.
Publicado: (2024)
Neural Mesh Fusion: Unsupervised 3D Planar Surface Understanding
por: Zanjani, Farhad G., et al.
Publicado: (2024)
por: Zanjani, Farhad G., et al.
Publicado: (2024)
CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation
por: Lee, Jungsoo, et al.
Publicado: (2025)
por: Lee, Jungsoo, et al.
Publicado: (2025)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
por: Lee, Dong Hoon, et al.
Publicado: (2024)
por: Lee, Dong Hoon, et al.
Publicado: (2024)
Learning Optical Flow Field via Neural Ordinary Differential Equation
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
por: Lin, Jamie Menjay, et al.
Publicado: (2024)
por: Lin, Jamie Menjay, et al.
Publicado: (2024)
OCAI: Improving Optical Flow Estimation by Occlusion and Consistency Aware Interpolation
por: Jeong, Jisoo, et al.
Publicado: (2024)
por: Jeong, Jisoo, et al.
Publicado: (2024)
FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices
por: Han, Shizhong, et al.
Publicado: (2025)
por: Han, Shizhong, et al.
Publicado: (2025)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
por: Uddin, Mohammad Helal, et al.
Publicado: (2025)
por: Uddin, Mohammad Helal, et al.
Publicado: (2025)
TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation
por: Xia, Zunhui, et al.
Publicado: (2025)
por: Xia, Zunhui, et al.
Publicado: (2025)
BePo: Dual Representation for 3D Occupancy Prediction
por: Shi, Yunxiao, et al.
Publicado: (2025)
por: Shi, Yunxiao, et al.
Publicado: (2025)
ODG: Occupancy Prediction Using Dual Gaussians
por: Shi, Yunxiao, et al.
Publicado: (2025)
por: Shi, Yunxiao, et al.
Publicado: (2025)
Segmentation-Free Guidance for Text-to-Image Diffusion Models
por: Azarian, Kambiz, et al.
Publicado: (2024)
por: Azarian, Kambiz, et al.
Publicado: (2024)
Resolving the Identity Crisis in Text-to-Image Generation
por: Borse, Shubhankar, et al.
Publicado: (2025)
por: Borse, Shubhankar, et al.
Publicado: (2025)
LoRA-X: Bridging Foundation Models with Training-Free Cross-Model Adaptation
por: Farhadzadeh, Farzad, et al.
Publicado: (2025)
por: Farhadzadeh, Farzad, et al.
Publicado: (2025)
Speed-up of Vision Transformer Models by Attention-aware Token Filtering
por: Naruko, Takahiro, et al.
Publicado: (2025)
por: Naruko, Takahiro, et al.
Publicado: (2025)
Context-Aware Token Selection and Packing for Enhanced Vision Transformer
por: Zhang, Tianyi, et al.
Publicado: (2024)
por: Zhang, Tianyi, et al.
Publicado: (2024)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
por: Wu, Xinjian, et al.
Publicado: (2023)
por: Wu, Xinjian, et al.
Publicado: (2023)
Context-Aware Token Pruning and Discriminative Selective Attention for Transformer Tracking
por: Kugarajeevan, Janani, et al.
Publicado: (2025)
por: Kugarajeevan, Janani, et al.
Publicado: (2025)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
por: Lew, Jaihyun, et al.
Publicado: (2024)
por: Lew, Jaihyun, et al.
Publicado: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
por: Lee, Dong-Jae, et al.
Publicado: (2025)
por: Lee, Dong-Jae, et al.
Publicado: (2025)
Ejemplares similares
-
DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos
por: Yasarla, Rajeev, et al.
Publicado: (2025) -
MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2023) -
DeCoTR: Enhancing Depth Completion with 2D and 3D Attentions
por: Shi, Yunxiao, et al.
Publicado: (2024) -
ToSA: Token Merging with Spatial Awareness
por: Huang, Hsiang-Wei, et al.
Publicado: (2025) -
FutureDepth: Learning to Predict the Future Improves Video Depth Estimation
por: Yasarla, Rajeev, et al.
Publicado: (2024)