Learning Spatial Decay for Vision Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mao, Yuxin, Qin, Zhen, Zhou, Jinxing, Fan, Bin, Zhang, Jing, Zhong, Yiran, Dai, Yuchao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
par: Mao, Yuxin, et autres
Publié: (2025)
par: Mao, Yuxin, et autres
Publié: (2025)
TAVGBench: Benchmarking Text to Audible-Video Generation
par: Mao, Yuxin, et autres
Publié: (2024)
par: Mao, Yuxin, et autres
Publié: (2024)
You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
Deep Non-rigid Structure-from-Motion Revisited: Canonicalization and Sequence Modeling
par: Deng, Hui, et autres
Publié: (2024)
par: Deng, Hui, et autres
Publié: (2024)
A Generative Victim Model for Segmentation
par: Li, Aixuan, et autres
Publié: (2024)
par: Li, Aixuan, et autres
Publié: (2024)
SSR: A Training-Free Approach for Streaming 3D Reconstruction
par: Deng, Hui, et autres
Publié: (2026)
par: Deng, Hui, et autres
Publié: (2026)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
par: Mao, Yuxin, et autres
Publié: (2023)
par: Mao, Yuxin, et autres
Publié: (2023)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Deep Non-rigid Structure-from-Motion: A Sequence-to-Sequence Translation Perspective
par: Deng, Hui, et autres
Publié: (2022)
par: Deng, Hui, et autres
Publié: (2022)
A Revisit of the Normalized Eight-Point Algorithm and A Self-Supervised Deep Solution
par: Fan, Bin, et autres
Publié: (2023)
par: Fan, Bin, et autres
Publié: (2023)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
par: Chen, Lan, et autres
Publié: (2025)
par: Chen, Lan, et autres
Publié: (2025)
SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors
par: Li, Aixuan, et autres
Publié: (2025)
par: Li, Aixuan, et autres
Publié: (2025)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
par: Chen, Lan, et autres
Publié: (2025)
par: Chen, Lan, et autres
Publié: (2025)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
par: Zhong, Yunshan, et autres
Publié: (2024)
par: Zhong, Yunshan, et autres
Publié: (2024)
Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction
par: Zhong, Yunshan, et autres
Publié: (2024)
par: Zhong, Yunshan, et autres
Publié: (2024)
Personalized Vision via Visual In-Context Learning
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
Advancing Vision Transformer with Enhanced Spatial Priors
par: Fan, Qihang, et autres
Publié: (2026)
par: Fan, Qihang, et autres
Publié: (2026)
Instance-Level Moving Object Segmentation from a Single Image with Events
par: Wan, Zhexiong, et autres
Publié: (2025)
par: Wan, Zhexiong, et autres
Publié: (2025)
Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
LoFLAT: Local Feature Matching using Focused Linear Attention Transformer
par: Cao, Naijian, et autres
Publié: (2024)
par: Cao, Naijian, et autres
Publié: (2024)
Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models
par: Zhou, Heng, et autres
Publié: (2026)
par: Zhou, Heng, et autres
Publié: (2026)
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning
par: Zhong, Hanwen, et autres
Publié: (2025)
par: Zhong, Hanwen, et autres
Publié: (2025)
Non-rigid Structure-from-Motion: Temporally-smooth Procrustean Alignment and Spatially-variant Deformation Modeling
par: Shi, Jiawei, et autres
Publié: (2024)
par: Shi, Jiawei, et autres
Publié: (2024)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
par: Mao, Junzhu, et autres
Publié: (2025)
par: Mao, Junzhu, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
Lightweight Vision Transformer with Bidirectional Interaction
par: Fan, Qihang, et autres
Publié: (2023)
par: Fan, Qihang, et autres
Publié: (2023)
Vision Transformers with Self-Distilled Registers
par: Chen, Yinjie, et autres
Publié: (2025)
par: Chen, Yinjie, et autres
Publié: (2025)
Mobius: A High Efficient Spatial-Temporal Parallel Training Paradigm for Text-to-Video Generation Task
par: Yang, Yiran, et autres
Publié: (2024)
par: Yang, Yiran, et autres
Publié: (2024)
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
par: Zhu, Xingkui, et autres
Publié: (2024)
par: Zhu, Xingkui, et autres
Publié: (2024)
Vision Transformer with Sparse Scan Prior
par: Zhang, Yuguang, et autres
Publié: (2024)
par: Zhang, Yuguang, et autres
Publié: (2024)
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning
par: Zhou, Heng, et autres
Publié: (2026)
par: Zhou, Heng, et autres
Publié: (2026)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
Integrated Structural Prompt Learning for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control
par: Zhou, Enshen, et autres
Publié: (2024)
par: Zhou, Enshen, et autres
Publié: (2024)
Documents similaires
-
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
par: Mao, Yuxin, et autres
Publié: (2025) -
TAVGBench: Benchmarking Text to Audible-Video Generation
par: Mao, Yuxin, et autres
Publié: (2024) -
You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
par: Qin, Zhen, et autres
Publié: (2024) -
Deep Non-rigid Structure-from-Motion Revisited: Canonicalization and Sequence Modeling
par: Deng, Hui, et autres
Publié: (2024) -
A Generative Victim Model for Segmentation
par: Li, Aixuan, et autres
Publié: (2024)