FlexAttention for Efficient High-Resolution Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Junyan, Chen, Delin, Cai, Tianle, Chen, Peihao, Hong, Yining, Chen, Zhenfang, Shen, Yikang, Gan, Chuang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TextPSG: Panoptic Scene Graph Generation from Textual Descriptions
von: Zhao, Chengyang, et al.
Veröffentlicht: (2023)
von: Zhao, Chengyang, et al.
Veröffentlicht: (2023)
EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
von: Cai, Han, et al.
Veröffentlicht: (2022)
von: Cai, Han, et al.
Veröffentlicht: (2022)
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
von: Hong, Yining, et al.
Veröffentlicht: (2024)
von: Hong, Yining, et al.
Veröffentlicht: (2024)
3D-VLA: A 3D Vision-Language-Action Generative World Model
von: Zhen, Haoyu, et al.
Veröffentlicht: (2024)
von: Zhen, Haoyu, et al.
Veröffentlicht: (2024)
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
von: Yang, Zeyuan, et al.
Veröffentlicht: (2025)
von: Yang, Zeyuan, et al.
Veröffentlicht: (2025)
VCA: Video Curious Agent for Long Video Understanding
von: Yang, Zeyuan, et al.
Veröffentlicht: (2024)
von: Yang, Zeyuan, et al.
Veröffentlicht: (2024)
SparseFlex: High-Resolution and Arbitrary-Topology 3D Shape Modeling
von: He, Xianglong, et al.
Veröffentlicht: (2025)
von: He, Xianglong, et al.
Veröffentlicht: (2025)
LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences
von: Zhi, Hongyan, et al.
Veröffentlicht: (2024)
von: Zhi, Hongyan, et al.
Veröffentlicht: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
von: Zou, Dongyun, et al.
Veröffentlicht: (2026)
von: Zou, Dongyun, et al.
Veröffentlicht: (2026)
One Last Attention for Your Vision-Language Model
von: Chen, Liang, et al.
Veröffentlicht: (2025)
von: Chen, Liang, et al.
Veröffentlicht: (2025)
Efficient Learnable Collaborative Attention for Single Image Super-Resolution
von: Zheng, Yigang Zhao Chaowei, et al.
Veröffentlicht: (2024)
von: Zheng, Yigang Zhao Chaowei, et al.
Veröffentlicht: (2024)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
von: Kuo, Chia-Wen, et al.
Veröffentlicht: (2025)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
von: Wu, Bo, et al.
Veröffentlicht: (2024)
von: Wu, Bo, et al.
Veröffentlicht: (2024)
Learning 3D Persistent Embodied World Models
von: Zhou, Siyuan, et al.
Veröffentlicht: (2025)
von: Zhou, Siyuan, et al.
Veröffentlicht: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
von: Li, Xu, et al.
Veröffentlicht: (2025)
von: Li, Xu, et al.
Veröffentlicht: (2025)
MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning
von: Lin, Ji, et al.
Veröffentlicht: (2021)
von: Lin, Ji, et al.
Veröffentlicht: (2021)
Efficient Test-Time Prompt Tuning for Vision-Language Models
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
von: Zhu, Yuhan, et al.
Veröffentlicht: (2024)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
von: Arif, Kazi Hasan Ibn, et al.
Veröffentlicht: (2024)
von: Arif, Kazi Hasan Ibn, et al.
Veröffentlicht: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
von: Yang, Yuncong, et al.
Veröffentlicht: (2024)
von: Yang, Yuncong, et al.
Veröffentlicht: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
Compositional Physical Reasoning of Objects and Events from Videos
von: Chen, Zhenfang, et al.
Veröffentlicht: (2024)
von: Chen, Zhenfang, et al.
Veröffentlicht: (2024)
ContPhy: Continuum Physical Concept Learning and Reasoning from Videos
von: Zheng, Zhicheng, et al.
Veröffentlicht: (2024)
von: Zheng, Zhicheng, et al.
Veröffentlicht: (2024)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
von: Liang, Yuxuan, et al.
Veröffentlicht: (2025)
von: Liang, Yuxuan, et al.
Veröffentlicht: (2025)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
von: Chen, Junyu, et al.
Veröffentlicht: (2024)
von: Chen, Junyu, et al.
Veröffentlicht: (2024)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
von: Lin, Junyan, et al.
Veröffentlicht: (2024)
von: Lin, Junyan, et al.
Veröffentlicht: (2024)
FlexGS: Train Once, Deploy Everywhere with Many-in-One Flexible 3D Gaussian Splatting
von: Liu, Hengyu, et al.
Veröffentlicht: (2025)
von: Liu, Hengyu, et al.
Veröffentlicht: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
von: Wang, Chenyu, et al.
Veröffentlicht: (2026)
von: Wang, Chenyu, et al.
Veröffentlicht: (2026)
RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention
von: Chen, Zhan, et al.
Veröffentlicht: (2025)
von: Chen, Zhan, et al.
Veröffentlicht: (2025)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
von: Tao, Hongyuan, et al.
Veröffentlicht: (2025)
von: Tao, Hongyuan, et al.
Veröffentlicht: (2025)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion Models
von: Li, Muyang, et al.
Veröffentlicht: (2024)
von: Li, Muyang, et al.
Veröffentlicht: (2024)
ToSA: Token Selective Attention for Efficient Vision Transformers
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
Advancing High Resolution Vision-Language Models in Biomedicine
von: Chen, Zekai, et al.
Veröffentlicht: (2024)
von: Chen, Zekai, et al.
Veröffentlicht: (2024)
FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models
von: Yuan, Shengming, et al.
Veröffentlicht: (2025)
von: Yuan, Shengming, et al.
Veröffentlicht: (2025)
These Maps Are Made by Propagation: Adapting Deep Stereo Networks to Road Scenarios with Decisive Disparity Diffusion
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
Adapting Vision Foundation Models for Real-time Ultrasound Image Segmentation
von: Zhang, Xiaoran, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaoran, et al.
Veröffentlicht: (2025)
DiffPattern-Flex: Efficient Layout Pattern Generation via Discrete Diffusion
von: Wang, Zixiao, et al.
Veröffentlicht: (2025)
von: Wang, Zixiao, et al.
Veröffentlicht: (2025)
RAU: Reference-based Anatomical Understanding with Vision Language Models
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
von: Li, Yiwei, et al.
Veröffentlicht: (2025)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
von: Xie, Enze, et al.
Veröffentlicht: (2024)
von: Xie, Enze, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TextPSG: Panoptic Scene Graph Generation from Textual Descriptions
von: Zhao, Chengyang, et al.
Veröffentlicht: (2023) -
EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
von: Cai, Han, et al.
Veröffentlicht: (2022) -
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
von: Hong, Yining, et al.
Veröffentlicht: (2024) -
3D-VLA: A 3D Vision-Language-Action Generative World Model
von: Zhen, Haoyu, et al.
Veröffentlicht: (2024) -
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens
von: Yang, Zeyuan, et al.
Veröffentlicht: (2025)