Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ju, Chen, Wang, Haicheng, Cheng, Haozhe, Chen, Xu, Zhai, Zhonghua, Huang, Weilin, Lan, Jinsong, Xiao, Shuai, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cell Variational Information Bottleneck Network
by: Zhai, Zhonghua, et al.
Published: (2024)
by: Zhai, Zhonghua, et al.
Published: (2024)
Wear-Any-Way: Manipulable Virtual Try-on via Sparse Correspondence Alignment
by: Chen, Mengting, et al.
Published: (2024)
by: Chen, Mengting, et al.
Published: (2024)
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
by: Wang, Haicheng, et al.
Published: (2025)
by: Wang, Haicheng, et al.
Published: (2025)
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
by: Chen, Liang, et al.
Published: (2024)
by: Chen, Liang, et al.
Published: (2024)
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training
by: Wang, Haicheng, et al.
Published: (2024)
by: Wang, Haicheng, et al.
Published: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
by: Li, Zeqian, et al.
Published: (2025)
by: Li, Zeqian, et al.
Published: (2025)
Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in Videos
by: Xu, Zhengze, et al.
Published: (2024)
by: Xu, Zhengze, et al.
Published: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
by: Liu, Xuyang, et al.
Published: (2025)
by: Liu, Xuyang, et al.
Published: (2025)
Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization
by: Wang, Zhicheng, et al.
Published: (2025)
by: Wang, Zhicheng, et al.
Published: (2025)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
by: Chen, Yizhu, et al.
Published: (2025)
by: Chen, Yizhu, et al.
Published: (2025)
Category-Oriented Representation Learning for Image to Multi-Modal Retrieval
by: Cheng, Zida, et al.
Published: (2023)
by: Cheng, Zida, et al.
Published: (2023)
Improving Human Image Animation via Semantic Representation Alignment
by: Liu, Chang, et al.
Published: (2026)
by: Liu, Chang, et al.
Published: (2026)
Enhancing Cross-domain Click-Through Rate Prediction via Explicit Feature Augmentation
by: Chen, Xu, et al.
Published: (2023)
by: Chen, Xu, et al.
Published: (2023)
Squeeze Out Tokens from Sample for Finer-Grained Data Governance
by: Lin, Weixiong, et al.
Published: (2025)
by: Lin, Weixiong, et al.
Published: (2025)
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
by: Cheng, Haozhe, et al.
Published: (2024)
by: Cheng, Haozhe, et al.
Published: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
Forgedit: Text Guided Image Editing via Learning and Forgetting
by: Zhang, Shiwen, et al.
Published: (2023)
by: Zhang, Shiwen, et al.
Published: (2023)
Score-Based Turbo Message Passing for Plug-and-Play Compressive Imaging
by: Cai, Chang, et al.
Published: (2025)
by: Cai, Chang, et al.
Published: (2025)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
by: Kang, Jialiang, et al.
Published: (2025)
by: Kang, Jialiang, et al.
Published: (2025)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
by: Wang, Haicheng, et al.
Published: (2025)
by: Wang, Haicheng, et al.
Published: (2025)
PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
by: Zhuang, Wanru, et al.
Published: (2025)
by: Zhuang, Wanru, et al.
Published: (2025)
SeedEdit 3.0: Fast and High-Quality Generative Image Editing
by: Wang, Peng, et al.
Published: (2025)
by: Wang, Peng, et al.
Published: (2025)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
by: Lan, Zhibin, et al.
Published: (2025)
by: Lan, Zhibin, et al.
Published: (2025)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
by: Zhang, Jintao, et al.
Published: (2025)
by: Zhang, Jintao, et al.
Published: (2025)
Counterfactual Learning-Driven Representation Disentanglement for Search-Enhanced Recommendation
by: Cui, Jiajun, et al.
Published: (2024)
by: Cui, Jiajun, et al.
Published: (2024)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
by: Liu, Xuyang, et al.
Published: (2025)
by: Liu, Xuyang, et al.
Published: (2025)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
by: Luo, Wen, et al.
Published: (2026)
by: Luo, Wen, et al.
Published: (2026)
Score-Based Turbo Message Passing for Plug-and-Play Compressive Image Recovery
by: Cai, Chang, et al.
Published: (2025)
by: Cai, Chang, et al.
Published: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
by: Xiong, Minhao, et al.
Published: (2025)
by: Xiong, Minhao, et al.
Published: (2025)
Are We on the Right Way for Evaluating Large Vision-Language Models?
by: Chen, Lin, et al.
Published: (2024)
by: Chen, Lin, et al.
Published: (2024)
Static and Plugged: Make Embodied Evaluation Simple
by: Xiao, Jiahao, et al.
Published: (2025)
by: Xiao, Jiahao, et al.
Published: (2025)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
by: Lei, Yuxuan, et al.
Published: (2024)
by: Lei, Yuxuan, et al.
Published: (2024)
Turbo4DGen: Ultra-Fast Acceleration for 4D Generation
by: Man, Yuanbin, et al.
Published: (2026)
by: Man, Yuanbin, et al.
Published: (2026)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
by: Zhang, Zezhou, et al.
Published: (2026)
by: Zhang, Zezhou, et al.
Published: (2026)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
by: Peng, Shuai, et al.
Published: (2024)
by: Peng, Shuai, et al.
Published: (2024)
TurboRAG: Accelerating Retrieval-Augmented Generation with Precomputed KV Caches for Chunked Text
by: Lu, Songshuo, et al.
Published: (2024)
by: Lu, Songshuo, et al.
Published: (2024)
CELLO: Causal Evaluation of Large Vision-Language Models
by: Chen, Meiqi, et al.
Published: (2024)
by: Chen, Meiqi, et al.
Published: (2024)
GCV-Turbo: End-to-end Acceleration of GNN-based Computer Vision Tasks on FPGA
by: Zhang, Bingyi, et al.
Published: (2024)
by: Zhang, Bingyi, et al.
Published: (2024)
Mitigating Cache Noise in Test-Time Adaptation for Large Vision-Language Models
by: Zhai, Haotian, et al.
Published: (2025)
by: Zhai, Haotian, et al.
Published: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
by: Chen, Jiaxing, et al.
Published: (2024)
by: Chen, Jiaxing, et al.
Published: (2024)
Similar Items
-
Cell Variational Information Bottleneck Network
by: Zhai, Zhonghua, et al.
Published: (2024) -
Wear-Any-Way: Manipulable Virtual Try-on via Sparse Correspondence Alignment
by: Chen, Mengting, et al.
Published: (2024) -
FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance
by: Wang, Haicheng, et al.
Published: (2025) -
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
by: Chen, Liang, et al.
Published: (2024) -
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training
by: Wang, Haicheng, et al.
Published: (2024)