An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Liang, Zhao, Haozhe, Liu, Tianyu, Bai, Shuai, Lin, Junyang, Zhou, Chang, Chang, Baobao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
por: Qin, Shengling, et al.
Publicado: (2025)
por: Qin, Shengling, et al.
Publicado: (2025)
Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
por: Ju, Chen, et al.
Publicado: (2024)
por: Ju, Chen, et al.
Publicado: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer
por: Peng, Shuai, et al.
Publicado: (2024)
por: Peng, Shuai, et al.
Publicado: (2024)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Rethinking Semantic Parsing for Large Language Models: Enhancing LLM Performance with Semantic Hints
por: An, Kaikai, et al.
Publicado: (2024)
por: An, Kaikai, et al.
Publicado: (2024)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
Mitigating Language-Level Performance Disparity in mPLMs via Teacher Language Selection and Cross-lingual Self-Distillation
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
Revisiting Multimodal Positional Encoding in Vision-Language Models
por: Huang, Jie, et al.
Publicado: (2025)
por: Huang, Jie, et al.
Publicado: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
por: Xiong, Minhao, et al.
Publicado: (2025)
por: Xiong, Minhao, et al.
Publicado: (2025)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024)
por: Chen, Jiaxing, et al.
Publicado: (2024)
LLM-KT: Aligning Large Language Models with Knowledge Tracing using a Plug-and-Play Instruction
por: Wang, Ziwei, et al.
Publicado: (2025)
por: Wang, Ziwei, et al.
Publicado: (2025)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
por: Zhao, Haozhe, et al.
Publicado: (2023)
por: Zhao, Haozhe, et al.
Publicado: (2023)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
Score-Based Turbo Message Passing for Plug-and-Play Compressive Imaging
por: Cai, Chang, et al.
Publicado: (2025)
por: Cai, Chang, et al.
Publicado: (2025)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
por: Tuli, Shikhar, et al.
Publicado: (2024)
por: Tuli, Shikhar, et al.
Publicado: (2024)
An Image is Worth 32 Tokens for Reconstruction and Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
Variator: Accelerating Pre-trained Models with Plug-and-Play Compression Modules
por: Xiao, Chaojun, et al.
Publicado: (2023)
por: Xiao, Chaojun, et al.
Publicado: (2023)
Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
por: Cao, Jiaqi, et al.
Publicado: (2025)
por: Cao, Jiaqi, et al.
Publicado: (2025)
Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering
por: Si, Shuzheng, et al.
Publicado: (2025)
por: Si, Shuzheng, et al.
Publicado: (2025)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
Score-Based Turbo Message Passing for Plug-and-Play Compressive Image Recovery
por: Cai, Chang, et al.
Publicado: (2025)
por: Cai, Chang, et al.
Publicado: (2025)
Interactive Text-to-Image Retrieval with Large Language Models: A Plug-and-Play Approach
por: Lee, Saehyung, et al.
Publicado: (2024)
por: Lee, Saehyung, et al.
Publicado: (2024)
Improving the Robustness of Distantly-Supervised Named Entity Recognition via Uncertainty-Aware Teacher Learning and Student-Student Collaborative Learning
por: Si, Shuzheng, et al.
Publicado: (2023)
por: Si, Shuzheng, et al.
Publicado: (2023)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
por: Liu, Yijin, et al.
Publicado: (2024)
por: Liu, Yijin, et al.
Publicado: (2024)
Text-to-Image Rectified Flow as Plug-and-Play Priors
por: Yang, Xiaofeng, et al.
Publicado: (2024)
por: Yang, Xiaofeng, et al.
Publicado: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
por: Zhao, Shiyu, et al.
Publicado: (2024)
por: Zhao, Shiyu, et al.
Publicado: (2024)
S2MDF: A Plug-And-Play Layer for Intersection-Free Multi-Object Signed Distance Fields
por: Mercadier, Deniz Sayin, et al.
Publicado: (2026)
por: Mercadier, Deniz Sayin, et al.
Publicado: (2026)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)
por: Yuan, Chenhan, et al.
Publicado: (2024)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
por: Li, Senmao, et al.
Publicado: (2025)
por: Li, Senmao, et al.
Publicado: (2025)
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
por: Li, Miaoran, et al.
Publicado: (2023)
por: Li, Miaoran, et al.
Publicado: (2023)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
por: Luo, Katie, et al.
Publicado: (2025)
por: Luo, Katie, et al.
Publicado: (2025)
Diffusion Sampling Path Tells More: An Efficient Plug-and-Play Strategy for Sample Filtering
por: Wang, Sixian, et al.
Publicado: (2025)
por: Wang, Sixian, et al.
Publicado: (2025)
Ejemplares similares
-
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
por: Chen, Liang, et al.
Publicado: (2024) -
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
por: Chen, Liang, et al.
Publicado: (2025) -
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024) -
VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
por: Qin, Shengling, et al.
Publicado: (2025) -
Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
por: Ju, Chen, et al.
Publicado: (2024)