LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Juntao, Niu, Liqiang, Chen, Wenchao, Zhou, Jie, Meng, Fandong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024)
par: Chen, Wenchao, et autres
Publié: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens
par: Wang, Panpan, et autres
Publié: (2025)
par: Wang, Panpan, et autres
Publié: (2025)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025)
par: Lan, Zhibin, et autres
Publié: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
ArrowGEV: Grounding Events in Video via Learning the Arrow of Time
par: Yu, Fangxu, et autres
Publié: (2026)
par: Yu, Fangxu, et autres
Publié: (2026)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
par: Chen, Xiaoshu, et autres
Publié: (2026)
par: Chen, Xiaoshu, et autres
Publié: (2026)
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing
par: Zhang, Hui, et autres
Publié: (2026)
par: Zhang, Hui, et autres
Publié: (2026)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
par: Zhang, Renshan, et autres
Publié: (2024)
par: Zhang, Renshan, et autres
Publié: (2024)
Continuous Visual Autoregressive Generation via Score Maximization
par: Shao, Chenze, et autres
Publié: (2025)
par: Shao, Chenze, et autres
Publié: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
par: Lu, Hongyu, et autres
Publié: (2026)
par: Lu, Hongyu, et autres
Publié: (2026)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
par: Yao, Linli, et autres
Publié: (2024)
par: Yao, Linli, et autres
Publié: (2024)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
par: Lei, Lei, et autres
Publié: (2025)
par: Lei, Lei, et autres
Publié: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
par: Peng, Tianfan, et autres
Publié: (2025)
par: Peng, Tianfan, et autres
Publié: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
LISA: A Layer-wise Integration and Suppression Approach for Hallucination Mitigation in Multimodal Large Language Models
par: Guo, Zhihui, et autres
Publié: (2025)
par: Guo, Zhihui, et autres
Publié: (2025)
Window Token Concatenation for Efficient Visual Large Language Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
par: Huang, Mouxiao, et autres
Publié: (2025)
par: Huang, Mouxiao, et autres
Publié: (2025)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
par: Zhang, Renshan, et autres
Publié: (2025)
par: Zhang, Renshan, et autres
Publié: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
par: Wu, Jianlong, et autres
Publié: (2025)
par: Wu, Jianlong, et autres
Publié: (2025)
Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation
par: Gao, Juntao, et autres
Publié: (2025)
par: Gao, Juntao, et autres
Publié: (2025)
Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models
par: Zhou, Haoran, et autres
Publié: (2025)
par: Zhou, Haoran, et autres
Publié: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
par: Guo, Xiaoyang, et autres
Publié: (2025)
par: Guo, Xiaoyang, et autres
Publié: (2025)
TokenPacker: Efficient Visual Projector for Multimodal LLM
par: Li, Wentong, et autres
Publié: (2024)
par: Li, Wentong, et autres
Publié: (2024)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
par: Lyu, Yibo, et autres
Publié: (2025)
par: Lyu, Yibo, et autres
Publié: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
par: Wang, Yahong, et autres
Publié: (2026)
par: Wang, Yahong, et autres
Publié: (2026)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
par: Zeng, Sen, et autres
Publié: (2026)
par: Zeng, Sen, et autres
Publié: (2026)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
par: Zhuang, Jiedong, et autres
Publié: (2024)
par: Zhuang, Jiedong, et autres
Publié: (2024)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
par: Ju, Shaobo, et autres
Publié: (2026)
par: Ju, Shaobo, et autres
Publié: (2026)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
par: Zhang, Dingkun, et autres
Publié: (2026)
par: Zhang, Dingkun, et autres
Publié: (2026)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
par: Shen, Leyang, et autres
Publié: (2024)
par: Shen, Leyang, et autres
Publié: (2024)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
par: Song, Jiafei, et autres
Publié: (2026)
par: Song, Jiafei, et autres
Publié: (2026)
Straightforward Layer-wise Pruning for More Efficient Visual Adaptation
par: Han, Ruizi, et autres
Publié: (2024)
par: Han, Ruizi, et autres
Publié: (2024)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
Documents similaires
-
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024) -
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024) -
D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens
par: Wang, Panpan, et autres
Publié: (2025) -
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025) -
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)