Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Xiaoyang, Wang, Keze |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoCo-LLaMA: Towards Vision Compression with Large Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
di: Tanvir, Md Tasnin, et al.
Pubblicazione: (2025)
di: Tanvir, Md Tasnin, et al.
Pubblicazione: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
di: Wang, Huanyu, et al.
Pubblicazione: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
di: Liu, Juntao, et al.
Pubblicazione: (2025)
di: Liu, Juntao, et al.
Pubblicazione: (2025)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
Conflict Adaptation in Vision-Language Models
di: Hu, Xiaoyang
Pubblicazione: (2025)
di: Hu, Xiaoyang
Pubblicazione: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
di: li, Bonan, et al.
Pubblicazione: (2025)
di: li, Bonan, et al.
Pubblicazione: (2025)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
di: Wang, Anmin, et al.
Pubblicazione: (2026)
di: Wang, Anmin, et al.
Pubblicazione: (2026)
ViVo: A Dataset for Volumetric Video Reconstruction and Compression
di: Azzarelli, Adrian, et al.
Pubblicazione: (2025)
di: Azzarelli, Adrian, et al.
Pubblicazione: (2025)
2D Gaussians Meet Visual Tokenizer
di: Shi, Yiang, et al.
Pubblicazione: (2025)
di: Shi, Yiang, et al.
Pubblicazione: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
di: Ma, Kexin, et al.
Pubblicazione: (2026)
di: Ma, Kexin, et al.
Pubblicazione: (2026)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
di: Yao, Linli, et al.
Pubblicazione: (2024)
di: Yao, Linli, et al.
Pubblicazione: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
di: Ma, Jie, et al.
Pubblicazione: (2026)
di: Ma, Jie, et al.
Pubblicazione: (2026)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
di: Peng, Tianfan, et al.
Pubblicazione: (2025)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
di: Li, Jianjian, et al.
Pubblicazione: (2025)
di: Li, Jianjian, et al.
Pubblicazione: (2025)
TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
di: Izzo, Riccardo Andrea, et al.
Pubblicazione: (2026)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
di: Zeng, Weili, et al.
Pubblicazione: (2025)
di: Zeng, Weili, et al.
Pubblicazione: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
di: Park, Minyoung, et al.
Pubblicazione: (2026)
di: Park, Minyoung, et al.
Pubblicazione: (2026)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs
di: Lee, Jaehoon, et al.
Pubblicazione: (2026)
di: Lee, Jaehoon, et al.
Pubblicazione: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VoCo-LLaMA: Towards Vision Compression with Large Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025) -
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
di: Lu, Hongyu, et al.
Pubblicazione: (2026) -
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025) -
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)