Window Token Concatenation for Efficient Visual Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yifan, Bao, Wentao, Ye, Botao, Tan, Zhen, Chen, Tianlong, Liu, Huan, Kong, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Facial Affective Behavior Analysis with Instruction Tuning
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Visual Large Language Models for Generalized and Specialized Applications
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Efficient Multi-modal Large Language Models via Visual Token Grouping
di: Huang, Minbin, et al.
Pubblicazione: (2024)
di: Huang, Minbin, et al.
Pubblicazione: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
di: Liu, Juntao, et al.
Pubblicazione: (2025)
di: Liu, Juntao, et al.
Pubblicazione: (2025)
Prompting Language-Informed Distribution for Compositional Zero-Shot Learning
di: Bao, Wentao, et al.
Pubblicazione: (2023)
di: Bao, Wentao, et al.
Pubblicazione: (2023)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
di: Li, Xu, et al.
Pubblicazione: (2025)
di: Li, Xu, et al.
Pubblicazione: (2025)
Open Set Face Forgery Detection via Dual-Level Evidence Collection
di: Cai, Zhongyi, et al.
Pubblicazione: (2025)
di: Cai, Zhongyi, et al.
Pubblicazione: (2025)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
di: Li, Jianjian, et al.
Pubblicazione: (2025)
di: Li, Jianjian, et al.
Pubblicazione: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
di: Lu, Hongyu, et al.
Pubblicazione: (2026)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
di: Chen, Xiaoshu, et al.
Pubblicazione: (2026)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
di: Yang, Jie, et al.
Pubblicazione: (2025)
di: Yang, Jie, et al.
Pubblicazione: (2025)
FairSkin: Fair Diffusion for Skin Disease Image Generation
di: Zhang, Ruichen, et al.
Pubblicazione: (2024)
di: Zhang, Ruichen, et al.
Pubblicazione: (2024)
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
di: Baek, Changwoo, et al.
Pubblicazione: (2026)
di: Baek, Changwoo, et al.
Pubblicazione: (2026)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
di: Tan, Yifan, et al.
Pubblicazione: (2026)
di: Tan, Yifan, et al.
Pubblicazione: (2026)
TCFormer: Visual Recognition via Token Clustering Transformer
di: Zeng, Wang, et al.
Pubblicazione: (2024)
di: Zeng, Wang, et al.
Pubblicazione: (2024)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
di: Meng, Yu, et al.
Pubblicazione: (2025)
di: Meng, Yu, et al.
Pubblicazione: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Facial Affective Behavior Analysis with Instruction Tuning
di: Li, Yifan, et al.
Pubblicazione: (2024) -
Visual Large Language Models for Generalized and Specialized Applications
di: Li, Yifan, et al.
Pubblicazione: (2025) -
Task-Aware Resolution Optimization for Visual Large Language Models
di: Luo, Weiqing, et al.
Pubblicazione: (2025) -
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025) -
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
di: Wang, Fei, et al.
Pubblicazione: (2025)