Dynamic Token Reduction during Generation for Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liang, Xiaoyu, Guan, Chaofeng, Lu, Jiaying, Chen, Huiyao, Wang, Huan, Hu, Haoji |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Rethinking Token Reduction for Large Vision-Language Models
von: Wang, Yi, et al.
Veröffentlicht: (2026)
von: Wang, Yi, et al.
Veröffentlicht: (2026)
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
von: Lu, Zhuqiang, et al.
Veröffentlicht: (2024)
von: Lu, Zhuqiang, et al.
Veröffentlicht: (2024)
Token-Level Inference-Time Alignment for Vision-Language Models
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
von: He, Yefei, et al.
Veröffentlicht: (2024)
von: He, Yefei, et al.
Veröffentlicht: (2024)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
von: Chen, Siyi, et al.
Veröffentlicht: (2026)
von: Chen, Siyi, et al.
Veröffentlicht: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation
von: Zheng, Wenjie, et al.
Veröffentlicht: (2026)
von: Zheng, Wenjie, et al.
Veröffentlicht: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
von: Li, Ao, et al.
Veröffentlicht: (2025)
von: Li, Ao, et al.
Veröffentlicht: (2025)
Frequency-Aware Token Reduction for Efficient Vision Transformer
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2025)
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
von: He, Jialuo, et al.
Veröffentlicht: (2026)
von: He, Jialuo, et al.
Veröffentlicht: (2026)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
von: Meng, Yu, et al.
Veröffentlicht: (2025)
von: Meng, Yu, et al.
Veröffentlicht: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
von: Yang, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Yang, Zhiyuan, et al.
Veröffentlicht: (2026)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
FlowCoMotion: Text-to-Motion Generation via Token-Latent Flow Modeling
von: Guan, Dawei, et al.
Veröffentlicht: (2026)
von: Guan, Dawei, et al.
Veröffentlicht: (2026)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
von: Zhang, Yuanhong, et al.
Veröffentlicht: (2026)
von: Zhang, Yuanhong, et al.
Veröffentlicht: (2026)
AToken: A Unified Tokenizer for Vision
von: Lu, Jiasen, et al.
Veröffentlicht: (2025)
von: Lu, Jiasen, et al.
Veröffentlicht: (2025)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
von: Wang, Guoxin, et al.
Veröffentlicht: (2025)
von: Wang, Guoxin, et al.
Veröffentlicht: (2025)
Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
von: Wang, Weixing, et al.
Veröffentlicht: (2025)
von: Wang, Weixing, et al.
Veröffentlicht: (2025)
TPC: Cross-Temporal Prediction Connection for Vision-Language Model Hallucination Reduction
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
von: Zheng, Dehua, et al.
Veröffentlicht: (2025)
von: Zheng, Dehua, et al.
Veröffentlicht: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
von: Kim, Sohee, et al.
Veröffentlicht: (2025)
von: Kim, Sohee, et al.
Veröffentlicht: (2025)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
von: Apedo, Yvon, et al.
Veröffentlicht: (2026)
von: Apedo, Yvon, et al.
Veröffentlicht: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
von: Luo, Junwei, et al.
Veröffentlicht: (2025)
von: Luo, Junwei, et al.
Veröffentlicht: (2025)
CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models
von: Chen, Xiang, et al.
Veröffentlicht: (2026)
von: Chen, Xiang, et al.
Veröffentlicht: (2026)
2D Gaussian Splatting with Semantic Alignment for Image Inpainting
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models
von: Zhao, Yulin, et al.
Veröffentlicht: (2026)
von: Zhao, Yulin, et al.
Veröffentlicht: (2026)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Rethinking Token Reduction for Large Vision-Language Models
von: Wang, Yi, et al.
Veröffentlicht: (2026) -
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
von: Lu, Zhuqiang, et al.
Veröffentlicht: (2024) -
Token-Level Inference-Time Alignment for Vision-Language Models
von: Chen, Kejia, et al.
Veröffentlicht: (2025) -
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
von: He, Yefei, et al.
Veröffentlicht: (2024) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)