Rethinking Token Reduction for Large Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yi, Zhang, Haofei, Huang, Qihan, Cao, Anda, Fang, Gongfan, Wang, Wei, Jin, Xuan, Song, Jie, Song, Mingli, Wang, Xinchao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
On the Concept Trustworthiness in Concept Bottleneck Models
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
von: Shen, Chengchao, et al.
Veröffentlicht: (2025)
von: Shen, Chengchao, et al.
Veröffentlicht: (2025)
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
von: Huang, Qihan, et al.
Veröffentlicht: (2025)
von: Huang, Qihan, et al.
Veröffentlicht: (2025)
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
von: Xue, Mengqi, et al.
Veröffentlicht: (2022)
von: Xue, Mengqi, et al.
Veröffentlicht: (2022)
LG-CAV: Train Any Concept Activation Vector with Language Guidance
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
Knowledge Amalgamation for Object Detection with Transformers
von: Zhang, Haofei, et al.
Veröffentlicht: (2022)
von: Zhang, Haofei, et al.
Veröffentlicht: (2022)
Isomorphic Pruning for Vision Models
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
In-Video Instructions: Visual Signals as Generative Control
von: Fang, Gongfan, et al.
Veröffentlicht: (2025)
von: Fang, Gongfan, et al.
Veröffentlicht: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient
von: Chen, Zigeng, et al.
Veröffentlicht: (2024)
von: Chen, Zigeng, et al.
Veröffentlicht: (2024)
SlimSAM: 0.1% Data Makes Segment Anything Slim
von: Chen, Zigeng, et al.
Veröffentlicht: (2023)
von: Chen, Zigeng, et al.
Veröffentlicht: (2023)
PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning
von: Wang, Song, et al.
Veröffentlicht: (2025)
von: Wang, Song, et al.
Veröffentlicht: (2025)
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
von: Tang, Siao, et al.
Veröffentlicht: (2026)
von: Tang, Siao, et al.
Veröffentlicht: (2026)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
von: Zhang, Ce, et al.
Veröffentlicht: (2025)
von: Zhang, Ce, et al.
Veröffentlicht: (2025)
Evolutionary Negative Module Pruning for Better LoRA Merging
von: Cao, Anda, et al.
Veröffentlicht: (2026)
von: Cao, Anda, et al.
Veröffentlicht: (2026)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
von: Chen, Zigeng, et al.
Veröffentlicht: (2024)
von: Chen, Zigeng, et al.
Veröffentlicht: (2024)
Introducing Visual Perception Token into Multimodal Large Language Model
von: Yu, Runpeng, et al.
Veröffentlicht: (2025)
von: Yu, Runpeng, et al.
Veröffentlicht: (2025)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
von: Tang, Siao, et al.
Veröffentlicht: (2025)
von: Tang, Siao, et al.
Veröffentlicht: (2025)
TinyFusion: Diffusion Transformers Learned Shallow
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
von: Wang, Jiayu, et al.
Veröffentlicht: (2025)
von: Wang, Jiayu, et al.
Veröffentlicht: (2025)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
von: Ma, Xinyin, et al.
Veröffentlicht: (2024)
von: Ma, Xinyin, et al.
Veröffentlicht: (2024)
Attention Prompting on Image for Large Vision-Language Models
von: Yu, Runpeng, et al.
Veröffentlicht: (2024)
von: Yu, Runpeng, et al.
Veröffentlicht: (2024)
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
von: Liu, Kejia, et al.
Veröffentlicht: (2026)
von: Liu, Kejia, et al.
Veröffentlicht: (2026)
Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
von: Huang, Qihan, et al.
Veröffentlicht: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
Token-Level Inference-Time Alignment for Vision-Language Models
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
ApET: Approximation-Error Guided Token Compression for Efficient VLMs
von: Ma, Qiankun, et al.
Veröffentlicht: (2026)
von: Ma, Qiankun, et al.
Veröffentlicht: (2026)
$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation
von: Wang, Ruizhi, et al.
Veröffentlicht: (2026)
von: Wang, Ruizhi, et al.
Veröffentlicht: (2026)
Failures to Surface Harmful Contents in Video Large Language Models
von: Cao, Yuxin, et al.
Veröffentlicht: (2025)
von: Cao, Yuxin, et al.
Veröffentlicht: (2025)
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
Dataset Ownership Verification in Contrastive Pre-trained Models
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
von: Wang, Song, et al.
Veröffentlicht: (2025)
von: Wang, Song, et al.
Veröffentlicht: (2025)
Sampling-Aware Quantization for Diffusion Models
von: Zeng, Qian, et al.
Veröffentlicht: (2025)
von: Zeng, Qian, et al.
Veröffentlicht: (2025)
Training-free Token Reduction for Vision Mamba
von: Ma, Qiankun, et al.
Veröffentlicht: (2025)
von: Ma, Qiankun, et al.
Veröffentlicht: (2025)
Angle Robustness Unmanned Aerial Vehicle Navigation in GNSS-Denied Scenarios
von: Wang, Yuxin, et al.
Veröffentlicht: (2024)
von: Wang, Yuxin, et al.
Veröffentlicht: (2024)
Training-Free Pretrained Model Merging
von: Xu, Zhengqi, et al.
Veröffentlicht: (2024)
von: Xu, Zhengqi, et al.
Veröffentlicht: (2024)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
von: Li, Xu, et al.
Veröffentlicht: (2025)
von: Li, Xu, et al.
Veröffentlicht: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
On the Concept Trustworthiness in Concept Bottleneck Models
von: Huang, Qihan, et al.
Veröffentlicht: (2024) -
Diversity-Guided MLP Reduction for Efficient Large Vision Transformers
von: Shen, Chengchao, et al.
Veröffentlicht: (2025) -
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
von: Huang, Qihan, et al.
Veröffentlicht: (2025) -
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
von: Xue, Mengqi, et al.
Veröffentlicht: (2022) -
LG-CAV: Train Any Concept Activation Vector with Language Guidance
von: Huang, Qihan, et al.
Veröffentlicht: (2024)