ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Zhaohong, Liu, Wenjing, Zhang, Yuxin, Chao, Fei, Ji, Rongrong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prototype-Based Test-Time Adaptation of Vision-Language Models
por: Huang, Zhaohong, et al.
Publicado: (2026)
por: Huang, Zhaohong, et al.
Publicado: (2026)
GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models
por: Huang, Zhaohong, et al.
Publicado: (2025)
por: Huang, Zhaohong, et al.
Publicado: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
por: Jiang, Pengfei, et al.
Publicado: (2025)
por: Jiang, Pengfei, et al.
Publicado: (2025)
DS$^2$Net: Detail-Semantic Deep Supervision Network for Medical Image Segmentation
por: Huang, Zhaohong, et al.
Publicado: (2025)
por: Huang, Zhaohong, et al.
Publicado: (2025)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
por: Ma, Yiwei, et al.
Publicado: (2025)
por: Ma, Yiwei, et al.
Publicado: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
por: Yan, Yichen, et al.
Publicado: (2025)
por: Yan, Yichen, et al.
Publicado: (2025)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
por: Hwang, Yerin, et al.
Publicado: (2025)
por: Hwang, Yerin, et al.
Publicado: (2025)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
por: Tan, Yifan, et al.
Publicado: (2026)
por: Tan, Yifan, et al.
Publicado: (2026)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs
por: Song, Baiyang, et al.
Publicado: (2026)
por: Song, Baiyang, et al.
Publicado: (2026)
Event-Anchored Frame Selection for Effective Long-Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
por: Zhang, Yunzhu, et al.
Publicado: (2025)
por: Zhang, Yunzhu, et al.
Publicado: (2025)
Learning Image Demoireing from Unpaired Real Data
por: Zhong, Yunshan, et al.
Publicado: (2024)
por: Zhong, Yunshan, et al.
Publicado: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
por: Zhan, Wengyi, et al.
Publicado: (2025)
por: Zhan, Wengyi, et al.
Publicado: (2025)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
por: Zhang, Shuheng, et al.
Publicado: (2025)
por: Zhang, Shuheng, et al.
Publicado: (2025)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
por: Feng, Ze, et al.
Publicado: (2025)
por: Feng, Ze, et al.
Publicado: (2025)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
por: Zhang, Liang, et al.
Publicado: (2024)
por: Zhang, Liang, et al.
Publicado: (2024)
POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
por: Zhu, Lanyun, et al.
Publicado: (2025)
por: Zhu, Lanyun, et al.
Publicado: (2025)
QuadMamba: Learning Quadtree-based Selective Scan for Visual State Space Model
por: Xie, Fei, et al.
Publicado: (2024)
por: Xie, Fei, et al.
Publicado: (2024)
Importance-Based Token Merging for Efficient Image and Video Generation
por: Wu, Haoyu, et al.
Publicado: (2024)
por: Wu, Haoyu, et al.
Publicado: (2024)
ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference
por: Pathak, Surendra, et al.
Publicado: (2026)
por: Pathak, Surendra, et al.
Publicado: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
por: Zhang, Yuan, et al.
Publicado: (2024)
por: Zhang, Yuan, et al.
Publicado: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
por: Zhu, Qihui, et al.
Publicado: (2026)
por: Zhu, Qihui, et al.
Publicado: (2026)
D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
por: Zhang, Evelyn, et al.
Publicado: (2025)
por: Zhang, Evelyn, et al.
Publicado: (2025)
MBQuant: A Novel Multi-Branch Topology Method for Arbitrary Bit-width Network Quantization
por: Zhong, Yunshan, et al.
Publicado: (2023)
por: Zhong, Yunshan, et al.
Publicado: (2023)
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
por: Zhuang, Xianwei, et al.
Publicado: (2025)
por: Zhuang, Xianwei, et al.
Publicado: (2025)
Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction
por: Zhong, Yunshan, et al.
Publicado: (2024)
por: Zhong, Yunshan, et al.
Publicado: (2024)
TR-PTS: Task-Relevant Parameter and Token Selection for Efficient Tuning
por: Luo, Siqi, et al.
Publicado: (2025)
por: Luo, Siqi, et al.
Publicado: (2025)
Selective Visual Prompting in Vision Mamba
por: Yao, Yifeng, et al.
Publicado: (2024)
por: Yao, Yifeng, et al.
Publicado: (2024)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
por: Cai, Kaitong, et al.
Publicado: (2025)
por: Cai, Kaitong, et al.
Publicado: (2025)
AIR-HLoc: Adaptive Retrieved Images Selection for Efficient Visual Localisation
por: Liu, Changkun, et al.
Publicado: (2024)
por: Liu, Changkun, et al.
Publicado: (2024)
ToSA: Token Selective Attention for Efficient Vision Transformers
por: Singh, Manish Kumar, et al.
Publicado: (2024)
por: Singh, Manish Kumar, et al.
Publicado: (2024)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
por: Zhong, Yunshan, et al.
Publicado: (2024)
por: Zhong, Yunshan, et al.
Publicado: (2024)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
por: Hu, Junshan, et al.
Publicado: (2025)
por: Hu, Junshan, et al.
Publicado: (2025)
Fwd2Bot: LVLM Visual Token Compression with Double Forward Bottleneck
por: Bulat, Adrian, et al.
Publicado: (2025)
por: Bulat, Adrian, et al.
Publicado: (2025)
Select2Col: Leveraging Spatial-Temporal Importance of Semantic Information for Efficient Collaborative Perception
por: Liu, Yuntao, et al.
Publicado: (2023)
por: Liu, Yuntao, et al.
Publicado: (2023)
Jump-teaching: Combating Sample Selection Bias via Temporal Disagreement
por: Ji, Kangye, et al.
Publicado: (2024)
por: Ji, Kangye, et al.
Publicado: (2024)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
por: Cho, Beomsik, et al.
Publicado: (2025)
por: Cho, Beomsik, et al.
Publicado: (2025)
Ejemplares similares
-
Prototype-Based Test-Time Adaptation of Vision-Language Models
por: Huang, Zhaohong, et al.
Publicado: (2026) -
GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models
por: Huang, Zhaohong, et al.
Publicado: (2025) -
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
por: Jiang, Pengfei, et al.
Publicado: (2025) -
DS$^2$Net: Detail-Semantic Deep Supervision Network for Medical Image Segmentation
por: Huang, Zhaohong, et al.
Publicado: (2025) -
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
por: Ma, Yiwei, et al.
Publicado: (2025)