Object-Centric Vision Token Pruning for Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Guangyuan, Zhao, Rongzhen, Deng, Jinhong, Wang, Yanbo, Pajarinen, Joni |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vector-Quantized Vision Foundation Models for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2025)
por: Zhao, Rongzhen, et al.
Publicado: (2025)
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence
por: Li, Zhiyuan, et al.
Publicado: (2026)
por: Li, Zhiyuan, et al.
Publicado: (2026)
Organized Grouped Discrete Representation for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2024)
por: Zhao, Rongzhen, et al.
Publicado: (2024)
Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization
por: Zhao, Rongzhen, et al.
Publicado: (2026)
por: Zhao, Rongzhen, et al.
Publicado: (2026)
Grouped Discrete Representation for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2024)
por: Zhao, Rongzhen, et al.
Publicado: (2024)
Cycle Consistency in Video Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2026)
por: Zhao, Rongzhen, et al.
Publicado: (2026)
Grouped Discrete Representation Guides Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2024)
por: Zhao, Rongzhen, et al.
Publicado: (2024)
MetaSlot: Break Through the Fixed Number of Slots in Object-Centric Learning
por: Liu, Hongjia, et al.
Publicado: (2025)
por: Liu, Hongjia, et al.
Publicado: (2025)
RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
por: Moshtaghi, Mehdi, et al.
Publicado: (2025)
por: Moshtaghi, Mehdi, et al.
Publicado: (2025)
Multi-Scale Fusion for Object Representation
por: Zhao, Rongzhen, et al.
Publicado: (2024)
por: Zhao, Rongzhen, et al.
Publicado: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
por: Li, Ao, et al.
Publicado: (2025)
por: Li, Ao, et al.
Publicado: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
por: Wang, Xinhao, et al.
Publicado: (2026)
por: Wang, Xinhao, et al.
Publicado: (2026)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
por: Lee, Dong-Jae, et al.
Publicado: (2026)
por: Lee, Dong-Jae, et al.
Publicado: (2026)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
por: Meng, Yu, et al.
Publicado: (2025)
por: Meng, Yu, et al.
Publicado: (2025)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
por: Li, Kaiyuan, et al.
Publicado: (2025)
por: Li, Kaiyuan, et al.
Publicado: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
por: Sha, Lin, et al.
Publicado: (2026)
por: Sha, Lin, et al.
Publicado: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
por: Apedo, Yvon, et al.
Publicado: (2026)
por: Apedo, Yvon, et al.
Publicado: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
por: He, Jialuo, et al.
Publicado: (2026)
por: He, Jialuo, et al.
Publicado: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Predicting Video Slot Attention Queries from Random Slot-Feature Pairs
por: Zhao, Rongzhen, et al.
Publicado: (2025)
por: Zhao, Rongzhen, et al.
Publicado: (2025)
Exploring Token Pruning in Vision State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
por: Ma, Jie, et al.
Publicado: (2026)
por: Ma, Jie, et al.
Publicado: (2026)
VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
por: Ji, Huawei, et al.
Publicado: (2026)
por: Ji, Huawei, et al.
Publicado: (2026)
Slot Attention with Re-Initialization and Self-Distillation
por: Zhao, Rongzhen, et al.
Publicado: (2025)
por: Zhao, Rongzhen, et al.
Publicado: (2025)
Smoothing Slot Attention Iterations and Recurrences
por: Zhao, Rongzhen, et al.
Publicado: (2025)
por: Zhao, Rongzhen, et al.
Publicado: (2025)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
por: Son, Jaemin, et al.
Publicado: (2025)
por: Son, Jaemin, et al.
Publicado: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Rethinking Token Reduction for Large Vision-Language Models
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
Token Pruning using a Lightweight Background Aware Vision Transformer
por: Sah, Sudhakar, et al.
Publicado: (2024)
por: Sah, Sudhakar, et al.
Publicado: (2024)
Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models
por: Zhao, Yulin, et al.
Publicado: (2026)
por: Zhao, Yulin, et al.
Publicado: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
por: Luo, Junwei, et al.
Publicado: (2025)
por: Luo, Junwei, et al.
Publicado: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
por: Li, Yuchen, et al.
Publicado: (2026)
por: Li, Yuchen, et al.
Publicado: (2026)
HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models
por: Bai, Lincen, et al.
Publicado: (2026)
por: Bai, Lincen, et al.
Publicado: (2026)
FoPru: Focal Pruning for Efficient Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2024)
por: Jiang, Lei, et al.
Publicado: (2024)
Egocentric Bias in Vision-Language Models
por: Wang, Maijunxian, et al.
Publicado: (2026)
por: Wang, Maijunxian, et al.
Publicado: (2026)
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
por: Seo, Hoigi, et al.
Publicado: (2025)
por: Seo, Hoigi, et al.
Publicado: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
por: Huang, Mingzhe, et al.
Publicado: (2026)
por: Huang, Mingzhe, et al.
Publicado: (2026)
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)
por: Liang, Xiaoyu, et al.
Publicado: (2025)
Ejemplares similares
-
Vector-Quantized Vision Foundation Models for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2025) -
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence
por: Li, Zhiyuan, et al.
Publicado: (2026) -
Organized Grouped Discrete Representation for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2024) -
Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization
por: Zhao, Rongzhen, et al.
Publicado: (2026) -
Grouped Discrete Representation for Object-Centric Learning
por: Zhao, Rongzhen, et al.
Publicado: (2024)