Towards Lossless Ultimate Vision Token Compression for VLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Dehua, Huang, Mouxiao, Jiang, Borui, Hu, Hailin, Chen, Xinghao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
por: Huang, Mouxiao, et al.
Publicado: (2025)
por: Huang, Mouxiao, et al.
Publicado: (2025)
Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models
por: Zhao, Yulin, et al.
Publicado: (2026)
por: Zhao, Yulin, et al.
Publicado: (2026)
Compression for Better: A General and Stable Lossless Compression Framework
por: Zhang, Boyang, et al.
Publicado: (2024)
por: Zhang, Boyang, et al.
Publicado: (2024)
Single Domain Generalization for Few-Shot Counting via Universal Representation Matching
por: Chen, Xianing, et al.
Publicado: (2025)
por: Chen, Xianing, et al.
Publicado: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
por: Jiang, Jindong, et al.
Publicado: (2026)
por: Jiang, Jindong, et al.
Publicado: (2026)
LINR-PCGC: Lossless Implicit Neural Representations for Point Cloud Geometry Compression
por: Huang, Wenjie, et al.
Publicado: (2025)
por: Huang, Wenjie, et al.
Publicado: (2025)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025)
por: Zhang, Yiman, et al.
Publicado: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
por: Wang, Huanyu, et al.
Publicado: (2025)
por: Wang, Huanyu, et al.
Publicado: (2025)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
por: Clark, Christopher, et al.
Publicado: (2026)
por: Clark, Christopher, et al.
Publicado: (2026)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
por: Berman, Shmuel, et al.
Publicado: (2025)
por: Berman, Shmuel, et al.
Publicado: (2025)
TinySAM 2: Extreme Memory Compression for Efficient Track Anything Model
por: Ding, Zhaoyuan, et al.
Publicado: (2026)
por: Ding, Zhaoyuan, et al.
Publicado: (2026)
Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption
por: Erol, Mehmet Kaan
Publicado: (2026)
por: Erol, Mehmet Kaan
Publicado: (2026)
D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition
por: Huang, Yiyang, et al.
Publicado: (2025)
por: Huang, Yiyang, et al.
Publicado: (2025)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
por: Li, Jianjian, et al.
Publicado: (2025)
por: Li, Jianjian, et al.
Publicado: (2025)
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
por: Kang, Inha, et al.
Publicado: (2025)
por: Kang, Inha, et al.
Publicado: (2025)
AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors
por: Zhang, Junyang, et al.
Publicado: (2025)
por: Zhang, Junyang, et al.
Publicado: (2025)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
por: Feng, Qianhan, et al.
Publicado: (2024)
por: Feng, Qianhan, et al.
Publicado: (2024)
Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details
por: Lai, Zeqiang, et al.
Publicado: (2025)
por: Lai, Zeqiang, et al.
Publicado: (2025)
Enhancing Subsequent Video Retrieval via Vision-Language Models (VLMs)
por: Duan, Yicheng, et al.
Publicado: (2025)
por: Duan, Yicheng, et al.
Publicado: (2025)
Nearly Lossless Adaptive Bit Switching
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
por: Ni, Zhenliang, et al.
Publicado: (2025)
por: Ni, Zhenliang, et al.
Publicado: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
por: Zhang, Qizhe, et al.
Publicado: (2024)
por: Zhang, Qizhe, et al.
Publicado: (2024)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
por: Ma, Yinchao, et al.
Publicado: (2026)
por: Ma, Yinchao, et al.
Publicado: (2026)
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)
por: Liang, Xiaoyu, et al.
Publicado: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
por: Zhang, Xinwei, et al.
Publicado: (2026)
por: Zhang, Xinwei, et al.
Publicado: (2026)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
por: Chen, Kaitao, et al.
Publicado: (2025)
por: Chen, Kaitao, et al.
Publicado: (2025)
Highly Compressed Tokenizer Can Generate Without Training
por: Beyer, L. Lao, et al.
Publicado: (2025)
por: Beyer, L. Lao, et al.
Publicado: (2025)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Evaluating Vision Language Models (VLMs) for Radiology: A Comprehensive Analysis
por: Li, Frank, et al.
Publicado: (2025)
por: Li, Frank, et al.
Publicado: (2025)
Token-Level Inference-Time Alignment for Vision-Language Models
por: Chen, Kejia, et al.
Publicado: (2025)
por: Chen, Kejia, et al.
Publicado: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
por: Wu, Yecheng, et al.
Publicado: (2025)
por: Wu, Yecheng, et al.
Publicado: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
por: Meng, Yu, et al.
Publicado: (2025)
por: Meng, Yu, et al.
Publicado: (2025)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
por: Wang, Guoxin, et al.
Publicado: (2025)
por: Wang, Guoxin, et al.
Publicado: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning
por: Xu, Zhaoqi, et al.
Publicado: (2025)
por: Xu, Zhaoqi, et al.
Publicado: (2025)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
por: Xu, Xuwei, et al.
Publicado: (2023)
por: Xu, Xuwei, et al.
Publicado: (2023)
Mixed Signals: Decoding VLMs' Reasoning and Underlying Bias in Vision-Language Conflict
por: Pezeshkpour, Pouya, et al.
Publicado: (2025)
por: Pezeshkpour, Pouya, et al.
Publicado: (2025)
DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs
por: Kukreja, Dikshant, et al.
Publicado: (2026)
por: Kukreja, Dikshant, et al.
Publicado: (2026)
Ejemplares similares
-
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
por: Huang, Mouxiao, et al.
Publicado: (2025) -
Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models
por: Zhao, Yulin, et al.
Publicado: (2026) -
Compression for Better: A General and Stable Lossless Compression Framework
por: Zhang, Boyang, et al.
Publicado: (2024) -
Single Domain Generalization for Few-Shot Counting via Universal Representation Matching
por: Chen, Xianing, et al.
Publicado: (2025) -
Stateful Token Reduction for Long-Video Hybrid VLMs
por: Jiang, Jindong, et al.
Publicado: (2026)