Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Shida, Hua, YongXiang, Tao, Zhou, Cao, Haoyu, Xu, Linli |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
par: Tao, Zhou, et autres
Publié: (2025)
par: Tao, Zhou, et autres
Publié: (2025)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
par: Ma, Yinchao, et autres
Publié: (2026)
par: Ma, Yinchao, et autres
Publié: (2026)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025)
par: Chen, Xueyi, et autres
Publié: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding
par: Wu, Peiran, et autres
Publié: (2025)
par: Wu, Peiran, et autres
Publié: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
par: Qi, Ji, et autres
Publié: (2025)
par: Qi, Ji, et autres
Publié: (2025)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
par: Wang, Mengyue, et autres
Publié: (2025)
par: Wang, Mengyue, et autres
Publié: (2025)
Importance-Based Token Merging for Efficient Image and Video Generation
par: Wu, Haoyu, et autres
Publié: (2024)
par: Wu, Haoyu, et autres
Publié: (2024)
One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
par: Zhang, Zheyu, et autres
Publié: (2026)
par: Zhang, Zheyu, et autres
Publié: (2026)
EarlyTom: Early Token Compression Completes Fast Video Understanding
par: Wang, Hesong, et autres
Publié: (2026)
par: Wang, Hesong, et autres
Publié: (2026)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
par: Tang, Jianting, et autres
Publié: (2025)
par: Tang, Jianting, et autres
Publié: (2025)
DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models
par: Yao, Linli, et autres
Publié: (2024)
par: Yao, Linli, et autres
Publié: (2024)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
par: Qiao, Bingtian, et autres
Publié: (2026)
par: Qiao, Bingtian, et autres
Publié: (2026)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
par: Wang, Yubo, et autres
Publié: (2024)
par: Wang, Yubo, et autres
Publié: (2024)
Principles of Visual Tokens for Efficient Video Understanding
par: Hao, Xinyue, et autres
Publié: (2024)
par: Hao, Xinyue, et autres
Publié: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
par: Cao, Sihan, et autres
Publié: (2026)
par: Cao, Sihan, et autres
Publié: (2026)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
par: Tao, Keda, et autres
Publié: (2024)
par: Tao, Keda, et autres
Publié: (2024)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
par: Zhang, Renshan, et autres
Publié: (2024)
par: Zhang, Renshan, et autres
Publié: (2024)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
par: Wang, Shaobo, et autres
Publié: (2025)
par: Wang, Shaobo, et autres
Publié: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
par: Zhang, Yunzhu, et autres
Publié: (2025)
par: Zhang, Yunzhu, et autres
Publié: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
par: Cho, Janghoon, et autres
Publié: (2025)
par: Cho, Janghoon, et autres
Publié: (2025)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
par: Zhang, Wentao, et autres
Publié: (2024)
par: Zhang, Wentao, et autres
Publié: (2024)
ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding
par: Zhou, Yuan, et autres
Publié: (2025)
par: Zhou, Yuan, et autres
Publié: (2025)
Video Token Merging for Long-form Video Understanding
par: Lee, Seon-Ho, et autres
Publié: (2024)
par: Lee, Seon-Ho, et autres
Publié: (2024)
MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
par: Mao, Junzhu, et autres
Publié: (2025)
par: Mao, Junzhu, et autres
Publié: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
par: Xu, Mingze, et autres
Publié: (2025)
par: Xu, Mingze, et autres
Publié: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
Generative Frame Sampler for Long Video Understanding
par: Yao, Linli, et autres
Publié: (2025)
par: Yao, Linli, et autres
Publié: (2025)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
par: Wang, Junxi, et autres
Publié: (2026)
par: Wang, Junxi, et autres
Publié: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
par: Wei, Yuancheng, et autres
Publié: (2026)
par: Wei, Yuancheng, et autres
Publié: (2026)
Documents similaires
-
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
par: Tao, Zhou, et autres
Publié: (2025) -
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
par: Ma, Yinchao, et autres
Publié: (2026) -
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
par: Sun, Xiaokun, et autres
Publié: (2026) -
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
par: Chen, Xueyi, et autres
Publié: (2025) -
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)