Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yiyu, Liu, Xuyang, Gui, Xiyan, Lin, Xinying, Yang, Boxue, Liao, Chenfei, Chen, Tailai, Zhang, Linfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026)
di: Lin, Xinying, et al.
Pubblicazione: (2026)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
di: Ke, Junlong, et al.
Pubblicazione: (2026)
di: Ke, Junlong, et al.
Pubblicazione: (2026)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
AI for Service: Proactive Assistance with AI Glasses
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
di: Han, Yuhang, et al.
Pubblicazione: (2026)
di: Han, Yuhang, et al.
Pubblicazione: (2026)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
Accelerating Diffusion Transformers with Token-wise Feature Caching
di: Zou, Chang, et al.
Pubblicazione: (2024)
di: Zou, Chang, et al.
Pubblicazione: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
di: Guo, Yansong, et al.
Pubblicazione: (2026)
di: Guo, Yansong, et al.
Pubblicazione: (2026)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
di: Han, Yuhang, et al.
Pubblicazione: (2024)
di: Han, Yuhang, et al.
Pubblicazione: (2024)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2024)
di: Tao, Keda, et al.
Pubblicazione: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
di: Yang, Yantai, et al.
Pubblicazione: (2025)
di: Yang, Yantai, et al.
Pubblicazione: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
VideoLLM-online: Online Video Large Language Model for Streaming Video
di: Chen, Joya, et al.
Pubblicazione: (2024)
di: Chen, Joya, et al.
Pubblicazione: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
di: Zeng, Sen, et al.
Pubblicazione: (2026)
di: Zeng, Sen, et al.
Pubblicazione: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
di: Zhou, Ziqin, et al.
Pubblicazione: (2025)
di: Zhou, Ziqin, et al.
Pubblicazione: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
di: Kang, Hyolim, et al.
Pubblicazione: (2025)
di: Kang, Hyolim, et al.
Pubblicazione: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
di: Kang, Minseok, et al.
Pubblicazione: (2026)
di: Kang, Minseok, et al.
Pubblicazione: (2026)
HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression
di: Ma, Yangzhi, et al.
Pubblicazione: (2026)
di: Ma, Yangzhi, et al.
Pubblicazione: (2026)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
4DGCPro: Efficient Hierarchical 4D Gaussian Compression for Progressive Volumetric Video Streaming
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
di: Zheng, Zihan, et al.
Pubblicazione: (2025)
Vision-centric Token Compression in Large Language Model
di: Xing, Ling, et al.
Pubblicazione: (2025)
di: Xing, Ling, et al.
Pubblicazione: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
Aligning Effective Tokens with Video Anomaly in Large Language Models
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
di: Chen, Yingxian, et al.
Pubblicazione: (2025)
Hierarchical Frequency-based Upsampling and Refining for Compressed Video Quality Enhancement
di: Zhang, Qianyu, et al.
Pubblicazione: (2024)
di: Zhang, Qianyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
di: Wen, Zichen, et al.
Pubblicazione: (2026) -
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025) -
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
di: Lin, Xinying, et al.
Pubblicazione: (2026) -
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
di: Ke, Junlong, et al.
Pubblicazione: (2026)