Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yiyu, Liu, Xuyang, Gui, Xiyan, Lin, Xinying, Yang, Boxue, Liao, Chenfei, Chen, Tailai, Zhang, Linfeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
von: Lin, Xinying, et al.
Veröffentlicht: (2026)
von: Lin, Xinying, et al.
Veröffentlicht: (2026)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
von: Liao, Chenfei, et al.
Veröffentlicht: (2025)
von: Liao, Chenfei, et al.
Veröffentlicht: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
AI for Service: Proactive Assistance with AI Glasses
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
von: Han, Yuhang, et al.
Veröffentlicht: (2026)
von: Han, Yuhang, et al.
Veröffentlicht: (2026)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
von: Huang, Haifeng, et al.
Veröffentlicht: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
von: Chen, Xueyi, et al.
Veröffentlicht: (2025)
Accelerating Diffusion Transformers with Token-wise Feature Caching
von: Zou, Chang, et al.
Veröffentlicht: (2024)
von: Zou, Chang, et al.
Veröffentlicht: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
von: Han, Yuhang, et al.
Veröffentlicht: (2024)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
von: Tao, Keda, et al.
Veröffentlicht: (2024)
von: Tao, Keda, et al.
Veröffentlicht: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
von: Wang, Junxi, et al.
Veröffentlicht: (2026)
von: Wang, Junxi, et al.
Veröffentlicht: (2026)
Streaming Long Video Understanding with Large Language Models
von: Qian, Rui, et al.
Veröffentlicht: (2024)
von: Qian, Rui, et al.
Veröffentlicht: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
von: Liu, Xuyang, et al.
Veröffentlicht: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
VideoLLM-online: Online Video Large Language Model for Streaming Video
von: Chen, Joya, et al.
Veröffentlicht: (2024)
von: Chen, Joya, et al.
Veröffentlicht: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
von: Kang, Hyolim, et al.
Veröffentlicht: (2025)
von: Kang, Hyolim, et al.
Veröffentlicht: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
von: Liu, Xinxin, et al.
Veröffentlicht: (2026)
von: Liu, Xinxin, et al.
Veröffentlicht: (2026)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression
von: Ma, Yangzhi, et al.
Veröffentlicht: (2026)
von: Ma, Yangzhi, et al.
Veröffentlicht: (2026)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
von: Lyu, Yuanhuiyi, et al.
Veröffentlicht: (2025)
von: Lyu, Yuanhuiyi, et al.
Veröffentlicht: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
von: Lan, Xiaohan, et al.
Veröffentlicht: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
4DGCPro: Efficient Hierarchical 4D Gaussian Compression for Progressive Volumetric Video Streaming
von: Zheng, Zihan, et al.
Veröffentlicht: (2025)
von: Zheng, Zihan, et al.
Veröffentlicht: (2025)
Vision-centric Token Compression in Large Language Model
von: Xing, Ling, et al.
Veröffentlicht: (2025)
von: Xing, Ling, et al.
Veröffentlicht: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
Aligning Effective Tokens with Video Anomaly in Large Language Models
von: Chen, Yingxian, et al.
Veröffentlicht: (2025)
von: Chen, Yingxian, et al.
Veröffentlicht: (2025)
Hierarchical Frequency-based Upsampling and Refining for Compressed Video Quality Enhancement
von: Zhang, Qianyu, et al.
Veröffentlicht: (2024)
von: Zhang, Qianyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
von: Wen, Zichen, et al.
Veröffentlicht: (2026) -
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
von: Liu, Xuyang, et al.
Veröffentlicht: (2025) -
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
von: Lin, Xinying, et al.
Veröffentlicht: (2026) -
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
von: Ke, Junlong, et al.
Veröffentlicht: (2026)