Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yiyu, Liu, Xuyang, Gui, Xiyan, Lin, Xinying, Yang, Boxue, Liao, Chenfei, Chen, Tailai, Zhang, Linfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
por: Wen, Zichen, et al.
Publicado: (2026)
por: Wen, Zichen, et al.
Publicado: (2026)
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
por: Lin, Xinying, et al.
Publicado: (2026)
por: Lin, Xinying, et al.
Publicado: (2026)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
por: Ke, Junlong, et al.
Publicado: (2026)
por: Ke, Junlong, et al.
Publicado: (2026)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
por: Liao, Chenfei, et al.
Publicado: (2025)
por: Liao, Chenfei, et al.
Publicado: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
AI for Service: Proactive Assistance with AI Glasses
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models
por: Huang, Haifeng, et al.
Publicado: (2026)
por: Huang, Haifeng, et al.
Publicado: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
por: Chen, Xueyi, et al.
Publicado: (2025)
por: Chen, Xueyi, et al.
Publicado: (2025)
Accelerating Diffusion Transformers with Token-wise Feature Caching
por: Zou, Chang, et al.
Publicado: (2024)
por: Zou, Chang, et al.
Publicado: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
por: Tan, Xudong, et al.
Publicado: (2025)
por: Tan, Xudong, et al.
Publicado: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
por: Guo, Yansong, et al.
Publicado: (2026)
por: Guo, Yansong, et al.
Publicado: (2026)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
por: Han, Yuhang, et al.
Publicado: (2024)
por: Han, Yuhang, et al.
Publicado: (2024)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
por: Tao, Keda, et al.
Publicado: (2024)
por: Tao, Keda, et al.
Publicado: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
por: Wang, Junxi, et al.
Publicado: (2026)
por: Wang, Junxi, et al.
Publicado: (2026)
Streaming Long Video Understanding with Large Language Models
por: Qian, Rui, et al.
Publicado: (2024)
por: Qian, Rui, et al.
Publicado: (2024)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
por: Yang, Yantai, et al.
Publicado: (2025)
por: Yang, Yantai, et al.
Publicado: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
por: Cao, Sihan, et al.
Publicado: (2026)
por: Cao, Sihan, et al.
Publicado: (2026)
VideoLLM-online: Online Video Large Language Model for Streaming Video
por: Chen, Joya, et al.
Publicado: (2024)
por: Chen, Joya, et al.
Publicado: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
por: Zeng, Sen, et al.
Publicado: (2026)
por: Zeng, Sen, et al.
Publicado: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
por: Zhou, Ziqin, et al.
Publicado: (2025)
por: Zhou, Ziqin, et al.
Publicado: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
por: Shao, Kele, et al.
Publicado: (2025)
por: Shao, Kele, et al.
Publicado: (2025)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
por: Kang, Hyolim, et al.
Publicado: (2025)
por: Kang, Hyolim, et al.
Publicado: (2025)
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
por: Liu, Xinxin, et al.
Publicado: (2026)
por: Liu, Xinxin, et al.
Publicado: (2026)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026)
por: Kang, Minseok, et al.
Publicado: (2026)
HPC: Hierarchical Point-based Latent Representation for Streaming Dynamic Gaussian Splatting Compression
por: Ma, Yangzhi, et al.
Publicado: (2026)
por: Ma, Yangzhi, et al.
Publicado: (2026)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
por: Lyu, Yuanhuiyi, et al.
Publicado: (2025)
por: Lyu, Yuanhuiyi, et al.
Publicado: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
por: Lan, Xiaohan, et al.
Publicado: (2024)
por: Lan, Xiaohan, et al.
Publicado: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
4DGCPro: Efficient Hierarchical 4D Gaussian Compression for Progressive Volumetric Video Streaming
por: Zheng, Zihan, et al.
Publicado: (2025)
por: Zheng, Zihan, et al.
Publicado: (2025)
Vision-centric Token Compression in Large Language Model
por: Xing, Ling, et al.
Publicado: (2025)
por: Xing, Ling, et al.
Publicado: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
por: Jin, Xinqi, et al.
Publicado: (2025)
por: Jin, Xinqi, et al.
Publicado: (2025)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
por: Shao, Kele, et al.
Publicado: (2025)
por: Shao, Kele, et al.
Publicado: (2025)
Aligning Effective Tokens with Video Anomaly in Large Language Models
por: Chen, Yingxian, et al.
Publicado: (2025)
por: Chen, Yingxian, et al.
Publicado: (2025)
Hierarchical Frequency-based Upsampling and Refining for Compressed Video Quality Enhancement
por: Zhang, Qianyu, et al.
Publicado: (2024)
por: Zhang, Qianyu, et al.
Publicado: (2024)
Ejemplares similares
-
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
por: Liu, Xuyang, et al.
Publicado: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
por: Wen, Zichen, et al.
Publicado: (2026) -
Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025) -
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
por: Lin, Xinying, et al.
Publicado: (2026) -
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
por: Ke, Junlong, et al.
Publicado: (2026)