V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Xinying, Liu, Xuyang, Wang, Yiyu, Ma, Teng, Ren, Wenqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
di: Liu, Xuyang, et al.
Pubblicazione: (2025)
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
di: Wang, Yiyu, et al.
Pubblicazione: (2025)
di: Wang, Yiyu, et al.
Pubblicazione: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
di: Zhuang, Weijun, et al.
Pubblicazione: (2026)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
di: Wang, Jiankang, et al.
Pubblicazione: (2025)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
di: Li, Sheng, et al.
Pubblicazione: (2026)
di: Li, Sheng, et al.
Pubblicazione: (2026)
ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models
di: Xia, Yingjie, et al.
Pubblicazione: (2025)
di: Xia, Yingjie, et al.
Pubblicazione: (2025)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
di: Kumar, Yogesh
Pubblicazione: (2025)
di: Kumar, Yogesh
Pubblicazione: (2025)
CAST: Modeling Visual State Transitions for Consistent Video Retrieval
di: Liu, Yanqing, et al.
Pubblicazione: (2026)
di: Liu, Yanqing, et al.
Pubblicazione: (2026)
Video-Language Alignment via Spatio-Temporal Graph Transformer
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2024)
CAST: Cross-Attentive Spatio-Temporal feature fusion for deepfake detection
di: Thakre, Aryan, et al.
Pubblicazione: (2025)
di: Thakre, Aryan, et al.
Pubblicazione: (2025)
Spatio-Temporal Distortion Aware Omnidirectional Video Super-Resolution
di: An, Hongyu, et al.
Pubblicazione: (2024)
di: An, Hongyu, et al.
Pubblicazione: (2024)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
di: Li, Peiyan, et al.
Pubblicazione: (2026)
di: Li, Peiyan, et al.
Pubblicazione: (2026)
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
di: Fu, Honghao, et al.
Pubblicazione: (2026)
di: Fu, Honghao, et al.
Pubblicazione: (2026)
VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
di: Meng, Jiahao, et al.
Pubblicazione: (2026)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
di: Sha, Lin, et al.
Pubblicazione: (2026)
di: Sha, Lin, et al.
Pubblicazione: (2026)
Vulnerability-Aware Spatio-Temporal Learning for Generalizable Deepfake Video Detection
di: Nguyen, Dat, et al.
Pubblicazione: (2025)
di: Nguyen, Dat, et al.
Pubblicazione: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
di: Cao, Tri, et al.
Pubblicazione: (2026)
di: Cao, Tri, et al.
Pubblicazione: (2026)
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
di: Tang, Linfeng, et al.
Pubblicazione: (2025)
di: Tang, Linfeng, et al.
Pubblicazione: (2025)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
di: Sugandhika, Chinthani, et al.
Pubblicazione: (2025)
Spatio-Temporal Correlation Guided Geometric Partitioning for Versatile Video Coding
di: Meng, Xuewei, et al.
Pubblicazione: (2026)
di: Meng, Xuewei, et al.
Pubblicazione: (2026)
Efficient Video Face Enhancement with Enhanced Spatial-Temporal Consistency
di: Wang, Yutong, et al.
Pubblicazione: (2024)
di: Wang, Yutong, et al.
Pubblicazione: (2024)
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
di: Li, Jiameng, et al.
Pubblicazione: (2026)
di: Li, Jiameng, et al.
Pubblicazione: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
STGV: Spatio-Temporal Hash Encoding for Gaussian-based Video Representation
di: Lin, Jierun, et al.
Pubblicazione: (2026)
di: Lin, Jierun, et al.
Pubblicazione: (2026)
VideoMamba: Spatio-Temporal Selective State Space Model
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
Context-Guided Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
CAST: Cross-Attention in Space and Time for Video Action Recognition
di: Lee, Dongho, et al.
Pubblicazione: (2023)
di: Lee, Dongho, et al.
Pubblicazione: (2023)
SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled Videos
di: Jiao, Yingying, et al.
Pubblicazione: (2025)
di: Jiao, Yingying, et al.
Pubblicazione: (2025)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
di: Guo, Yanan, et al.
Pubblicazione: (2025)
di: Guo, Yanan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
di: Liu, Xuyang, et al.
Pubblicazione: (2025) -
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
di: Wang, Yiyu, et al.
Pubblicazione: (2025) -
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025) -
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
di: Zhuang, Weijun, et al.
Pubblicazione: (2026) -
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
di: Xu, Wenhao, et al.
Pubblicazione: (2025)