VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Ruanjun, Tan, Yuedong, Shi, Yuanming, Shao, Jiawei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What You Have is What You Track: Adaptive and Robust Multimodal Tracking
di: Tan, Yuedong, et al.
Pubblicazione: (2025)
di: Tan, Yuedong, et al.
Pubblicazione: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026)
di: Liu, Jinming, et al.
Pubblicazione: (2026)
Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery
di: Menn, Dennis, et al.
Pubblicazione: (2026)
di: Menn, Dennis, et al.
Pubblicazione: (2026)
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
di: Ma, Junpeng, et al.
Pubblicazione: (2026)
di: Ma, Junpeng, et al.
Pubblicazione: (2026)
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
M-LLM Based Video Frame Selection for Efficient Video Understanding
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval
di: Ning, Zhenyu, et al.
Pubblicazione: (2025)
di: Ning, Zhenyu, et al.
Pubblicazione: (2025)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
Frame by Familiar Frame: Understanding Replication in Video Diffusion Models
di: Rahman, Aimon, et al.
Pubblicazione: (2024)
di: Rahman, Aimon, et al.
Pubblicazione: (2024)
Making Every Frame Matter: Continuous Activity Recognition in Streaming Video via Adaptive Video Context Modeling
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions
di: Liu, Zihao, et al.
Pubblicazione: (2026)
di: Liu, Zihao, et al.
Pubblicazione: (2026)
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
Shot-Aware Frame Sampling for Video Understanding
di: Zhao, Mengyu, et al.
Pubblicazione: (2026)
di: Zhao, Mengyu, et al.
Pubblicazione: (2026)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding
di: Wu, Hang, et al.
Pubblicazione: (2026)
di: Wu, Hang, et al.
Pubblicazione: (2026)
LADDER: An Efficient Framework for Video Frame Interpolation
di: Shen, Tong, et al.
Pubblicazione: (2024)
di: Shen, Tong, et al.
Pubblicazione: (2024)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
Improving LLM Video Understanding with 16 Frames Per Second
di: Li, Yixuan, et al.
Pubblicazione: (2025)
di: Li, Yixuan, et al.
Pubblicazione: (2025)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
Learning Streaming Video Representation via Multitask Training
di: Yan, Yibin, et al.
Pubblicazione: (2025)
di: Yan, Yibin, et al.
Pubblicazione: (2025)
Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
di: Qi, Ji, et al.
Pubblicazione: (2025)
di: Qi, Ji, et al.
Pubblicazione: (2025)
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024)
di: You, Zeng, et al.
Pubblicazione: (2024)
Memory Consolidation Enables Long-Context Video Understanding
di: Balažević, Ivana, et al.
Pubblicazione: (2024)
di: Balažević, Ivana, et al.
Pubblicazione: (2024)
HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
di: Qiu, Haonan, et al.
Pubblicazione: (2025)
di: Qiu, Haonan, et al.
Pubblicazione: (2025)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
Video Understanding: From Geometry and Semantics to Unified Models
di: An, Zhaochong, et al.
Pubblicazione: (2026)
di: An, Zhaochong, et al.
Pubblicazione: (2026)
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
What You Have is What You Track: Adaptive and Robust Multimodal Tracking
di: Tan, Yuedong, et al.
Pubblicazione: (2025) -
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025) -
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026) -
Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery
di: Menn, Dennis, et al.
Pubblicazione: (2026) -
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
di: Ma, Junpeng, et al.
Pubblicazione: (2026)