StreamingVLM: Real-Time Understanding for Infinite Video Streams
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Ruyi, Xiao, Guangxuan, Chen, Yukang, He, Liuning, Lu, Yao, Han, Song |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
XAttention: Block Sparse Attention with Antidiagonal Scoring
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
di: Lee, Daeun, et al.
Pubblicazione: (2025)
di: Lee, Daeun, et al.
Pubblicazione: (2025)
RAIN: Real-time Animation of Infinite Video Stream
di: Shu, Zhilei, et al.
Pubblicazione: (2024)
di: Shu, Zhilei, et al.
Pubblicazione: (2024)
Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
Online Misinformation Detection in Live Streaming Videos
di: Cao, Rui
Pubblicazione: (2025)
di: Cao, Rui
Pubblicazione: (2025)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
Thinking in Streaming Video
di: Liu, Zikang, et al.
Pubblicazione: (2026)
di: Liu, Zikang, et al.
Pubblicazione: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams
di: Zhang, Haoji, et al.
Pubblicazione: (2024)
di: Zhang, Haoji, et al.
Pubblicazione: (2024)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
di: Wang, Haibo, et al.
Pubblicazione: (2025)
di: Wang, Haibo, et al.
Pubblicazione: (2025)
StreamingEffect: Real-Time Human-Centric Video Effect Generation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval
di: Ning, Zhenyu, et al.
Pubblicazione: (2025)
di: Ning, Zhenyu, et al.
Pubblicazione: (2025)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
DeepCoT: Deep Continual Transformers for Real-Time Inference on Data Streams
di: Picón, Ginés Carreto, et al.
Pubblicazione: (2025)
di: Picón, Ginés Carreto, et al.
Pubblicazione: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
StreamSTGS: Streaming Spatial and Temporal Gaussian Grids for Real-Time Free-Viewpoint Video
di: Ke, Zhihui, et al.
Pubblicazione: (2025)
di: Ke, Zhihui, et al.
Pubblicazione: (2025)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
Chronotome: Real-Time Topic Modeling for Streaming Embedding Spaces
di: Lim, Matte, et al.
Pubblicazione: (2025)
di: Lim, Matte, et al.
Pubblicazione: (2025)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
Decouple and Cache: KV Cache Construction for Streaming Video Understanding
di: Pang, Zhanzhong, et al.
Pubblicazione: (2026)
di: Pang, Zhanzhong, et al.
Pubblicazione: (2026)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
di: He, Lehan, et al.
Pubblicazione: (2024)
di: He, Lehan, et al.
Pubblicazione: (2024)
Stream-T1: Test-Time Scaling for Streaming Video Generation
di: Tu, Yijing, et al.
Pubblicazione: (2026)
di: Tu, Yijing, et al.
Pubblicazione: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
Real-Time Anomaly Detection in Video Streams
di: Poirier, Fabien
Pubblicazione: (2024)
di: Poirier, Fabien
Pubblicazione: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026)
di: Liu, Jinming, et al.
Pubblicazione: (2026)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
di: Lyu, Hengye, et al.
Pubblicazione: (2026)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding
di: Sun, Peiwen, et al.
Pubblicazione: (2026)
di: Sun, Peiwen, et al.
Pubblicazione: (2026)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
di: Meng, Rui, et al.
Pubblicazione: (2025)
di: Meng, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
XAttention: Block Sparse Attention with Antidiagonal Scoring
di: Xu, Ruyi, et al.
Pubblicazione: (2025) -
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024) -
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
di: Tian, Xueyun, et al.
Pubblicazione: (2026) -
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
di: Lu, Xudong, et al.
Pubblicazione: (2026) -
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
di: Lu, Xudong, et al.
Pubblicazione: (2026)