Thinking in Streaming Video
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zikang, Guo, Longteng, Li, Handong, Zhen, Ru, He, Xingjian, Ji, Ruyi, Ren, Xiaoming, Zhang, Yanhao, Lu, Haonan, Liu, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
di: Wu, Qi, et al.
Pubblicazione: (2025)
di: Wu, Qi, et al.
Pubblicazione: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
di: Li, Handong, et al.
Pubblicazione: (2025)
di: Li, Handong, et al.
Pubblicazione: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
di: Li, Weihong, et al.
Pubblicazione: (2025)
di: Li, Weihong, et al.
Pubblicazione: (2025)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
di: Zhao, Yuyang, et al.
Pubblicazione: (2026)
Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation
di: Zhao, Bingrui, et al.
Pubblicazione: (2025)
di: Zhao, Bingrui, et al.
Pubblicazione: (2025)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
SeaBird: Segmentation in Bird's View with Dice Loss Improves Monocular 3D Detection of Large Objects
di: Kumar, Abhinav, et al.
Pubblicazione: (2024)
di: Kumar, Abhinav, et al.
Pubblicazione: (2024)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
LoopAnimate: Loopable Salient Object Animation
di: Wang, Fanyi, et al.
Pubblicazione: (2024)
di: Wang, Fanyi, et al.
Pubblicazione: (2024)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
di: Wang, Lu, et al.
Pubblicazione: (2026)
di: Wang, Lu, et al.
Pubblicazione: (2026)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
di: Yang, Yanlai, et al.
Pubblicazione: (2025)
di: Yang, Yanlai, et al.
Pubblicazione: (2025)
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
di: Jiang, Yankai, et al.
Pubblicazione: (2025)
di: Jiang, Yankai, et al.
Pubblicazione: (2025)
Explore the Limits of Omni-modal Pretraining at Scale
di: Zhang, Yiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yiyuan, et al.
Pubblicazione: (2024)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
di: Ma, Ke, et al.
Pubblicazione: (2026)
di: Ma, Ke, et al.
Pubblicazione: (2026)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
Real-Time Visual Attribution Streaming in Thinking Model
di: Kang, Seil, et al.
Pubblicazione: (2026)
di: Kang, Seil, et al.
Pubblicazione: (2026)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling
di: Li, Wenjie, et al.
Pubblicazione: (2026)
di: Li, Wenjie, et al.
Pubblicazione: (2026)
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
Pseudo-label Based Domain Adaptation for Zero-Shot Text Steganalysis
di: Luo, Yufei, et al.
Pubblicazione: (2024)
di: Luo, Yufei, et al.
Pubblicazione: (2024)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
di: Li, Handong, et al.
Pubblicazione: (2026)
di: Li, Handong, et al.
Pubblicazione: (2026)
Beyond Fixed Anchors: Precisely Erasing Concepts with Sibling Exclusive Counterparts
di: Zhang, Tong, et al.
Pubblicazione: (2025)
di: Zhang, Tong, et al.
Pubblicazione: (2025)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
di: Singh, Shivam, et al.
Pubblicazione: (2026)
di: Singh, Shivam, et al.
Pubblicazione: (2026)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
di: Zhao, Yusong, et al.
Pubblicazione: (2026)
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
di: Wu, Peng, et al.
Pubblicazione: (2023)
di: Wu, Peng, et al.
Pubblicazione: (2023)
SurgPLAN++: Universal Surgical Phase Localization Network for Online and Offline Inference
di: Chen, Zhen, et al.
Pubblicazione: (2024)
di: Chen, Zhen, et al.
Pubblicazione: (2024)
VideoScore2: Think before You Score in Generative Video Evaluation
di: He, Xuan, et al.
Pubblicazione: (2025)
di: He, Xuan, et al.
Pubblicazione: (2025)
StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video
di: Li, Ao, et al.
Pubblicazione: (2026)
di: Li, Ao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
di: Wu, Qi, et al.
Pubblicazione: (2025) -
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025) -
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
di: Yang, Fan, et al.
Pubblicazione: (2024) -
Breaking the Encoder Barrier for Seamless Video-Language Understanding
di: Li, Handong, et al.
Pubblicazione: (2025) -
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)