StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yifei, Li, Zhenkai, Qian, Tianwen, Zheng, Huanran, Wang, Zheng, Fu, Yuqian, Wang, Xiaoling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026)
di: Tang, Guowei, et al.
Pubblicazione: (2026)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
di: Li, Kailing, et al.
Pubblicazione: (2025)
di: Li, Kailing, et al.
Pubblicazione: (2025)
Prompt as Free Lunch: Enhancing Diversity in Source-Free Cross-domain Few-shot Learning through Semantic-Guided Prompting
di: Zhuo, Linhai, et al.
Pubblicazione: (2024)
di: Zhuo, Linhai, et al.
Pubblicazione: (2024)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
di: Lang, Xiaolei, et al.
Pubblicazione: (2026)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
di: Wang, Zheng, et al.
Pubblicazione: (2026)
di: Wang, Zheng, et al.
Pubblicazione: (2026)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
di: Zhu, Bingwen, et al.
Pubblicazione: (2026)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
StreamChat: Chatting with Streaming Video
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
DeformStream: Deformation-based Adaptive Volumetric Video Streaming
di: Li, Boyan, et al.
Pubblicazione: (2024)
di: Li, Boyan, et al.
Pubblicazione: (2024)
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
StreamForest: Efficient Online Video Understanding with Persistent Event Memory
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2025)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
di: Li, Kailing, et al.
Pubblicazione: (2026)
di: Li, Kailing, et al.
Pubblicazione: (2026)
Stream-T1: Test-Time Scaling for Streaming Video Generation
di: Tu, Yijing, et al.
Pubblicazione: (2026)
di: Tu, Yijing, et al.
Pubblicazione: (2026)
Audio-Sync Video Generation with Multi-Stream Temporal Control
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
di: Weng, Shuchen, et al.
Pubblicazione: (2025)
HSACNet: Hierarchical Scale-Aware Consistency Regularized Semi-Supervised Change Detection
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
di: Xu, Qi'ao, et al.
Pubblicazione: (2025)
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
di: Liu, Ruicong, et al.
Pubblicazione: (2025)
di: Liu, Ruicong, et al.
Pubblicazione: (2025)
Embodied Understanding of Driving Scenarios
di: Zhou, Yunsong, et al.
Pubblicazione: (2024)
di: Zhou, Yunsong, et al.
Pubblicazione: (2024)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution
di: Zhang, Ziqing, et al.
Pubblicazione: (2025)
di: Zhang, Ziqing, et al.
Pubblicazione: (2025)
Flash-VStream: Efficient Real-Time Understanding for Long Video Streams
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
di: Zhang, Haoji, et al.
Pubblicazione: (2025)
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026)
di: Liu, Jinming, et al.
Pubblicazione: (2026)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
EndoStreamDepth: Temporally Consistent Monocular Depth Estimation for Endoscopic Video Streams
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
di: Hu, Yuhang, et al.
Pubblicazione: (2025)
PEARL: Personalized Streaming Video Understanding Model
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
ViSpeak: Visual Instruction Feedback in Streaming Videos
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams
di: Wu, Zike, et al.
Pubblicazione: (2025)
di: Wu, Zike, et al.
Pubblicazione: (2025)
Documenti analoghi
-
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026) -
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
di: Li, Kailing, et al.
Pubblicazione: (2025) -
Prompt as Free Lunch: Enhancing Diversity in Source-Free Cross-domain Few-shot Learning through Semantic-Guided Prompting
di: Zhuo, Linhai, et al.
Pubblicazione: (2024) -
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
di: Li, Yifan, et al.
Pubblicazione: (2025) -
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)