X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Peiwen, Lu, Xudong, Liu, Huadai, Bo, Yang, Wu, Dongming, Guan, Huankang, Cai, Minghong, Chen, Jinpeng, Guo, Xintong, Li, Shuhan, Liu, Rui, Yue, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
di: Sun, Peiwen, et al.
Pubblicazione: (2025)
di: Sun, Peiwen, et al.
Pubblicazione: (2025)
Memory Helps, but Confabulation Misleads: Understanding Streaming Events in Videos with MLLMs
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
Understanding Server-Assisted Federated Learning in the Presence of Incomplete Client Participation
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
di: Xie, Yiweng, et al.
Pubblicazione: (2026)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs
di: Wu, Xin, et al.
Pubblicazione: (2026)
di: Wu, Xin, et al.
Pubblicazione: (2026)
IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams
di: Li, Jinzhao, et al.
Pubblicazione: (2026)
di: Li, Jinzhao, et al.
Pubblicazione: (2026)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
An Efficient Streaming Video Understanding Framework with Agentic Control
di: Liu, Jinming, et al.
Pubblicazione: (2026)
di: Liu, Jinming, et al.
Pubblicazione: (2026)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
di: Yang, Haolin, et al.
Pubblicazione: (2025)
di: Yang, Haolin, et al.
Pubblicazione: (2025)
In-Context Audio Control of Video Diffusion Transformers
di: Liu, Wenze, et al.
Pubblicazione: (2025)
di: Liu, Wenze, et al.
Pubblicazione: (2025)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
Delving into Dark Regions for Robust Shadow Detection
di: Guan, Huankang, et al.
Pubblicazione: (2024)
di: Guan, Huankang, et al.
Pubblicazione: (2024)
CogStream: Context-guided Streaming Video Question Answering
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zicheng, et al.
Pubblicazione: (2025)
Thinking in Streaming Video
di: Liu, Zikang, et al.
Pubblicazione: (2026)
di: Liu, Zikang, et al.
Pubblicazione: (2026)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
di: Li, Yun, et al.
Pubblicazione: (2025)
di: Li, Yun, et al.
Pubblicazione: (2025)
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
Multi-Stream Keypoint Attention Network for Sign Language Recognition and Translation
di: Guan, Mo, et al.
Pubblicazione: (2024)
di: Guan, Mo, et al.
Pubblicazione: (2024)
ChainStream: An LLM-based Framework for Unified Synthetic Sensing
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Streaming Multi-agent Pathfinding
di: Tang, Mingkai, et al.
Pubblicazione: (2025)
di: Tang, Mingkai, et al.
Pubblicazione: (2025)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
di: Sun, Peiwen, et al.
Pubblicazione: (2024)
di: Sun, Peiwen, et al.
Pubblicazione: (2024)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
di: Luo, Yawen, et al.
Pubblicazione: (2026)
di: Luo, Yawen, et al.
Pubblicazione: (2026)
One Stream or Two -- Exploring Andromeda's North West Stream
di: Preston, Janet, et al.
Pubblicazione: (2024)
di: Preston, Janet, et al.
Pubblicazione: (2024)
Glad: A Streaming Scene Generator for Autonomous Driving
di: Xie, Bin, et al.
Pubblicazione: (2025)
di: Xie, Bin, et al.
Pubblicazione: (2025)
Graph-Enhanced Dual-Stream Feature Fusion with Pre-Trained Model for Acoustic Traffic Monitoring
di: Fan, Shitong, et al.
Pubblicazione: (2024)
di: Fan, Shitong, et al.
Pubblicazione: (2024)
FairGen: Enhancing Fairness in Text-to-Image Diffusion Models via Self-Discovering Latent Directions
di: Jiang, Yilei, et al.
Pubblicazione: (2024)
di: Jiang, Yilei, et al.
Pubblicazione: (2024)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
LLM-Alignment Live-Streaming Recommendation
di: Liu, Yueyang, et al.
Pubblicazione: (2025)
di: Liu, Yueyang, et al.
Pubblicazione: (2025)
FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation
di: Cai, Yiyi, et al.
Pubblicazione: (2025)
di: Cai, Yiyi, et al.
Pubblicazione: (2025)
StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs
di: Che, Chang, et al.
Pubblicazione: (2026)
di: Che, Chang, et al.
Pubblicazione: (2026)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
SSNVC: Single Stream Neural Video Compression with Implicit Temporal Information
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AURA: Always-On Understanding and Real-Time Assistance via Video Streams
di: Lu, Xudong, et al.
Pubblicazione: (2026) -
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
di: Lu, Xudong, et al.
Pubblicazione: (2026) -
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024) -
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
di: Wang, Chao, et al.
Pubblicazione: (2026) -
SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
di: Sun, Peiwen, et al.
Pubblicazione: (2025)