ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tian, Xueyun, Li, Wei, Xu, Bingbing, Dong, Heng, Wang, Yuanzhuo, Shen, Huawei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
von: Tian, Xueyun, et al.
Veröffentlicht: (2025)
von: Tian, Xueyun, et al.
Veröffentlicht: (2025)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
von: Lu, Xudong, et al.
Veröffentlicht: (2026)
von: Lu, Xudong, et al.
Veröffentlicht: (2026)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
von: Zhang, Pan, et al.
Veröffentlicht: (2024)
von: Zhang, Pan, et al.
Veröffentlicht: (2024)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
von: Yang, Qize, et al.
Veröffentlicht: (2025)
von: Yang, Qize, et al.
Veröffentlicht: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
von: Xu, Ruyi, et al.
Veröffentlicht: (2025)
von: Xu, Ruyi, et al.
Veröffentlicht: (2025)
MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
von: Goel, Arushi, et al.
Veröffentlicht: (2026)
von: Goel, Arushi, et al.
Veröffentlicht: (2026)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
von: Zhu, Minjie, et al.
Veröffentlicht: (2024)
von: Zhu, Minjie, et al.
Veröffentlicht: (2024)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
von: Li, Yongqi, et al.
Veröffentlicht: (2025)
von: Li, Yongqi, et al.
Veröffentlicht: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
von: He, Chaoqun, et al.
Veröffentlicht: (2026)
von: He, Chaoqun, et al.
Veröffentlicht: (2026)
Real-Time Multimodal Cognitive Assistant for Emergency Medical Services
von: Weerasinghe, Keshara, et al.
Veröffentlicht: (2024)
von: Weerasinghe, Keshara, et al.
Veröffentlicht: (2024)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
von: Wang, Haibo, et al.
Veröffentlicht: (2025)
von: Wang, Haibo, et al.
Veröffentlicht: (2025)
Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
von: Lin, Junyan, et al.
Veröffentlicht: (2026)
von: Lin, Junyan, et al.
Veröffentlicht: (2026)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
Baichuan-Omni Technical Report
von: Li, Yadong, et al.
Veröffentlicht: (2024)
von: Li, Yadong, et al.
Veröffentlicht: (2024)
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
von: Wu, Mengyang, et al.
Veröffentlicht: (2024)
von: Wu, Mengyang, et al.
Veröffentlicht: (2024)
OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction
von: Zhang, Haonan, et al.
Veröffentlicht: (2025)
von: Zhang, Haonan, et al.
Veröffentlicht: (2025)
Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts
von: Wu, Jialin, et al.
Veröffentlicht: (2023)
von: Wu, Jialin, et al.
Veröffentlicht: (2023)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
von: Gan, Ziliang, et al.
Veröffentlicht: (2024)
von: Gan, Ziliang, et al.
Veröffentlicht: (2024)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
von: Wu, Chenyuan, et al.
Veröffentlicht: (2025)
von: Wu, Chenyuan, et al.
Veröffentlicht: (2025)
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression
von: Li, Zhe, et al.
Veröffentlicht: (2025)
von: Li, Zhe, et al.
Veröffentlicht: (2025)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
von: Wang, Zhaokai, et al.
Veröffentlicht: (2025)
von: Wang, Zhaokai, et al.
Veröffentlicht: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
von: Li, Xinpeng, et al.
Veröffentlicht: (2026)
von: Li, Xinpeng, et al.
Veröffentlicht: (2026)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
von: Wang, Xiangfeng, et al.
Veröffentlicht: (2025)
von: Wang, Xiangfeng, et al.
Veröffentlicht: (2025)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
LLaVA-Critic: Learning to Evaluate Multimodal Models
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
von: Xiong, Tianyi, et al.
Veröffentlicht: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
von: Qin, Lixiong, et al.
Veröffentlicht: (2025)
von: Qin, Lixiong, et al.
Veröffentlicht: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
von: Kim, Geewook, et al.
Veröffentlicht: (2024)
von: Kim, Geewook, et al.
Veröffentlicht: (2024)
OmniCaptioner: One Captioner to Rule Them All
von: Lu, Yiting, et al.
Veröffentlicht: (2025)
von: Lu, Yiting, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
von: Tian, Xueyun, et al.
Veröffentlicht: (2025) -
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
von: Lu, Xudong, et al.
Veröffentlicht: (2026) -
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024) -
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
von: Zhang, Pan, et al.
Veröffentlicht: (2024) -
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
von: Yang, Qize, et al.
Veröffentlicht: (2025)