InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
Fuente:
arXiv
Salvato in:
| Autori principali: | Tong, Wenwen, Guo, Hewei, Ran, Dongchuan, Chen, Jiangnan, Lu, Jiefan, Wang, Kaibin, Li, Keqiang, Zhu, Xiaoxu, Li, Jiakui, Li, Kehan, Li, Xueheng, Li, Lumin, Guo, Chenxu, Zhou, Jiasheng, Chen, Jiandong, Wu, Xianye, Wang, Jiahao, Wu, Silei, Chen, Lei, Deng, Hanming, Song, Yuxuan, Zhou, Dinghao, Zhong, Guiping, Zheng, Ken, Kang, Shiyin, Lu, Lewei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
di: Ran, Dongchuan, et al.
Pubblicazione: (2026)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
di: Chng, Yong Xien, et al.
Pubblicazione: (2025)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2024)
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
AEQ-Bench: Measuring Empathy of Omni-Modal Large Models
di: Luo, Xuan, et al.
Pubblicazione: (2026)
di: Luo, Xuan, et al.
Pubblicazione: (2026)
Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
di: Peng, Shuhai, et al.
Pubblicazione: (2026)
di: Peng, Shuhai, et al.
Pubblicazione: (2026)
OmniArch: Building Foundation Model For Scientific Computing
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
di: Chen, Tianyu, et al.
Pubblicazione: (2024)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
Baichuan-Omni Technical Report
di: Li, Yadong, et al.
Pubblicazione: (2024)
di: Li, Yadong, et al.
Pubblicazione: (2024)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
OmniRe: Omni Urban Scene Reconstruction
di: Chen, Ziyu, et al.
Pubblicazione: (2024)
di: Chen, Ziyu, et al.
Pubblicazione: (2024)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
di: Diao, Haiwen, et al.
Pubblicazione: (2025)
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
di: Chen, Dongping, et al.
Pubblicazione: (2026)
di: Chen, Dongping, et al.
Pubblicazione: (2026)
Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
di: Luo, Jiamin, et al.
Pubblicazione: (2025)
di: Luo, Jiamin, et al.
Pubblicazione: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
di: Liang, Sen, et al.
Pubblicazione: (2025)
di: Liang, Sen, et al.
Pubblicazione: (2025)
Megrez-Omni Technical Report
di: Li, Boxun, et al.
Pubblicazione: (2025)
di: Li, Boxun, et al.
Pubblicazione: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
di: Li, Yizhi, et al.
Pubblicazione: (2024)
di: Li, Yizhi, et al.
Pubblicazione: (2024)
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
di: Wei, Dongxu, et al.
Pubblicazione: (2024)
di: Wei, Dongxu, et al.
Pubblicazione: (2024)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Baichuan-Omni-1.5 Technical Report
di: Li, Yadong, et al.
Pubblicazione: (2025)
di: Li, Yadong, et al.
Pubblicazione: (2025)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
di: Yang, Morunliu, et al.
Pubblicazione: (2026)
OmniCaptioner: One Captioner to Rule Them All
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
di: Yan, Qianqi, et al.
Pubblicazione: (2026)
di: Yan, Qianqi, et al.
Pubblicazione: (2026)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
di: Wang, Yukun, et al.
Pubblicazione: (2026)
di: Wang, Yukun, et al.
Pubblicazione: (2026)
Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology
di: Hu, Jucheng, et al.
Pubblicazione: (2026)
di: Hu, Jucheng, et al.
Pubblicazione: (2026)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
di: Liu, Mushui, et al.
Pubblicazione: (2024)
di: Liu, Mushui, et al.
Pubblicazione: (2024)
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
di: Bie, Fuqing, et al.
Pubblicazione: (2025)
di: Bie, Fuqing, et al.
Pubblicazione: (2025)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
di: Ding, Yue, et al.
Pubblicazione: (2026)
di: Ding, Yue, et al.
Pubblicazione: (2026)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
di: Chen, Junzhe, et al.
Pubblicazione: (2025)
di: Chen, Junzhe, et al.
Pubblicazione: (2025)
Kling-Omni Technical Report
di: Kling Team, et al.
Pubblicazione: (2025)
di: Kling Team, et al.
Pubblicazione: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
di: Li, Xinpeng, et al.
Pubblicazione: (2026)
OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model
di: Chen, Liuhan, et al.
Pubblicazione: (2024)
di: Chen, Liuhan, et al.
Pubblicazione: (2024)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
di: Li, Qingyun, et al.
Pubblicazione: (2024)
di: Li, Qingyun, et al.
Pubblicazione: (2024)
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
di: Zhu, Lei, et al.
Pubblicazione: (2026)
di: Zhu, Lei, et al.
Pubblicazione: (2026)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
OmniPred: Language Models as Universal Regressors
di: Song, Xingyou, et al.
Pubblicazione: (2024)
di: Song, Xingyou, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams
di: Ran, Dongchuan, et al.
Pubblicazione: (2026) -
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
di: Chng, Yong Xien, et al.
Pubblicazione: (2025) -
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2024) -
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
di: Zhang, Haoyu, et al.
Pubblicazione: (2026) -
AEQ-Bench: Measuring Empathy of Omni-Modal Large Models
di: Luo, Xuan, et al.
Pubblicazione: (2026)