Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhicheng, Gu, Wentao, Wang, Weicheng, Zhu, Yongjie, Qin, Wenyu, Wang, Meng, Wan, Pengfei, Yang, Jufeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
di: Wang, Weicheng, et al.
Pubblicazione: (2026)
di: Wang, Weicheng, et al.
Pubblicazione: (2026)
Analytic Score Optimization for Multi Dimension Video Quality Assessment
di: Lin, Boda, et al.
Pubblicazione: (2026)
di: Lin, Boda, et al.
Pubblicazione: (2026)
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
di: Jiang, Haonan, et al.
Pubblicazione: (2026)
di: Jiang, Haonan, et al.
Pubblicazione: (2026)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
di: Zhong, Hao, et al.
Pubblicazione: (2025)
di: Zhong, Hao, et al.
Pubblicazione: (2025)
Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization
di: Oh, Yeongtak, et al.
Pubblicazione: (2026)
di: Oh, Yeongtak, et al.
Pubblicazione: (2026)
Active Perception Agent for Omnimodal Audio-Video Understanding
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
di: Tao, Keda, et al.
Pubblicazione: (2026)
di: Tao, Keda, et al.
Pubblicazione: (2026)
OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models
di: Deng, Yuchen, et al.
Pubblicazione: (2026)
di: Deng, Yuchen, et al.
Pubblicazione: (2026)
Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
di: Xu, Ke, et al.
Pubblicazione: (2026)
di: Xu, Ke, et al.
Pubblicazione: (2026)
Dynin-Omni: Omnimodal Unified Large Diffusion Language Model
di: Kim, Jaeik, et al.
Pubblicazione: (2026)
di: Kim, Jaeik, et al.
Pubblicazione: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
di: Jia, Yiduo, et al.
Pubblicazione: (2026)
di: Jia, Yiduo, et al.
Pubblicazione: (2026)
KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding
di: Lin, Boda, et al.
Pubblicazione: (2026)
di: Lin, Boda, et al.
Pubblicazione: (2026)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
di: Li, Caorui, et al.
Pubblicazione: (2025)
di: Li, Caorui, et al.
Pubblicazione: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
di: Yu, Tao, et al.
Pubblicazione: (2026)
di: Yu, Tao, et al.
Pubblicazione: (2026)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
di: Xie, Tianyu, et al.
Pubblicazione: (2026)
di: Xie, Tianyu, et al.
Pubblicazione: (2026)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training
di: Luo, Xiangyang, et al.
Pubblicazione: (2026)
di: Luo, Xiangyang, et al.
Pubblicazione: (2026)
How Far Are We from Intelligent Visual Deductive Reasoning?
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
JuFengWang/scripts: RNA-editing analysis Scripts
di: Jufeng Wang
Pubblicazione: (2025)
di: Jufeng Wang
Pubblicazione: (2025)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
di: Li, Yian, et al.
Pubblicazione: (2024)
di: Li, Yian, et al.
Pubblicazione: (2024)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
di: Tong, Wenwen, et al.
Pubblicazione: (2025)
Deformable Audio Transformer for Audio Event Detection
di: Zhu, Wentao
Pubblicazione: (2023)
di: Zhu, Wentao
Pubblicazione: (2023)
Reason4Rec: Large Language Models for Recommendation with Deliberative User Preference Alignment
di: Fang, Yi, et al.
Pubblicazione: (2025)
di: Fang, Yi, et al.
Pubblicazione: (2025)
A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks
di: Wan, Wentao, et al.
Pubblicazione: (2023)
di: Wan, Wentao, et al.
Pubblicazione: (2023)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
FGeo-DRL: Deductive Reasoning for Geometric Problems through Deep Reinforcement Learning
di: Zou, Jia, et al.
Pubblicazione: (2024)
di: Zou, Jia, et al.
Pubblicazione: (2024)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
di: Chen, Junyi, et al.
Pubblicazione: (2026)
di: Chen, Junyi, et al.
Pubblicazione: (2026)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
di: Zhu, Zhenhao, et al.
Pubblicazione: (2026)
di: Zhu, Zhenhao, et al.
Pubblicazione: (2026)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025) -
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
di: Wang, Weicheng, et al.
Pubblicazione: (2026) -
Analytic Score Optimization for Multi Dimension Video Quality Assessment
di: Lin, Boda, et al.
Pubblicazione: (2026) -
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering
di: Zhu, Yifan, et al.
Pubblicazione: (2026) -
MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)