OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Guohui, Ma, XiaoXiao, Huang, Jie, Xu, Hang, Yu, Hu, Fu, Siming, Li, Yuming, Xue, Zeyue, Song, Lin, Huang, Haoyang, Duan, Nan, Zhao, Feng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
von: Su, Yaofeng, et al.
Veröffentlicht: (2026)
von: Su, Yaofeng, et al.
Veröffentlicht: (2026)
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
von: Zhang, Songchun, et al.
Veröffentlicht: (2026)
von: Zhang, Songchun, et al.
Veröffentlicht: (2026)
A Systematic Post-Train Framework for Video Generation
von: Xue, Zeyue, et al.
Veröffentlicht: (2026)
von: Xue, Zeyue, et al.
Veröffentlicht: (2026)
Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026)
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026)
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
von: Bie, Fuqing, et al.
Veröffentlicht: (2025)
von: Bie, Fuqing, et al.
Veröffentlicht: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
von: Chen, Yuheng, et al.
Veröffentlicht: (2026)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
von: Chen, Zhangquan, et al.
Veröffentlicht: (2026)
von: Chen, Zhangquan, et al.
Veröffentlicht: (2026)
RAE-AR: Taming Autoregressive Models with Representation Autoencoders
von: Yu, Hu, et al.
Veröffentlicht: (2026)
von: Yu, Hu, et al.
Veröffentlicht: (2026)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
von: Tian, Zeyue, et al.
Veröffentlicht: (2026)
von: Tian, Zeyue, et al.
Veröffentlicht: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
von: Liu, Huadai, et al.
Veröffentlicht: (2025)
von: Liu, Huadai, et al.
Veröffentlicht: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
von: Liang, Susan, et al.
Veröffentlicht: (2026)
von: Liang, Susan, et al.
Veröffentlicht: (2026)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
von: Dai, Yifan, et al.
Veröffentlicht: (2026)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
von: Li, Caorui, et al.
Veröffentlicht: (2025)
von: Li, Caorui, et al.
Veröffentlicht: (2025)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
von: Li, Maomao, et al.
Veröffentlicht: (2026)
von: Li, Maomao, et al.
Veröffentlicht: (2026)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
von: Henry, Felix, et al.
Veröffentlicht: (2026)
von: Henry, Felix, et al.
Veröffentlicht: (2026)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
von: Xi, Dianbing, et al.
Veröffentlicht: (2025)
von: Xi, Dianbing, et al.
Veröffentlicht: (2025)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
von: Xie, Tianyu, et al.
Veröffentlicht: (2026)
von: Xie, Tianyu, et al.
Veröffentlicht: (2026)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
von: Cheng, Xize, et al.
Veröffentlicht: (2024)
von: Cheng, Xize, et al.
Veröffentlicht: (2024)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
von: Fei, Zhengcong, et al.
Veröffentlicht: (2025)
von: Fei, Zhengcong, et al.
Veröffentlicht: (2025)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
von: Chen, Junzhe, et al.
Veröffentlicht: (2025)
von: Chen, Junzhe, et al.
Veröffentlicht: (2025)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
von: Yan, Qianqi, et al.
Veröffentlicht: (2026)
von: Yan, Qianqi, et al.
Veröffentlicht: (2026)
OmniRefiner: Reinforcement-Guided Local Diffusion Refinement
von: Liu, Yaoli, et al.
Veröffentlicht: (2025)
von: Liu, Yaoli, et al.
Veröffentlicht: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
von: Geng, Tiantian, et al.
Veröffentlicht: (2024)
von: Geng, Tiantian, et al.
Veröffentlicht: (2024)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
von: Yao, Jiali, et al.
Veröffentlicht: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
von: Yang, Qize, et al.
Veröffentlicht: (2025)
von: Yang, Qize, et al.
Veröffentlicht: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
von: Jia, Yiduo, et al.
Veröffentlicht: (2026)
von: Jia, Yiduo, et al.
Veröffentlicht: (2026)
OmniGAIA: Towards Native Omni-Modal AI Agents
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
von: Zhu, Boyu, et al.
Veröffentlicht: (2025)
von: Zhu, Boyu, et al.
Veröffentlicht: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
von: Wang, Zehan, et al.
Veröffentlicht: (2024)
von: Wang, Zehan, et al.
Veröffentlicht: (2024)
OmniRe: Omni Urban Scene Reconstruction
von: Chen, Ziyu, et al.
Veröffentlicht: (2024)
von: Chen, Ziyu, et al.
Veröffentlicht: (2024)
OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance
von: Park, Yeo Jeong, et al.
Veröffentlicht: (2026)
von: Park, Yeo Jeong, et al.
Veröffentlicht: (2026)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
von: Xu, Xuenan, et al.
Veröffentlicht: (2025)
von: Xu, Xuenan, et al.
Veröffentlicht: (2025)
EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs
von: Tian, Wenjie, et al.
Veröffentlicht: (2026)
von: Tian, Wenjie, et al.
Veröffentlicht: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
von: Peng, Haosong, et al.
Veröffentlicht: (2025)
von: Peng, Haosong, et al.
Veröffentlicht: (2025)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
von: Wei, Yujie, et al.
Veröffentlicht: (2026)
von: Wei, Yujie, et al.
Veröffentlicht: (2026)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
von: Gan, Qijun, et al.
Veröffentlicht: (2025)
von: Gan, Qijun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
von: Su, Yaofeng, et al.
Veröffentlicht: (2026) -
Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models
von: Zhang, Songchun, et al.
Veröffentlicht: (2026) -
A Systematic Post-Train Framework for Video Generation
von: Xue, Zeyue, et al.
Veröffentlicht: (2026) -
Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026) -
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
von: Bie, Fuqing, et al.
Veröffentlicht: (2025)