Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Hao, Tan, Zhiyu, Gong, Jia, Qin, Luozheng, Chen, Hesen, Yang, Xiaomeng, Sun, Yuqing, Lin, Yuetan, Yang, Mengping, Li, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
di: Qin, Luozheng, et al.
Pubblicazione: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
di: Yang, Mengping, et al.
Pubblicazione: (2026)
di: Yang, Mengping, et al.
Pubblicazione: (2026)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
di: Qin, Luozheng, et al.
Pubblicazione: (2026)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
di: Chen, Hesen, et al.
Pubblicazione: (2025)
di: Chen, Hesen, et al.
Pubblicazione: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026)
di: Liu, Jialun, et al.
Pubblicazione: (2026)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
di: Zhou, Donghao, et al.
Pubblicazione: (2026)
di: Zhou, Donghao, et al.
Pubblicazione: (2026)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
di: Li, Binglei, et al.
Pubblicazione: (2026)
di: Li, Binglei, et al.
Pubblicazione: (2026)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
di: Li, Binglei, et al.
Pubblicazione: (2026)
di: Li, Binglei, et al.
Pubblicazione: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
di: Wang, Yibin, et al.
Pubblicazione: (2024)
di: Wang, Yibin, et al.
Pubblicazione: (2024)
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
VideoCoF: Unified Video Editing with Temporal Reasoner
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
di: Chen, Feng, et al.
Pubblicazione: (2024)
di: Chen, Feng, et al.
Pubblicazione: (2024)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
di: Chen, Yuqing, et al.
Pubblicazione: (2025)
DreamOmni: Unified Image Generation and Editing
di: Xia, Bin, et al.
Pubblicazione: (2024)
di: Xia, Bin, et al.
Pubblicazione: (2024)
DreamWorld: Unified World Modeling in Video Generation
di: Tan, Boming, et al.
Pubblicazione: (2026)
di: Tan, Boming, et al.
Pubblicazione: (2026)
OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
di: Liu, Yuheng, et al.
Pubblicazione: (2026)
di: Liu, Yuheng, et al.
Pubblicazione: (2026)
Generative Neural Video Compression via Video Diffusion Prior
di: Mao, Qi, et al.
Pubblicazione: (2025)
di: Mao, Qi, et al.
Pubblicazione: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
di: Wang, Yukun, et al.
Pubblicazione: (2026)
di: Wang, Yukun, et al.
Pubblicazione: (2026)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
di: Fei, Zhengcong, et al.
Pubblicazione: (2025)
di: Fei, Zhengcong, et al.
Pubblicazione: (2025)
Offline Meteorology-Pollution Coupling Global Air Pollution Forecasting Model with Bilinear Pooling
di: Fan, Xu, et al.
Pubblicazione: (2025)
di: Fan, Xu, et al.
Pubblicazione: (2025)
Echo-Path: Pathology-Conditioned Echo Video Generation
di: Muhammad, Kabir Hamzah, et al.
Pubblicazione: (2025)
di: Muhammad, Kabir Hamzah, et al.
Pubblicazione: (2025)
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
di: Liang, Sen, et al.
Pubblicazione: (2025)
di: Liang, Sen, et al.
Pubblicazione: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
di: Yu, Shoubin, et al.
Pubblicazione: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
Unified Dense Prediction of Video Diffusion
di: Yang, Lehan, et al.
Pubblicazione: (2025)
di: Yang, Lehan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Omni-Video: Democratizing Unified Video Understanding and Generation
di: Tan, Zhiyu, et al.
Pubblicazione: (2025) -
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025) -
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
di: Qin, Luozheng, et al.
Pubblicazione: (2025) -
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
di: Tan, Zhiyu, et al.
Pubblicazione: (2025) -
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
di: Qin, Luozheng, et al.
Pubblicazione: (2025)