DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Xu, Ye, Fulong, Sun, Qichao, Chen, Liyang, Li, Bingchuan, Zhang, Pengze, Liu, Jiawei, Zhao, Songtao, He, Qian, Hou, Xiangwang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
por: Guo, Xu, et al.
Publicado: (2026)
por: Guo, Xu, et al.
Publicado: (2026)
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning
por: Ye, Fulong, et al.
Publicado: (2025)
por: Ye, Fulong, et al.
Publicado: (2025)
InstructX: Towards Unified Visual Editing with MLLM Guidance
por: Mou, Chong, et al.
Publicado: (2025)
por: Mou, Chong, et al.
Publicado: (2025)
OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer
por: Zhang, Pengze, et al.
Publicado: (2026)
por: Zhang, Pengze, et al.
Publicado: (2026)
AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion Models
por: Li, Xinghui, et al.
Publicado: (2024)
por: Li, Xinghui, et al.
Publicado: (2024)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
por: Chen, Jinshu, et al.
Publicado: (2025)
por: Chen, Jinshu, et al.
Publicado: (2025)
DreamStyle: A Unified Framework for Video Stylization
por: Li, Mengtian, et al.
Publicado: (2026)
por: Li, Mengtian, et al.
Publicado: (2026)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
DreamO: A Unified Framework for Image Customization
por: Mou, Chong, et al.
Publicado: (2025)
por: Mou, Chong, et al.
Publicado: (2025)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
por: Wei, Yujie, et al.
Publicado: (2026)
por: Wei, Yujie, et al.
Publicado: (2026)
MUSAR: Exploring Multi-Subject Customization from Single-Subject Dataset via Attention Routing
por: Guo, Zinan, et al.
Publicado: (2025)
por: Guo, Zinan, et al.
Publicado: (2025)
I2VControl: Disentangled and Unified Video Motion Synthesis Control
por: Feng, Wanquan, et al.
Publicado: (2024)
por: Feng, Wanquan, et al.
Publicado: (2024)
DreamOmni: Unified Image Generation and Editing
por: Xia, Bin, et al.
Publicado: (2024)
por: Xia, Bin, et al.
Publicado: (2024)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
por: Li, Liyang, et al.
Publicado: (2026)
por: Li, Liyang, et al.
Publicado: (2026)
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
por: Zhao, Jiaxing, et al.
Publicado: (2025)
por: Zhao, Jiaxing, et al.
Publicado: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
por: Zhu, Lei, et al.
Publicado: (2026)
por: Zhu, Lei, et al.
Publicado: (2026)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
por: Wang, Yukun, et al.
Publicado: (2026)
por: Wang, Yukun, et al.
Publicado: (2026)
DreamRelation: Relation-Centric Video Customization
por: Wei, Yujie, et al.
Publicado: (2025)
por: Wei, Yujie, et al.
Publicado: (2025)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
por: Xu, Xuenan, et al.
Publicado: (2025)
por: Xu, Xuenan, et al.
Publicado: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
por: Tong, Wenwen, et al.
Publicado: (2025)
por: Tong, Wenwen, et al.
Publicado: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
por: Liang, Susan, et al.
Publicado: (2026)
por: Liang, Susan, et al.
Publicado: (2026)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
por: Cheng, Shihao, et al.
Publicado: (2026)
por: Cheng, Shihao, et al.
Publicado: (2026)
HyperLoRA: Parameter-Efficient Adaptive Generation for Portrait Synthesis
por: Li, Mengtian, et al.
Publicado: (2025)
por: Li, Mengtian, et al.
Publicado: (2025)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
por: Li, Caorui, et al.
Publicado: (2025)
por: Li, Caorui, et al.
Publicado: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)
por: Dai, Yifan, et al.
Publicado: (2026)
I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength
por: Feng, Wanquan, et al.
Publicado: (2024)
por: Feng, Wanquan, et al.
Publicado: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
por: Li, Fu, et al.
Publicado: (2025)
por: Li, Fu, et al.
Publicado: (2025)
Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video
por: Xu, Mengyao, et al.
Publicado: (2025)
por: Xu, Mengyao, et al.
Publicado: (2025)
X-MoGen: Unified Motion Generation across Humans and Animals
por: Wang, Xuan, et al.
Publicado: (2025)
por: Wang, Xuan, et al.
Publicado: (2025)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
por: Liu, Jialun, et al.
Publicado: (2026)
por: Liu, Jialun, et al.
Publicado: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
por: Yang, Xiaoda, et al.
Publicado: (2025)
por: Yang, Xiaoda, et al.
Publicado: (2025)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
por: Zhong, Zhisheng, et al.
Publicado: (2024)
por: Zhong, Zhisheng, et al.
Publicado: (2024)
Evaluation of Drivers' Interaction Ability at Social Scenarios: A Process-Based Framework
por: Liu, Jiaqi, et al.
Publicado: (2024)
por: Liu, Jiaqi, et al.
Publicado: (2024)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
por: Zhou, Donghao, et al.
Publicado: (2026)
por: Zhou, Donghao, et al.
Publicado: (2026)
Omni-Video: Democratizing Unified Video Understanding and Generation
por: Tan, Zhiyu, et al.
Publicado: (2025)
por: Tan, Zhiyu, et al.
Publicado: (2025)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
por: Zhang, Guohui, et al.
Publicado: (2026)
por: Zhang, Guohui, et al.
Publicado: (2026)
Ejemplares similares
-
DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
por: Guo, Xu, et al.
Publicado: (2026) -
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning
por: Ye, Fulong, et al.
Publicado: (2025) -
InstructX: Towards Unified Visual Editing with MLLM Guidance
por: Mou, Chong, et al.
Publicado: (2025) -
OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer
por: Zhang, Pengze, et al.
Publicado: (2026) -
AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion Models
por: Li, Xinghui, et al.
Publicado: (2024)