JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Xiaohu, Zhou, Hao, Yang, Qiangpeng, Wen, Shilei, Han, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
par: Zhou, Donghao, et autres
Publié: (2026)
par: Zhou, Donghao, et autres
Publié: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
par: He, Haoyang, et autres
Publié: (2025)
par: He, Haoyang, et autres
Publié: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
JoPano: Unified Panorama Generation via Joint Modeling
par: Feng, Wancheng, et autres
Publié: (2025)
par: Feng, Wancheng, et autres
Publié: (2025)
Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
par: Li, Ruibin, et autres
Publié: (2025)
par: Li, Ruibin, et autres
Publié: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
par: Wang, Kai, et autres
Publié: (2024)
par: Wang, Kai, et autres
Publié: (2024)
Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
par: Wu, Jianzong, et autres
Publié: (2025)
par: Wu, Jianzong, et autres
Publié: (2025)
MuJo: Multimodal Joint Feature Space Learning for Human Activity Recognition
par: Fritsch, Stefan Gerd, et autres
Publié: (2024)
par: Fritsch, Stefan Gerd, et autres
Publié: (2024)
Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation
par: Chen, Yingjie, et autres
Publié: (2026)
par: Chen, Yingjie, et autres
Publié: (2026)
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
par: Tu, Shuyuan, et autres
Publié: (2026)
par: Tu, Shuyuan, et autres
Publié: (2026)
JoIN: Joint GANs Inversion for Intrinsic Image Decomposition
par: Shah, Viraj, et autres
Publié: (2023)
par: Shah, Viraj, et autres
Publié: (2023)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
par: Ma, Bingqi, et autres
Publié: (2026)
par: Ma, Bingqi, et autres
Publié: (2026)
UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
par: Wang, Duomin, et autres
Publié: (2025)
par: Wang, Duomin, et autres
Publié: (2025)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
DiffSal: Joint Audio and Video Learning for Diffusion Saliency Prediction
par: Xiong, Junwen, et autres
Publié: (2024)
par: Xiong, Junwen, et autres
Publié: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition
par: Huang, Xiaohu, et autres
Publié: (2024)
par: Huang, Xiaohu, et autres
Publié: (2024)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
par: Zhang, Guozhen, et autres
Publié: (2025)
par: Zhang, Guozhen, et autres
Publié: (2025)
CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content
par: Han, Gyuwon, et autres
Publié: (2026)
par: Han, Gyuwon, et autres
Publié: (2026)
Change3D: Revisiting Change Detection and Captioning from A Video Modeling Perspective
par: Zhu, Duowang, et autres
Publié: (2025)
par: Zhu, Duowang, et autres
Publié: (2025)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
par: Cheng, Xin, et autres
Publié: (2026)
par: Cheng, Xin, et autres
Publié: (2026)
JoReS-Diff: Joint Retinex and Semantic Priors in Diffusion Model for Low-light Image Enhancement
par: Wu, Yuhui, et autres
Publié: (2023)
par: Wu, Yuhui, et autres
Publié: (2023)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
par: Liu, Jialun, et autres
Publié: (2026)
par: Liu, Jialun, et autres
Publié: (2026)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
par: Liu, Xiaohong, et autres
Publié: (2025)
par: Liu, Xiaohong, et autres
Publié: (2025)
MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection
par: Hu, Mengxue, et autres
Publié: (2025)
par: Hu, Mengxue, et autres
Publié: (2025)
Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning
par: Xie, Yifan, et autres
Publié: (2025)
par: Xie, Yifan, et autres
Publié: (2025)
Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
par: Li, Ruibin, et autres
Publié: (2026)
par: Li, Ruibin, et autres
Publié: (2026)
DiffTED: One-shot Audio-driven TED Talk Video Generation with Diffusion-based Co-speech Gestures
par: Hogue, Steven, et autres
Publié: (2024)
par: Hogue, Steven, et autres
Publié: (2024)
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
par: Liang, Zhengyang, et autres
Publié: (2025)
par: Liang, Zhengyang, et autres
Publié: (2025)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
par: Zheng, Haojie, et autres
Publié: (2026)
par: Zheng, Haojie, et autres
Publié: (2026)
Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations
par: Huang, Hai, et autres
Publié: (2025)
par: Huang, Hai, et autres
Publié: (2025)
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
par: Cao, Zhe, et autres
Publié: (2025)
par: Cao, Zhe, et autres
Publié: (2025)
ProJo4D: Progressive Joint Optimization for Sparse-View Inverse Physics Estimation
par: Rho, Daniel, et autres
Publié: (2025)
par: Rho, Daniel, et autres
Publié: (2025)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts
par: Son, Taein, et autres
Publié: (2024)
par: Son, Taein, et autres
Publié: (2024)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Documents similaires
-
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
par: Zhou, Donghao, et autres
Publié: (2026) -
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
par: Huang, Xiaohu, et autres
Publié: (2024) -
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026) -
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
par: He, Haoyang, et autres
Publié: (2025) -
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)