Enregistré dans:
| Auteurs principaux: | Li, Yan, Zhou, Ziya, Wang, Zhiqiang, Xue, Wei, Luo, Wenhan, Guo, Yike |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2412.03430 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025)
par: Tian, Zeyue, et autres
Publié: (2025)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
Diffusion Models for Joint Audio-Video Generation
par: La Torre, Alejandro Paredes
Publié: (2026)
par: La Torre, Alejandro Paredes
Publié: (2026)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
par: Tian, Zeyue, et autres
Publié: (2024)
par: Tian, Zeyue, et autres
Publié: (2024)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
par: OpenMOSS Team, et autres
Publié: (2026)
par: OpenMOSS Team, et autres
Publié: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
par: Ye, Zhen, et autres
Publié: (2026)
par: Ye, Zhen, et autres
Publié: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026)
par: Tateishi, Kazuya, et autres
Publié: (2026)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
par: Du, Fangyu, et autres
Publié: (2025)
par: Du, Fangyu, et autres
Publié: (2025)
Diffusion Models as Masked Audio-Video Learners
par: Nunez, Elvis, et autres
Publié: (2023)
par: Nunez, Elvis, et autres
Publié: (2023)
VABench: A Comprehensive Benchmark for Audio-Video Generation
par: Hua, Daili, et autres
Publié: (2025)
par: Hua, Daili, et autres
Publié: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
par: Zhou, Yupeng, et autres
Publié: (2026)
par: Zhou, Yupeng, et autres
Publié: (2026)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
par: Yang, Ruihan, et autres
Publié: (2023)
par: Yang, Ruihan, et autres
Publié: (2023)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
Do Joint Audio-Video Generation Models Understand Physics?
par: Cui, Zijun, et autres
Publié: (2026)
par: Cui, Zijun, et autres
Publié: (2026)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
Hierarchical Codec Diffusion for Video-to-Speech Generation
par: Ye, Jiaxin, et autres
Publié: (2026)
par: Ye, Jiaxin, et autres
Publié: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment
par: Zhou, Hao, et autres
Publié: (2025)
par: Zhou, Hao, et autres
Publié: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
par: Liao, Junchao, et autres
Publié: (2026)
par: Liao, Junchao, et autres
Publié: (2026)
Documents similaires
-
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026) -
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025) -
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025) -
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024) -
Diffusion Models for Joint Audio-Video Generation
par: La Torre, Alejandro Paredes
Publié: (2026)