MCDubber: Multimodal Context-Aware Expressive Video Dubbing
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Yuan, Jia, Zhenqi, Liu, Rui, Hu, De, Bao, Feilong, Gao, Guanglai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
por: Zhao, Yuan, et al.
Publicado: (2024)
por: Zhao, Yuan, et al.
Publicado: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
por: Cong, Gaoxiang, et al.
Publicado: (2025)
por: Cong, Gaoxiang, et al.
Publicado: (2025)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2024)
por: Cong, Gaoxiang, et al.
Publicado: (2024)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
por: Chi, Xiaowei, et al.
Publicado: (2024)
por: Chi, Xiaowei, et al.
Publicado: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
por: Chen, Ziyang, et al.
Publicado: (2024)
por: Chen, Ziyang, et al.
Publicado: (2024)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
por: Gupta, Akshita, et al.
Publicado: (2024)
por: Gupta, Akshita, et al.
Publicado: (2024)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
por: Wang, Baisen, et al.
Publicado: (2024)
por: Wang, Baisen, et al.
Publicado: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning
por: Zhao, Fuzheng, et al.
Publicado: (2024)
por: Zhao, Fuzheng, et al.
Publicado: (2024)
A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation
por: Min, Anna, et al.
Publicado: (2025)
por: Min, Anna, et al.
Publicado: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)
por: Huang, Qiaochu, et al.
Publicado: (2024)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
Audio-Assisted Face Video Restoration with Temporal and Identity Complementary Learning
por: Cao, Yuqin, et al.
Publicado: (2025)
por: Cao, Yuqin, et al.
Publicado: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
por: Yang, Qi, et al.
Publicado: (2024)
por: Yang, Qi, et al.
Publicado: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
por: Tan, Weiting, et al.
Publicado: (2025)
por: Tan, Weiting, et al.
Publicado: (2025)
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
por: Lin, Yan-Bo, et al.
Publicado: (2024)
por: Lin, Yan-Bo, et al.
Publicado: (2024)
Video-to-Audio Generation with Hidden Alignment
por: Xu, Manjie, et al.
Publicado: (2024)
por: Xu, Manjie, et al.
Publicado: (2024)
Temporally Aligned Audio for Video with Autoregression
por: Viertola, Ilpo, et al.
Publicado: (2024)
por: Viertola, Ilpo, et al.
Publicado: (2024)
Digit Recognition using Multimodal Spiking Neural Networks
por: Bjorndahl, William, et al.
Publicado: (2024)
por: Bjorndahl, William, et al.
Publicado: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
Diffusion Models as Masked Audio-Video Learners
por: Nunez, Elvis, et al.
Publicado: (2023)
por: Nunez, Elvis, et al.
Publicado: (2023)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
por: Yu, Fei, et al.
Publicado: (2024)
por: Yu, Fei, et al.
Publicado: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
por: Guo, Yuxin, et al.
Publicado: (2024)
por: Guo, Yuxin, et al.
Publicado: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
por: Jeong, Yujin, et al.
Publicado: (2024)
por: Jeong, Yujin, et al.
Publicado: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024)
por: Rai, Aashish, et al.
Publicado: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
por: Oorloff, Trevine, et al.
Publicado: (2024)
por: Oorloff, Trevine, et al.
Publicado: (2024)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
por: Hong, Joanna, et al.
Publicado: (2025)
por: Hong, Joanna, et al.
Publicado: (2025)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
por: Zhao, Yuan, et al.
Publicado: (2024) -
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025) -
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
por: Cong, Gaoxiang, et al.
Publicado: (2025) -
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2024) -
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
por: Chi, Xiaowei, et al.
Publicado: (2024)