EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Izzati, Fathinah, Li, Xinyue, Xia, Gus |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-to-Music Generation: A Survey
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
di: Yao, Yao, et al.
Pubblicazione: (2023)
di: Yao, Yao, et al.
Pubblicazione: (2023)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
di: Gan, Qijun, et al.
Pubblicazione: (2024)
di: Gan, Qijun, et al.
Pubblicazione: (2024)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
di: Wang, Baisen, et al.
Pubblicazione: (2024)
di: Wang, Baisen, et al.
Pubblicazione: (2024)
Controllable Dance Generation with Style-Guided Motion Diffusion
di: Wang, Hongsong, et al.
Pubblicazione: (2024)
di: Wang, Hongsong, et al.
Pubblicazione: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
PianoVAM: A Multimodal Piano Performance Dataset
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
di: Jiang, Peiyuan, et al.
Pubblicazione: (2025)
di: Jiang, Peiyuan, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Latent Swap Joint Diffusion for 2D Long-Form Latent Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2025)
di: Dai, Yusheng, et al.
Pubblicazione: (2025)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Learning Musical Representations for Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
Align Your Rhythm: Generating Highly Aligned Dance Poses with Gating-Enhanced Rhythm-Aware Feature Representation
di: Fan, Congyi, et al.
Pubblicazione: (2025)
di: Fan, Congyi, et al.
Pubblicazione: (2025)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
Seeing Sound, Hearing Sight: Uncovering Modality Bias and Conflict of AI models in Sound Localization
di: Jia, Yanhao, et al.
Pubblicazione: (2025)
di: Jia, Yanhao, et al.
Pubblicazione: (2025)
FilmComposer: LLM-Driven Music Production for Silent Film Clips
di: Xie, Zhifeng, et al.
Pubblicazione: (2025)
di: Xie, Zhifeng, et al.
Pubblicazione: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
di: Fu, Youquan, et al.
Pubblicazione: (2025)
di: Fu, Youquan, et al.
Pubblicazione: (2025)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
di: Sun, Yu, et al.
Pubblicazione: (2025)
di: Sun, Yu, et al.
Pubblicazione: (2025)
Structured Multi-Track Accompaniment Arrangement via Style Prior Modelling
di: Zhao, Jingwei, et al.
Pubblicazione: (2023)
di: Zhao, Jingwei, et al.
Pubblicazione: (2023)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vision-to-Music Generation: A Survey
di: Wang, Zhaokai, et al.
Pubblicazione: (2025) -
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024) -
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
di: Yao, Yao, et al.
Pubblicazione: (2023) -
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026) -
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
di: Gan, Qijun, et al.
Pubblicazione: (2024)