Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Hong, Jiaying, Zhu, Ting, Markchom, Thanet, Liang, Huizhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-based Music Generation
por: Sulun, Serkan
Publicado: (2026)
por: Sulun, Serkan
Publicado: (2026)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026)
por: Rinaldi, Ivan, et al.
Publicado: (2026)
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
por: Lin, Yan-Bo, et al.
Publicado: (2026)
por: Lin, Yan-Bo, et al.
Publicado: (2026)
CRRG-CLIP: Automatic Generation of Chest Radiology Reports and Classification of Chest Radiographs
por: Xu, Jianfei, et al.
Publicado: (2024)
por: Xu, Jianfei, et al.
Publicado: (2024)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
por: Wang, Xuanchen, et al.
Publicado: (2025)
por: Wang, Xuanchen, et al.
Publicado: (2025)
Vision-to-Music Generation: A Survey
por: Wang, Zhaokai, et al.
Publicado: (2025)
por: Wang, Zhaokai, et al.
Publicado: (2025)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
por: Rinaldi, Ivan, et al.
Publicado: (2024)
por: Rinaldi, Ivan, et al.
Publicado: (2024)
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
por: Yao, Yao, et al.
Publicado: (2023)
por: Yao, Yao, et al.
Publicado: (2023)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
por: Izzati, Fathinah, et al.
Publicado: (2025)
por: Izzati, Fathinah, et al.
Publicado: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
por: Lin, Yan-Bo, et al.
Publicado: (2024)
por: Lin, Yan-Bo, et al.
Publicado: (2024)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
por: Tian, Zeyue, et al.
Publicado: (2024)
por: Tian, Zeyue, et al.
Publicado: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
por: Hisariya, Tanisha, et al.
Publicado: (2024)
por: Hisariya, Tanisha, et al.
Publicado: (2024)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
por: Carnemolla, Simone, et al.
Publicado: (2025)
por: Carnemolla, Simone, et al.
Publicado: (2025)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
360+x: A Panoptic Multi-modal Scene Understanding Dataset
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
por: Novack, Zachary, et al.
Publicado: (2026)
por: Novack, Zachary, et al.
Publicado: (2026)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
por: Nguyen, Ngoc-Son, et al.
Publicado: (2026)
por: Nguyen, Ngoc-Son, et al.
Publicado: (2026)
Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition
por: Xia, Haiying, et al.
Publicado: (2025)
por: Xia, Haiying, et al.
Publicado: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
por: Lyu, Guangtao, et al.
Publicado: (2025)
por: Lyu, Guangtao, et al.
Publicado: (2025)
MDD: A Dataset for Text-and-Music Conditioned Duet Dance Generation
por: Gupta, Prerit, et al.
Publicado: (2025)
por: Gupta, Prerit, et al.
Publicado: (2025)
Diffusion Models for Joint Audio-Video Generation
por: La Torre, Alejandro Paredes
Publicado: (2026)
por: La Torre, Alejandro Paredes
Publicado: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
por: Cui, Zijun, et al.
Publicado: (2026)
por: Cui, Zijun, et al.
Publicado: (2026)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
por: Tang, Xiaoxuan, et al.
Publicado: (2025)
Music Arena: Live Evaluation for Text-to-Music
por: Kim, Yonghyun, et al.
Publicado: (2025)
por: Kim, Yonghyun, et al.
Publicado: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
por: Tan, Weiting, et al.
Publicado: (2026)
por: Tan, Weiting, et al.
Publicado: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
por: Yang, Jialiang, et al.
Publicado: (2026)
por: Yang, Jialiang, et al.
Publicado: (2026)
MusicSwarm: Biologically Inspired Intelligence for Music Composition
por: Buehler, Markus J.
Publicado: (2025)
por: Buehler, Markus J.
Publicado: (2025)
V2Meow: Meowing to the Visual Beat via Video-to-Music Generation
por: Su, Kun, et al.
Publicado: (2023)
por: Su, Kun, et al.
Publicado: (2023)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
Multimodal Real-Time Anomaly Detection and Industrial Applications
por: Verma, Aman, et al.
Publicado: (2025)
por: Verma, Aman, et al.
Publicado: (2025)
Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation Models
por: Mehta, Atharva, et al.
Publicado: (2025)
por: Mehta, Atharva, et al.
Publicado: (2025)
Learning Musical Representations for Music Performance Question Answering
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
por: Zhang, Hengyuan, et al.
Publicado: (2025)
por: Zhang, Hengyuan, et al.
Publicado: (2025)
PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
por: Im, Jaekwon, et al.
Publicado: (2026)
por: Im, Jaekwon, et al.
Publicado: (2026)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
por: Ai, Zhiqi, et al.
Publicado: (2025)
por: Ai, Zhiqi, et al.
Publicado: (2025)
Ejemplares similares
-
Video-based Music Generation
por: Sulun, Serkan
Publicado: (2026) -
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026) -
V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
por: Lin, Yan-Bo, et al.
Publicado: (2026) -
CRRG-CLIP: Automatic Generation of Chest Radiology Reports and Classification of Chest Radiographs
por: Xu, Jianfei, et al.
Publicado: (2024) -
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)