Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Rinaldi, Ivan, Mendula, Matteo, Fanelli, Nicola, Levé, Florence, Testi, Matteo, Castellano, Giovanna, Vessio, Gennaro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025)
di: Song, Jiahao, et al.
Pubblicazione: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
di: Li, Shuyu, et al.
Pubblicazione: (2025)
di: Li, Shuyu, et al.
Pubblicazione: (2025)
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
di: Ji, Shulei, et al.
Pubblicazione: (2023)
di: Ji, Shulei, et al.
Pubblicazione: (2023)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
di: Stewart, Shanti, et al.
Pubblicazione: (2024)
di: Stewart, Shanti, et al.
Pubblicazione: (2024)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
di: Li, Sifei, et al.
Pubblicazione: (2025)
di: Li, Sifei, et al.
Pubblicazione: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval
di: Fanelli, Nicola, et al.
Pubblicazione: (2025)
di: Fanelli, Nicola, et al.
Pubblicazione: (2025)
Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment
di: Hong, Jiaying, et al.
Pubblicazione: (2025)
di: Hong, Jiaying, et al.
Pubblicazione: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
di: Spanio, Matteo, et al.
Pubblicazione: (2026)
di: Spanio, Matteo, et al.
Pubblicazione: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
di: Zhu, Jian, et al.
Pubblicazione: (2026)
di: Zhu, Jian, et al.
Pubblicazione: (2026)
Towards Practical Real-Time Low-Latency Music Source Separation
di: Wu, Junyu, et al.
Pubblicazione: (2025)
di: Wu, Junyu, et al.
Pubblicazione: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
di: Carnemolla, Simone, et al.
Pubblicazione: (2025)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
di: Yang, Meng, et al.
Pubblicazione: (2026)
di: Yang, Meng, et al.
Pubblicazione: (2026)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
di: Veerendranath, Vishruth, et al.
Pubblicazione: (2024)
di: Veerendranath, Vishruth, et al.
Pubblicazione: (2024)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
di: Qiu, Ke, et al.
Pubblicazione: (2026)
di: Qiu, Ke, et al.
Pubblicazione: (2026)
Music Arena: Live Evaluation for Text-to-Music
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
di: Kim, Yonghyun, et al.
Pubblicazione: (2025)
MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
di: Boudaghi, Ali, et al.
Pubblicazione: (2025)
di: Boudaghi, Ali, et al.
Pubblicazione: (2025)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
di: Liu, Renhang, et al.
Pubblicazione: (2024)
di: Liu, Renhang, et al.
Pubblicazione: (2024)
MusicSwarm: Biologically Inspired Intelligence for Music Composition
di: Buehler, Markus J.
Pubblicazione: (2025)
di: Buehler, Markus J.
Pubblicazione: (2025)
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
di: Koo, Inyong, et al.
Pubblicazione: (2026)
di: Koo, Inyong, et al.
Pubblicazione: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
Music4All A+A: A Multimodal Dataset for Music Information Retrieval Tasks
di: Geiger, Jonas, et al.
Pubblicazione: (2025)
di: Geiger, Jonas, et al.
Pubblicazione: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
di: Ishii, Masato, et al.
Pubblicazione: (2025)
di: Ishii, Masato, et al.
Pubblicazione: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024) -
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025) -
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025) -
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
di: Li, Shuyu, et al.
Pubblicazione: (2025) -
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)