Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rinaldi, Ivan, Mendula, Matteo, Fanelli, Nicola, Levé, Florence, Testi, Matteo, Castellano, Giovanna, Vessio, Gennaro |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
par: Rinaldi, Ivan, et autres
Publié: (2024)
par: Rinaldi, Ivan, et autres
Publié: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025)
par: Li, Shuyu, et autres
Publié: (2025)
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
par: Wang, Xuanchen, et autres
Publié: (2025)
par: Wang, Xuanchen, et autres
Publié: (2025)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
par: Ji, Shulei, et autres
Publié: (2023)
par: Ji, Shulei, et autres
Publié: (2023)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
par: Stewart, Shanti, et autres
Publié: (2024)
par: Stewart, Shanti, et autres
Publié: (2024)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
par: Li, Sifei, et autres
Publié: (2025)
par: Li, Sifei, et autres
Publié: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
par: Hu, Han, et autres
Publié: (2025)
par: Hu, Han, et autres
Publié: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
ArtSeek: Deep artwork understanding via multimodal in-context reasoning and late interaction retrieval
par: Fanelli, Nicola, et autres
Publié: (2025)
par: Fanelli, Nicola, et autres
Publié: (2025)
Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment
par: Hong, Jiaying, et autres
Publié: (2025)
par: Hong, Jiaying, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
par: Spanio, Matteo, et autres
Publié: (2026)
par: Spanio, Matteo, et autres
Publié: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
par: Mao, Zhuoyuan, et autres
Publié: (2025)
par: Mao, Zhuoyuan, et autres
Publié: (2025)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
par: Zhu, Jian, et autres
Publié: (2026)
par: Zhu, Jian, et autres
Publié: (2026)
Towards Practical Real-Time Low-Latency Music Source Separation
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
SeeingSounds: Learning Audio-to-Visual Alignment via Text
par: Carnemolla, Simone, et autres
Publié: (2025)
par: Carnemolla, Simone, et autres
Publié: (2025)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
par: Yang, Meng, et autres
Publié: (2026)
par: Yang, Meng, et autres
Publié: (2026)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
par: Veerendranath, Vishruth, et autres
Publié: (2024)
par: Veerendranath, Vishruth, et autres
Publié: (2024)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
Music Arena: Live Evaluation for Text-to-Music
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
par: Boudaghi, Ali, et autres
Publié: (2025)
par: Boudaghi, Ali, et autres
Publié: (2025)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
par: Liu, Renhang, et autres
Publié: (2024)
par: Liu, Renhang, et autres
Publié: (2024)
MusicSwarm: Biologically Inspired Intelligence for Music Composition
par: Buehler, Markus J.
Publié: (2025)
par: Buehler, Markus J.
Publié: (2025)
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
par: Koo, Inyong, et autres
Publié: (2026)
par: Koo, Inyong, et autres
Publié: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
par: Koh, Junyoung, et autres
Publié: (2025)
par: Koh, Junyoung, et autres
Publié: (2025)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
Music4All A+A: A Multimodal Dataset for Music Information Retrieval Tasks
par: Geiger, Jonas, et autres
Publié: (2025)
par: Geiger, Jonas, et autres
Publié: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
par: Ishii, Masato, et autres
Publié: (2025)
par: Ishii, Masato, et autres
Publié: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
Documents similaires
-
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
par: Rinaldi, Ivan, et autres
Publié: (2024) -
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025) -
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025) -
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025) -
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
par: Wang, Xuanchen, et autres
Publié: (2025)