Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Rinaldi, Ivan, Fanelli, Nicola, Castellano, Giovanna, Vessio, Gennaro
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866908471737188352
author Rinaldi, Ivan
Fanelli, Nicola
Castellano, Giovanna
Vessio, Gennaro
author_facet Rinaldi, Ivan
Fanelli, Nicola
Castellano, Giovanna
Vessio, Gennaro
contents Artificial Intelligence and generative models have revolutionized music creation, with many models leveraging textual or visual prompts for guidance. However, existing image-to-music models are limited to simple images, lacking the capability to generate music from complex digitized artworks. To address this gap, we introduce $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$, a novel model designed to create music from digitized artworks or text inputs. $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$ extends the AudioLDM~2 architecture, a text-to-audio model, and employs our newly curated datasets, created via ImageBind, which pair digitized artworks with music. Experimental results demonstrate that $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$ can generate music that resonates with the input stimuli. These findings suggest promising applications in multimedia art, interactive installations, and AI-driven creative tools.
format Preprint
id arxiv_https___arxiv_org_abs_2410_04906
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
Rinaldi, Ivan
Fanelli, Nicola
Castellano, Giovanna
Vessio, Gennaro
Multimedia
Computer Vision and Pattern Recognition
Sound
Audio and Speech Processing
Artificial Intelligence and generative models have revolutionized music creation, with many models leveraging textual or visual prompts for guidance. However, existing image-to-music models are limited to simple images, lacking the capability to generate music from complex digitized artworks. To address this gap, we introduce $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$, a novel model designed to create music from digitized artworks or text inputs. $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$ extends the AudioLDM~2 architecture, a text-to-audio model, and employs our newly curated datasets, created via ImageBind, which pair digitized artworks with music. Experimental results demonstrate that $\mathcal{A}\textit{rt2}\mathcal{M}\textit{us}$ can generate music that resonates with the input stimuli. These findings suggest promising applications in multimedia art, interactive installations, and AI-driven creative tools.
title Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
topic Multimedia
Computer Vision and Pattern Recognition
Sound
Audio and Speech Processing
url https://arxiv.org/abs/2410.04906