MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Surana, Rohan, Namburi, Amit, Mundada, Gagan, Lal, Abhay, Novack, Zachary, McAuley, Julian, Wu, Junda
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866911392931512320
author Surana, Rohan
Namburi, Amit
Mundada, Gagan
Lal, Abhay
Novack, Zachary
McAuley, Julian
Wu, Junda
author_facet Surana, Rohan
Namburi, Amit
Mundada, Gagan
Lal, Abhay
Novack, Zachary
McAuley, Julian
Wu, Junda
contents Conversational recommendation has advanced rapidly with large language models (LLMs), yet music remains a uniquely challenging domain in which effective recommendations require reasoning over audio content beyond what text or metadata can capture. We present MusiCRS, the first benchmark for audio-centric conversational recommendation that links authentic user conversations from Reddit with corresponding tracks. MusiCRS includes 477 high-quality conversations spanning diverse genres (classical, hip-hop, electronic, metal, pop, indie, jazz), with 3,589 unique musical entities and audio grounding via YouTube links. MusiCRS supports evaluation under three input modality configurations: audio-only, query-only, and audio+query, allowing systematic comparison of audio-LLMs, retrieval models, and traditional approaches. Our experiments reveal that current systems struggle with cross-modal integration, with optimal performance frequently occurring in single-modality settings rather than multimodal configurations. This highlights fundamental limitations in cross-modal knowledge integration, as models excel at dialogue semantics but struggle when grounding abstract musical concepts in audio. To facilitate progress, we release the MusiCRS dataset (https://huggingface.co/datasets/rohan2810/MusiCRS), evaluation code (https://github.com/rohan2810/musiCRS), and comprehensive baselines.
format Preprint
id arxiv_https___arxiv_org_abs_2509_19469
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
Surana, Rohan
Namburi, Amit
Mundada, Gagan
Lal, Abhay
Novack, Zachary
McAuley, Julian
Wu, Junda
Sound
Multimedia
Conversational recommendation has advanced rapidly with large language models (LLMs), yet music remains a uniquely challenging domain in which effective recommendations require reasoning over audio content beyond what text or metadata can capture. We present MusiCRS, the first benchmark for audio-centric conversational recommendation that links authentic user conversations from Reddit with corresponding tracks. MusiCRS includes 477 high-quality conversations spanning diverse genres (classical, hip-hop, electronic, metal, pop, indie, jazz), with 3,589 unique musical entities and audio grounding via YouTube links. MusiCRS supports evaluation under three input modality configurations: audio-only, query-only, and audio+query, allowing systematic comparison of audio-LLMs, retrieval models, and traditional approaches. Our experiments reveal that current systems struggle with cross-modal integration, with optimal performance frequently occurring in single-modality settings rather than multimodal configurations. This highlights fundamental limitations in cross-modal knowledge integration, as models excel at dialogue semantics but struggle when grounding abstract musical concepts in audio. To facilitate progress, we release the MusiCRS dataset (https://huggingface.co/datasets/rohan2810/MusiCRS), evaluation code (https://github.com/rohan2810/musiCRS), and comprehensive baselines.
title MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
topic Sound
Multimedia
url https://arxiv.org/abs/2509.19469