FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Haven, Hou, Yupeng, McAuley, Julian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025)
par: Kim, Haven, et autres
Publié: (2025)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
par: Kim, Haven, et autres
Publié: (2026)
par: Kim, Haven, et autres
Publié: (2026)
Do Captioning Metrics Reflect Music Semantic Alignment?
par: Lee, Jinwoo, et autres
Publié: (2024)
par: Lee, Jinwoo, et autres
Publié: (2024)
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
par: Huang, Jingyue, et autres
Publié: (2025)
par: Huang, Jingyue, et autres
Publié: (2025)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
par: Doh, SeungHeon, et autres
Publié: (2024)
par: Doh, SeungHeon, et autres
Publié: (2024)
Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning
par: Pan, Xiaofeng, et autres
Publié: (2025)
par: Pan, Xiaofeng, et autres
Publié: (2025)
Diff4Steer: Steerable Diffusion Prior for Generative Music Retrieval with Semantic Guidance
par: Bao, Xuchan, et autres
Publié: (2024)
par: Bao, Xuchan, et autres
Publié: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
Automatic Estimation of Singing Voice Musical Dynamics
par: Narang, Jyoti, et autres
Publié: (2024)
par: Narang, Jyoti, et autres
Publié: (2024)
Exploring GPT's Ability as a Judge in Music Understanding
par: Fang, Kun, et autres
Publié: (2025)
par: Fang, Kun, et autres
Publié: (2025)
Exploring Diverse Sounds: Identifying Outliers in a Music Corpus
par: Cai, Le, et autres
Publié: (2024)
par: Cai, Le, et autres
Publié: (2024)
Evaluating Interval-based Tokenization for Pitch Representation in Symbolic Music Analysis
par: Le, Dinh-Viet-Toan, et autres
Publié: (2025)
par: Le, Dinh-Viet-Toan, et autres
Publié: (2025)
Personalized Dynamic Music Emotion Recognition with Dual-Scale Attention-Based Meta-Learning
par: Zhang, Dengming, et autres
Publié: (2024)
par: Zhang, Dengming, et autres
Publié: (2024)
Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics
par: Zhang, Hanwen, et autres
Publié: (2025)
par: Zhang, Hanwen, et autres
Publié: (2025)
Expressivity-aware Music Performance Retrieval using Mid-level Perceptual Features and Emotion Word Embeddings
par: Chowdhury, Shreyan, et autres
Publié: (2024)
par: Chowdhury, Shreyan, et autres
Publié: (2024)
Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
par: Wang, Qian, et autres
Publié: (2024)
par: Wang, Qian, et autres
Publié: (2024)
Enriching Music Descriptions with a Finetuned-LLM and Metadata for Text-to-Music Retrieval
par: Doh, SeungHeon, et autres
Publié: (2024)
par: Doh, SeungHeon, et autres
Publié: (2024)
Music Foundation Model as Generic Booster for Music Downstream Tasks
par: Liao, WeiHsiang, et autres
Publié: (2024)
par: Liao, WeiHsiang, et autres
Publié: (2024)
Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset
par: Xu, Weihan, et autres
Publié: (2024)
par: Xu, Weihan, et autres
Publié: (2024)
Nested Music Transformer: Sequentially Decoding Compound Tokens in Symbolic Music and Audio Generation
par: Yoo, HaeJun, et autres
Publié: (2024)
par: Yoo, HaeJun, et autres
Publié: (2024)
JEPOO: Highly Accurate Joint Estimation of Pitch, Onset and Offset for Music Information Retrieval
par: Wei, Haojie, et autres
Publié: (2023)
par: Wei, Haojie, et autres
Publié: (2023)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
par: Papaioannou, Charilaos, et autres
Publié: (2025)
par: Papaioannou, Charilaos, et autres
Publié: (2025)
Natural Language Processing Methods for Symbolic Music Generation and Information Retrieval: a Survey
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
EMelodyGen: Emotion-Conditioned Melody Generation in ABC Notation with the Musical Feature Template
par: Zhou, Monan, et autres
Publié: (2023)
par: Zhou, Monan, et autres
Publié: (2023)
Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
par: Joung, Haesun, et autres
Publié: (2024)
par: Joung, Haesun, et autres
Publié: (2024)
Analyzing Byte-Pair Encoding on Monophonic and Polyphonic Symbolic Music: A Focus on Musical Phrase Segmentation
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
par: Le, Dinh-Viet-Toan, et autres
Publié: (2024)
Advancing the Foundation Model for Music Understanding
par: Jiang, Yi, et autres
Publié: (2025)
par: Jiang, Yi, et autres
Publié: (2025)
TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation
par: Choi, Keunwoo, et autres
Publié: (2025)
par: Choi, Keunwoo, et autres
Publié: (2025)
On the Effect of Data-Augmentation on Local Embedding Properties in the Contrastive Learning of Music Audio Representations
par: McCallum, Matthew C., et autres
Publié: (2024)
par: McCallum, Matthew C., et autres
Publié: (2024)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
par: Mancusi, Michele, et autres
Publié: (2024)
par: Mancusi, Michele, et autres
Publié: (2024)
Analyzing Musical Characteristics of National Anthems in Relation to Global Indices
par: Hasan, S M Rakib, et autres
Publié: (2024)
par: Hasan, S M Rakib, et autres
Publié: (2024)
A Novel Audio Representation for Music Genre Identification in MIR
par: Kamuni, Navin, et autres
Publié: (2024)
par: Kamuni, Navin, et autres
Publié: (2024)
SoundSignature: What Type of Music Do You Like?
par: Carone, Brandon James, et autres
Publié: (2024)
par: Carone, Brandon James, et autres
Publié: (2024)
Improving Musical Instrument Classification with Advanced Machine Learning Techniques
par: Chulev, Joanikij
Publié: (2024)
par: Chulev, Joanikij
Publié: (2024)
VoxRAG: A Step Toward Transcription-Free RAG Systems in Spoken Question Answering
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Track Role Prediction of Single-Instrumental Sequences
par: Han, Changheon, et autres
Publié: (2024)
par: Han, Changheon, et autres
Publié: (2024)
LARP: Language Audio Relational Pre-training for Cold-Start Playlist Continuation
par: Salganik, Rebecca, et autres
Publié: (2024)
par: Salganik, Rebecca, et autres
Publié: (2024)
Language-based Audio Retrieval with Co-Attention Networks
par: Sun, Haoran, et autres
Publié: (2024)
par: Sun, Haoran, et autres
Publié: (2024)
Documents similaires
-
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025) -
TALKPLAY: Multimodal Music Recommendation with Large Language Models
par: Doh, Seungheon, et autres
Publié: (2025) -
Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
par: Kim, Haven, et autres
Publié: (2026) -
Do Captioning Metrics Reflect Music Semantic Alignment?
par: Lee, Jinwoo, et autres
Publié: (2024) -
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
par: Huang, Jingyue, et autres
Publié: (2025)