Are you really listening? Boosting Perceptual Awareness in Music-QA Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zang, Yongyi, O'Brien, Sean, Berg-Kirkpatrick, Taylor, McAuley, Julian, Novack, Zachary |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music Generation
par: Novack, Zachary, et autres
Publié: (2024)
par: Novack, Zachary, et autres
Publié: (2024)
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
par: Long, Phillip, et autres
Publié: (2024)
par: Long, Phillip, et autres
Publié: (2024)
DITTO: Diffusion Inference-Time T-Optimization for Music Generation
par: Novack, Zachary, et autres
Publié: (2024)
par: Novack, Zachary, et autres
Publié: (2024)
WildFX: A DAW-Powered Pipeline for In-the-Wild Audio FX Graph Modeling
par: Yang, Qihui, et autres
Publié: (2025)
par: Yang, Qihui, et autres
Publié: (2025)
Steering Autoregressive Music Generation with Recursive Feature Machines
par: Zhao, Daniel, et autres
Publié: (2025)
par: Zhao, Daniel, et autres
Publié: (2025)
Presto! Distilling Steps and Layers for Accelerating Music Generation
par: Novack, Zachary, et autres
Publié: (2024)
par: Novack, Zachary, et autres
Publié: (2024)
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
par: Huang, Jingyue, et autres
Publié: (2025)
par: Huang, Jingyue, et autres
Publié: (2025)
Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset
par: Xu, Weihan, et autres
Publié: (2024)
par: Xu, Weihan, et autres
Publié: (2024)
WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
par: Mundada, Gagan, et autres
Publié: (2025)
par: Mundada, Gagan, et autres
Publié: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025)
par: Kim, Haven, et autres
Publié: (2025)
MuseCPBench: an Empirical Study of Music Editing Methods through Music Context Preservation
par: Vishe, Yash, et autres
Publié: (2025)
par: Vishe, Yash, et autres
Publié: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning
par: Wang, Boyang, et autres
Publié: (2025)
par: Wang, Boyang, et autres
Publié: (2025)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
par: Surana, Rohan, et autres
Publié: (2025)
par: Surana, Rohan, et autres
Publié: (2025)
Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
par: Kim, Haven, et autres
Publié: (2026)
par: Kim, Haven, et autres
Publié: (2026)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation
par: Roh, Jaechul, et autres
Publié: (2025)
par: Roh, Jaechul, et autres
Publié: (2025)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
par: Kim, Haven, et autres
Publié: (2026)
par: Kim, Haven, et autres
Publié: (2026)
Composer Vector: Style-steering Symbolic Music Generation in a Latent Space
par: Jiang, Xunyi, et autres
Publié: (2026)
par: Jiang, Xunyi, et autres
Publié: (2026)
Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
par: Wu, Shangda, et autres
Publié: (2026)
par: Wu, Shangda, et autres
Publié: (2026)
Fast Text-to-Audio Generation with Adversarial Post-Training
par: Novack, Zachary, et autres
Publié: (2025)
par: Novack, Zachary, et autres
Publié: (2025)
StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks
par: Huang, Jingyue, et autres
Publié: (2025)
par: Huang, Jingyue, et autres
Publié: (2025)
The Interpretation Gap in Text-to-Music Generation Models
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on Pop and Classical Music
par: Yao, Mingyang, et autres
Publié: (2025)
par: Yao, Mingyang, et autres
Publié: (2025)
MSRBench: A Benchmarking Dataset for Music Source Restoration
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
GSound-SIR: A Spatial Impulse Response Ray-Tracing and High-order Ambisonic Auralization Python Toolkit
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
Synthesizing Composite Hierarchical Structure from Symbolic Music Corpora
par: Shapiro, Ilana, et autres
Publié: (2025)
par: Shapiro, Ilana, et autres
Publié: (2025)
Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
par: Long, Phillip, et autres
Publié: (2026)
par: Long, Phillip, et autres
Publié: (2026)
HumMusQA: A Human-written Music Understanding QA Benchmark Dataset
par: Weck, Benno, et autres
Publié: (2026)
par: Weck, Benno, et autres
Publié: (2026)
Music Source Restoration
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
FlowSynth: Instrument Generation Through Distributional Flow Matching and Test-Time Search
par: Yang, Qihui, et autres
Publié: (2025)
par: Yang, Qihui, et autres
Publié: (2025)
Efficient Vocal Source Separation Through Windowed Sink Attention
par: Benetatos, Christodoulos, et autres
Publié: (2025)
par: Benetatos, Christodoulos, et autres
Publié: (2025)
Interpretable and Perceptually-Aligned Music Similarity with Pretrained Embeddings
par: Vohra, Arhan, et autres
Publié: (2026)
par: Vohra, Arhan, et autres
Publié: (2026)
Ambisonizer: Neural Upmixing as Spherical Harmonics Generation
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
Aligning Text-to-Music Evaluation with Human Preferences
par: Huang, Yichen, et autres
Publié: (2025)
par: Huang, Yichen, et autres
Publié: (2025)
SAME: A Semantically-Aligned Music Autoencoder
par: Parker, Julian D., et autres
Publié: (2026)
par: Parker, Julian D., et autres
Publié: (2026)
Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering
par: Koh, Junyoung, et autres
Publié: (2026)
par: Koh, Junyoung, et autres
Publié: (2026)
Learning Interpretable Features in Audio Latent Spaces via Sparse Autoencoders
par: Paek, Nathan, et autres
Publié: (2025)
par: Paek, Nathan, et autres
Publié: (2025)
Documents similaires
-
DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music Generation
par: Novack, Zachary, et autres
Publié: (2024) -
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
par: Long, Phillip, et autres
Publié: (2024) -
DITTO: Diffusion Inference-Time T-Optimization for Music Generation
par: Novack, Zachary, et autres
Publié: (2024) -
WildFX: A DAW-Powered Pipeline for In-the-Wild Audio FX Graph Modeling
par: Yang, Qihui, et autres
Publié: (2025) -
Steering Autoregressive Music Generation with Recursive Feature Machines
par: Zhao, Daniel, et autres
Publié: (2025)