TinyMU: A Compact Audio-Language Model for Music Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xiquan, Quelennec, Aurian, Essid, Slim |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025)
por: Quelennec, Aurian, et al.
Publicado: (2025)
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025)
por: Quelennec, Aurian, et al.
Publicado: (2025)
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026)
SALT: Standardized Audio event Label Taxonomy
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
por: Berger, Clémentine, et al.
Publicado: (2025)
por: Berger, Clémentine, et al.
Publicado: (2025)
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
por: Gagnere, Antonin, et al.
Publicado: (2024)
por: Gagnere, Antonin, et al.
Publicado: (2024)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
por: Zaiem, Salah, et al.
Publicado: (2024)
por: Zaiem, Salah, et al.
Publicado: (2024)
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
por: Gagnere, Antonin, et al.
Publicado: (2025)
por: Gagnere, Antonin, et al.
Publicado: (2025)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
por: Olvera, Michel, et al.
Publicado: (2024)
por: Olvera, Michel, et al.
Publicado: (2024)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
por: Malard, Hugo, et al.
Publicado: (2024)
por: Malard, Hugo, et al.
Publicado: (2024)
Online speaker diarization of meetings guided by speech separation
por: Gruttadauria, Elio, et al.
Publicado: (2024)
por: Gruttadauria, Elio, et al.
Publicado: (2024)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
por: Serre, Thomas, et al.
Publicado: (2026)
por: Serre, Thomas, et al.
Publicado: (2026)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
por: Gruttadauria, Elio, et al.
Publicado: (2025)
por: Gruttadauria, Elio, et al.
Publicado: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025)
por: Li, Xiquan, et al.
Publicado: (2025)
OpenMU: Your Swiss Army Knife for Music Understanding
por: Zhao, Mengjie, et al.
Publicado: (2024)
por: Zhao, Mengjie, et al.
Publicado: (2024)
IS${}^3$ : Generic Impulsive--Stationary Sound Separation in Acoustic Scenes using Deep Filtering
por: Berger, Clémentine, et al.
Publicado: (2025)
por: Berger, Clémentine, et al.
Publicado: (2025)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
por: Weck, Benno, et al.
Publicado: (2024)
por: Weck, Benno, et al.
Publicado: (2024)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
por: Perera, David, et al.
Publicado: (2024)
por: Perera, David, et al.
Publicado: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding
por: Guinot, Julien, et al.
Publicado: (2025)
por: Guinot, Julien, et al.
Publicado: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
por: Zaiem, Salah, et al.
Publicado: (2023)
por: Zaiem, Salah, et al.
Publicado: (2023)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
por: Dai, Congren, et al.
Publicado: (2025)
por: Dai, Congren, et al.
Publicado: (2025)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
por: Feng, Tiantian, et al.
Publicado: (2026)
por: Feng, Tiantian, et al.
Publicado: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
por: Su, Yuchen, et al.
Publicado: (2026)
por: Su, Yuchen, et al.
Publicado: (2026)
Assessing Factual Music Comprehension in Large Audio Language Models
por: Lin, Daniel Chenyu, et al.
Publicado: (2025)
por: Lin, Daniel Chenyu, et al.
Publicado: (2025)
Can Large Language Models Understand Spatial Audio?
por: Tang, Changli, et al.
Publicado: (2024)
por: Tang, Changli, et al.
Publicado: (2024)
Do Foundational Audio Encoders Understand Music Structure?
por: Toyama, Keisuke, et al.
Publicado: (2025)
por: Toyama, Keisuke, et al.
Publicado: (2025)
ABC-Eval: Benchmarking Large Language Models on Symbolic Music Understanding and Instruction Following
por: Zhao, Jiahao, et al.
Publicado: (2025)
por: Zhao, Jiahao, et al.
Publicado: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding
por: Ye, Jashin, et al.
Publicado: (2026)
por: Ye, Jashin, et al.
Publicado: (2026)
Audio ControlNet for Fine-Grained Audio Generation and Editing
por: Zhu, Haina, et al.
Publicado: (2026)
por: Zhu, Haina, et al.
Publicado: (2026)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)
por: Salganik, Rebecca, et al.
Publicado: (2026)
MERIT: Learning Disentangled Music Representations for Audio Similarity
por: Roy, Abhinaba, et al.
Publicado: (2026)
por: Roy, Abhinaba, et al.
Publicado: (2026)
Ejemplares similares
-
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025) -
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
por: Quelennec, Aurian, et al.
Publicado: (2025) -
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
por: Adlouni, Mohammed Ali El, et al.
Publicado: (2026) -
SALT: Standardized Audio event Label Taxonomy
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024) -
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
por: Berger, Clémentine, et al.
Publicado: (2025)