Gespeichert in:
| Hauptverfasser: | Li, Xiquan, Quelennec, Aurian, Essid, Slim |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2604.15849 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025)
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025)
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025)
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025)
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
von: Adlouni, Mohammed Ali El, et al.
Veröffentlicht: (2026)
von: Adlouni, Mohammed Ali El, et al.
Veröffentlicht: (2026)
SALT: Standardized Audio event Label Taxonomy
von: Stamatiadis, Paraskevas, et al.
Veröffentlicht: (2024)
von: Stamatiadis, Paraskevas, et al.
Veröffentlicht: (2024)
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
von: Berger, Clémentine, et al.
Veröffentlicht: (2025)
von: Berger, Clémentine, et al.
Veröffentlicht: (2025)
A Contrastive Self-Supervised Learning scheme for beat tracking amenable to few-shot learning
von: Gagnere, Antonin, et al.
Veröffentlicht: (2024)
von: Gagnere, Antonin, et al.
Veröffentlicht: (2024)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
von: Zaiem, Salah, et al.
Veröffentlicht: (2024)
von: Zaiem, Salah, et al.
Veröffentlicht: (2024)
Controlling Contrastive Self-Supervised Learning with Knowledge-Driven Multiple Hypothesis: Application to Beat Tracking
von: Gagnere, Antonin, et al.
Veröffentlicht: (2025)
von: Gagnere, Antonin, et al.
Veröffentlicht: (2025)
A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification
von: Olvera, Michel, et al.
Veröffentlicht: (2024)
von: Olvera, Michel, et al.
Veröffentlicht: (2024)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
von: Malard, Hugo, et al.
Veröffentlicht: (2024)
von: Malard, Hugo, et al.
Veröffentlicht: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
Online speaker diarization of meetings guided by speech separation
von: Gruttadauria, Elio, et al.
Veröffentlicht: (2024)
von: Gruttadauria, Elio, et al.
Veröffentlicht: (2024)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
von: Serre, Thomas, et al.
Veröffentlicht: (2026)
von: Serre, Thomas, et al.
Veröffentlicht: (2026)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
von: Serre, Thomas, et al.
Veröffentlicht: (2024)
von: Serre, Thomas, et al.
Veröffentlicht: (2024)
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
von: Gruttadauria, Elio, et al.
Veröffentlicht: (2025)
von: Gruttadauria, Elio, et al.
Veröffentlicht: (2025)
IS${}^3$ : Generic Impulsive--Stationary Sound Separation in Acoustic Scenes using Deep Filtering
von: Berger, Clémentine, et al.
Veröffentlicht: (2025)
von: Berger, Clémentine, et al.
Veröffentlicht: (2025)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
von: Li, Xiquan, et al.
Veröffentlicht: (2026)
Multiple Choice Learning for Efficient Speech Separation with Many Speakers
von: Perera, David, et al.
Veröffentlicht: (2024)
von: Perera, David, et al.
Veröffentlicht: (2024)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
von: Li, Xiquan, et al.
Veröffentlicht: (2025)
von: Li, Xiquan, et al.
Veröffentlicht: (2025)
OpenMU: Your Swiss Army Knife for Music Understanding
von: Zhao, Mengjie, et al.
Veröffentlicht: (2024)
von: Zhao, Mengjie, et al.
Veröffentlicht: (2024)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
Speech Self-Supervised Representations Benchmarking: a Case for Larger Probing Heads
von: Zaiem, Salah, et al.
Veröffentlicht: (2023)
von: Zaiem, Salah, et al.
Veröffentlicht: (2023)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
von: Weck, Benno, et al.
Veröffentlicht: (2024)
von: Weck, Benno, et al.
Veröffentlicht: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
von: Dai, Zheqi, et al.
Veröffentlicht: (2026)
von: Dai, Zheqi, et al.
Veröffentlicht: (2026)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding
von: Guinot, Julien, et al.
Veröffentlicht: (2025)
von: Guinot, Julien, et al.
Veröffentlicht: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
von: Yin, Han, et al.
Veröffentlicht: (2025)
von: Yin, Han, et al.
Veröffentlicht: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
von: Dai, Congren, et al.
Veröffentlicht: (2025)
von: Dai, Congren, et al.
Veröffentlicht: (2025)
Towards Reliable Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
Annealed Multiple Choice Learning: Overcoming limitations of Winner-takes-all with annealing
von: Perera, David, et al.
Veröffentlicht: (2024)
von: Perera, David, et al.
Veröffentlicht: (2024)
Do Foundational Audio Encoders Understand Music Structure?
von: Toyama, Keisuke, et al.
Veröffentlicht: (2025)
von: Toyama, Keisuke, et al.
Veröffentlicht: (2025)
Assessing Factual Music Comprehension in Large Audio Language Models
von: Lin, Daniel Chenyu, et al.
Veröffentlicht: (2025)
von: Lin, Daniel Chenyu, et al.
Veröffentlicht: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
von: Su, Yuchen, et al.
Veröffentlicht: (2026)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
von: Wang, Ziqian, et al.
Veröffentlicht: (2025)
von: Wang, Ziqian, et al.
Veröffentlicht: (2025)
Can Large Language Models Understand Spatial Audio?
von: Tang, Changli, et al.
Veröffentlicht: (2024)
von: Tang, Changli, et al.
Veröffentlicht: (2024)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
von: Feng, Tiantian, et al.
Veröffentlicht: (2026)
von: Feng, Tiantian, et al.
Veröffentlicht: (2026)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
von: Salganik, Rebecca, et al.
Veröffentlicht: (2026)
von: Salganik, Rebecca, et al.
Veröffentlicht: (2026)
ABC-Eval: Benchmarking Large Language Models on Symbolic Music Understanding and Instruction Following
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025) -
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
von: Quelennec, Aurian, et al.
Veröffentlicht: (2025) -
S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models
von: Adlouni, Mohammed Ali El, et al.
Veröffentlicht: (2026) -
SALT: Standardized Audio event Label Taxonomy
von: Stamatiadis, Paraskevas, et al.
Veröffentlicht: (2024) -
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
von: Berger, Clémentine, et al.
Veröffentlicht: (2025)