Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)
Fuente:
arXiv
Guardado en:
| Autores principales: | Allauzen, Cyril, Bagby, Tom, Heigold, Georg, Variani, Ehsan, Wu, Ke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Massive Sound Embedding Benchmark (MSEB)
por: Heigold, Georg, et al.
Publicado: (2026)
por: Heigold, Georg, et al.
Publicado: (2026)
MAEB: Massive Audio Embedding Benchmark
por: Assadi, Adnan El, et al.
Publicado: (2026)
por: Assadi, Adnan El, et al.
Publicado: (2026)
Audio Geolocation: A Natural Sounds Benchmark
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
Benchmarking Diarization Models
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Sound Signal Synthesis with Auxiliary Classifier GAN, COVID-19 cough as an example
por: Saleh, Yahya Sherif Solayman Mohamed, et al.
Publicado: (2025)
por: Saleh, Yahya Sherif Solayman Mohamed, et al.
Publicado: (2025)
A Novel Fusion Architecture for PD Detection Using Semi-Supervised Speech Embeddings
por: Adnan, Tariq, et al.
Publicado: (2024)
por: Adnan, Tariq, et al.
Publicado: (2024)
Benchmarking Music Generation Models and Metrics via Human Preference Studies
por: Grötschla, Florian, et al.
Publicado: (2025)
por: Grötschla, Florian, et al.
Publicado: (2025)
PROCESS-2: A Benchmark Speech Corpus for Early Cognitive Impairment Detection
por: Pahar, Madhurananda, et al.
Publicado: (2026)
por: Pahar, Madhurananda, et al.
Publicado: (2026)
DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation
por: Shao, Weichuang, et al.
Publicado: (2025)
por: Shao, Weichuang, et al.
Publicado: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
por: Yu, Tao, et al.
Publicado: (2026)
por: Yu, Tao, et al.
Publicado: (2026)
LibriVAD: A Scalable Open Dataset with Deep Learning Benchmarks for Voice Activity Detection
por: Stylianou, Ioannis, et al.
Publicado: (2025)
por: Stylianou, Ioannis, et al.
Publicado: (2025)
Embedding-Space Diffusion for Zero-Shot Environmental Sound Classification
por: Sims, Ysobel, et al.
Publicado: (2024)
por: Sims, Ysobel, et al.
Publicado: (2024)
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Analysis-Driven Procedural Generation of an Engine Sound Dataset with Embedded Control Annotations
por: Doerfler, Robin, et al.
Publicado: (2026)
por: Doerfler, Robin, et al.
Publicado: (2026)
Uncertainty Calibration of Multi-Label Bird Sound Classifiers
por: Schwinger, Raphael, et al.
Publicado: (2025)
por: Schwinger, Raphael, et al.
Publicado: (2025)
Dynamic-SUPERB: Towards A Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark for Speech
por: Huang, Chien-yu, et al.
Publicado: (2023)
por: Huang, Chien-yu, et al.
Publicado: (2023)
Unleashing the Power of Natural Audio Featuring Multiple Sound Sources
por: Cheng, Xize, et al.
Publicado: (2025)
por: Cheng, Xize, et al.
Publicado: (2025)
Benchmarks and leaderboards for sound demixing tasks
por: Solovyev, Roman, et al.
Publicado: (2023)
por: Solovyev, Roman, et al.
Publicado: (2023)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context
por: Hou, Yuanbo, et al.
Publicado: (2026)
por: Hou, Yuanbo, et al.
Publicado: (2026)
Sound and Music Biases in Deep Music Transcription Models: A Systematic Analysis
por: Marták, Lukáš Samuel, et al.
Publicado: (2025)
por: Marták, Lukáš Samuel, et al.
Publicado: (2025)
ESTM: An Enhanced Dual-Branch Spectral-Temporal Mamba for Anomalous Sound Detection
por: Ma, Chengyuan, et al.
Publicado: (2025)
por: Ma, Chengyuan, et al.
Publicado: (2025)
Benchmarking Representations for Speech, Music, and Acoustic Events
por: La Quatra, Moreno, et al.
Publicado: (2024)
por: La Quatra, Moreno, et al.
Publicado: (2024)
Improving Deep Learning-based Respiratory Sound Analysis with Frequency Selection and Attention Mechanism
por: Fraihi, Nouhaila, et al.
Publicado: (2025)
por: Fraihi, Nouhaila, et al.
Publicado: (2025)
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
por: Banerjee, Adhiraj, et al.
Publicado: (2025)
por: Banerjee, Adhiraj, et al.
Publicado: (2025)
MedASR: An Open-Source Model for High-Accuracy Medical Dictation
por: Wu, Ke, et al.
Publicado: (2026)
por: Wu, Ke, et al.
Publicado: (2026)
A Framework for Evaluating Faithfulness in Explainable AI for Machine Anomalous Sound Detection Using Frequency-Band Perturbation
por: Buck, Alexander, et al.
Publicado: (2026)
por: Buck, Alexander, et al.
Publicado: (2026)
Rethinking Music Captioning with Music Metadata LLMs
por: Bukey, Irmak, et al.
Publicado: (2026)
por: Bukey, Irmak, et al.
Publicado: (2026)
Investigating Modality Contribution in Audio LLMs for Music
por: Morais, Giovana, et al.
Publicado: (2025)
por: Morais, Giovana, et al.
Publicado: (2025)
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
por: Zhang, Yuanhe, et al.
Publicado: (2026)
por: Zhang, Yuanhe, et al.
Publicado: (2026)
End-to-End Efficiency in Keyword Spotting: A System-Level Approach for Embedded Microcontrollers
por: Bartoli, Pietro, et al.
Publicado: (2025)
por: Bartoli, Pietro, et al.
Publicado: (2025)
mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
por: Beyene, Luel Hagos, et al.
Publicado: (2025)
RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks
por: Diaconu, Alexandra, et al.
Publicado: (2026)
por: Diaconu, Alexandra, et al.
Publicado: (2026)
SoundMorpher: Perceptually-Uniform Sound Morphing with Diffusion Model
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
DeepForestSound: a multi-species automatic detector for passive acoustic monitoring in African tropical forests, a case study in Kibale National Park
por: Dubus, Gabriel, et al.
Publicado: (2026)
por: Dubus, Gabriel, et al.
Publicado: (2026)
Woosh: A Sound Effects Foundation Model
por: Hadjeres, Gaëtan, et al.
Publicado: (2026)
por: Hadjeres, Gaëtan, et al.
Publicado: (2026)
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
por: Pang, Jiacheng, et al.
Publicado: (2026)
por: Pang, Jiacheng, et al.
Publicado: (2026)
Ejemplares similares
-
Massive Sound Embedding Benchmark (MSEB)
por: Heigold, Georg, et al.
Publicado: (2026) -
MAEB: Massive Audio Embedding Benchmark
por: Assadi, Adnan El, et al.
Publicado: (2026) -
Audio Geolocation: A Natural Sounds Benchmark
por: Chasmai, Mustafa, et al.
Publicado: (2025) -
Benchmarking Diarization Models
por: Lanzendörfer, Luca A., et al.
Publicado: (2025) -
TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
por: Lin, Yi-Cheng, et al.
Publicado: (2025)