MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rajgarhia, Harshit, Ojha, Shuubham, Shaik, Asif, Pothanapalli, Akhil, Lokesh, Rachuri, Mukherji, Abhishek, Desikan, Prasanna |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
par: Desikan, Prasanna, et autres
Publié: (2026)
par: Desikan, Prasanna, et autres
Publié: (2026)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025)
par: Ojha, Shuubham, et autres
Publié: (2025)
An Evaluation Study of Hybrid Methods for Multilingual PII Detection
par: Rajgarhia, Harshit, et autres
Publié: (2025)
par: Rajgarhia, Harshit, et autres
Publié: (2025)
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025)
par: Rajgarhia, Harshit, et autres
Publié: (2025)
GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
par: Krishna, Leela, et autres
Publié: (2025)
par: Krishna, Leela, et autres
Publié: (2025)
AudioMosaic: Contrastive Masked Audio Representation Learning
par: Huang, Hanxun, et autres
Publié: (2026)
par: Huang, Hanxun, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
par: Lin, Jingru, et autres
Publié: (2026)
par: Lin, Jingru, et autres
Publié: (2026)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
par: Xu, Jilan, et autres
Publié: (2026)
par: Xu, Jilan, et autres
Publié: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
par: Feng, Tiantian, et autres
Publié: (2026)
par: Feng, Tiantian, et autres
Publié: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
par: Zhao, Feiyu, et autres
Publié: (2026)
par: Zhao, Feiyu, et autres
Publié: (2026)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Tadabur: A Large-Scale Quran Audio Dataset
par: Alherran, Faisal
Publié: (2026)
par: Alherran, Faisal
Publié: (2026)
MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
par: Guo, Wenxiang, et autres
Publié: (2025)
par: Guo, Wenxiang, et autres
Publié: (2025)
Psychophysiology-aided Perceptually Fluent Speech Analysis of Children Who Stutter
par: Xiao, Yi, et autres
Publié: (2022)
par: Xiao, Yi, et autres
Publié: (2022)
Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval
par: Xiao, Boda, et autres
Publié: (2026)
par: Xiao, Boda, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
par: Kumar, Sonal, et autres
Publié: (2025)
par: Kumar, Sonal, et autres
Publié: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
par: Kang, Mintong, et autres
Publié: (2026)
par: Kang, Mintong, et autres
Publié: (2026)
SONIC: Sound Optimization for Noise In Crowds
par: N, Pranav M, et autres
Publié: (2025)
par: N, Pranav M, et autres
Publié: (2025)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
par: Surana, Rohan, et autres
Publié: (2025)
par: Surana, Rohan, et autres
Publié: (2025)
VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding
par: Ye, Jashin, et autres
Publié: (2026)
par: Ye, Jashin, et autres
Publié: (2026)
TwinShift: Benchmarking Audio Deepfake Detection across Synthesizer and Speaker Shifts
par: Hong, Jiyoung, et autres
Publié: (2025)
par: Hong, Jiyoung, et autres
Publié: (2025)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Documents similaires
-
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
par: Desikan, Prasanna, et autres
Publié: (2026) -
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025) -
An Evaluation Study of Hybrid Methods for Multilingual PII Detection
par: Rajgarhia, Harshit, et autres
Publié: (2025) -
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025) -
GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
par: Krishna, Leela, et autres
Publié: (2025)