Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Chao-Han Huck, Ghosh, Sreyan, Wang, Qing, Kim, Jaeyeon, Hong, Hengyi, Kumar, Sonal, Zhong, Guirui, Kong, Zhifeng, Sakshi, S, Lokegaonkar, Vaibhavi, Nieto, Oriol, Duraiswami, Ramani, Manocha, Dinesh, Kim, Gunhee, Du, Jun, Valle, Rafael, Catanzaro, Bryan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
par: Sakshi, S, et autres
Publié: (2025)
par: Sakshi, S, et autres
Publié: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)
par: Sakshi, S, et autres
Publié: (2024)
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
RECAP: Retrieval-Augmented Audio Captioning
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
par: Lokegaonkar, Vaibhavi, et autres
Publié: (2026)
par: Lokegaonkar, Vaibhavi, et autres
Publié: (2026)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Music Flamingo: Scaling Music Understanding in Audio Language Models
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Do Vision-Language Models Understand Compound Nouns?
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
par: Anand, Nishit, et autres
Publié: (2024)
par: Anand, Nishit, et autres
Publié: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
par: Ghosh, Sreyan, et autres
Publié: (2026)
par: Ghosh, Sreyan, et autres
Publié: (2026)
A Closer Look at the Limitations of Instruction Tuning
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
ProSE: Diffusion Priors for Speech Enhancement
par: Kumar, Sonal, et autres
Publié: (2025)
par: Kumar, Sonal, et autres
Publié: (2025)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
par: Kim, Jaeyeon, et autres
Publié: (2025)
par: Kim, Jaeyeon, et autres
Publié: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
par: Seth, Ashish, et autres
Publié: (2025)
par: Seth, Ashish, et autres
Publié: (2025)
ViSAGe: Video-to-Spatial Audio Generation
par: Kim, Jaeyeon, et autres
Publié: (2025)
par: Kim, Jaeyeon, et autres
Publié: (2025)
Do Audio-Visual Large Language Models Really See and Hear?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
par: Kong, Zhifeng, et autres
Publié: (2025)
par: Kong, Zhifeng, et autres
Publié: (2025)
Learning Illumination Control in Diffusion Models
par: Anand, Nishit, et autres
Publié: (2026)
par: Anand, Nishit, et autres
Publié: (2026)
Audio Dialogues: Dialogues dataset for audio and music understanding
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
Do Audio-Language Models Understand Linguistic Variations?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
par: Gerami, Armin, et autres
Publié: (2025)
par: Gerami, Armin, et autres
Publié: (2025)
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
ETTA: Elucidating the Design Space of Text-to-Audio Models
par: Lee, Sang-gil, et autres
Publié: (2024)
par: Lee, Sang-gil, et autres
Publié: (2024)
TAC: Timestamped Audio Captioning
par: Kumar, Sonal, et autres
Publié: (2026)
par: Kumar, Sonal, et autres
Publié: (2026)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
par: Kong, Zhifeng, et autres
Publié: (2024)
par: Kong, Zhifeng, et autres
Publié: (2024)
CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP
par: Evuru, Chandra Kiran Reddy, et autres
Publié: (2024)
par: Evuru, Chandra Kiran Reddy, et autres
Publié: (2024)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
par: Song, Seokwon, et autres
Publié: (2025)
par: Song, Seokwon, et autres
Publié: (2025)
ORCA: Open-ended Response Correctness Assessment for Audio Question Answering
par: Sedláček, Šimon, et autres
Publié: (2025)
par: Sedláček, Šimon, et autres
Publié: (2025)
Documents similaires
-
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
par: Sakshi, S, et autres
Publié: (2025) -
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2025) -
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025) -
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
par: Ghosh, Sreyan, et autres
Publié: (2024) -
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)