Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chao-Han Huck, Ghosh, Sreyan, Wang, Qing, Kim, Jaeyeon, Hong, Hengyi, Kumar, Sonal, Zhong, Guirui, Kong, Zhifeng, Sakshi, S, Lokegaonkar, Vaibhavi, Nieto, Oriol, Duraiswami, Ramani, Manocha, Dinesh, Kim, Gunhee, Du, Jun, Valle, Rafael, Catanzaro, Bryan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
por: Sakshi, S, et al.
Publicado: (2025)
por: Sakshi, S, et al.
Publicado: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025)
por: Goel, Arushi, et al.
Publicado: (2025)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
por: Sakshi, S, et al.
Publicado: (2024)
por: Sakshi, S, et al.
Publicado: (2024)
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
RECAP: Retrieval-Augmented Audio Captioning
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
por: Lokegaonkar, Vaibhavi, et al.
Publicado: (2026)
por: Lokegaonkar, Vaibhavi, et al.
Publicado: (2026)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Music Flamingo: Scaling Music Understanding in Audio Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Do Vision-Language Models Understand Compound Nouns?
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
por: Anand, Nishit, et al.
Publicado: (2024)
por: Anand, Nishit, et al.
Publicado: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
por: Seth, Ashish, et al.
Publicado: (2026)
por: Seth, Ashish, et al.
Publicado: (2026)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
A Closer Look at the Limitations of Instruction Tuning
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
ProSE: Diffusion Priors for Speech Enhancement
por: Kumar, Sonal, et al.
Publicado: (2025)
por: Kumar, Sonal, et al.
Publicado: (2025)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2025)
por: Seth, Ashish, et al.
Publicado: (2025)
ViSAGe: Video-to-Spatial Audio Generation
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
Do Audio-Visual Large Language Models Really See and Hear?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Learning Illumination Control in Diffusion Models
por: Anand, Nishit, et al.
Publicado: (2026)
por: Anand, Nishit, et al.
Publicado: (2026)
Audio Dialogues: Dialogues dataset for audio and music understanding
por: Goel, Arushi, et al.
Publicado: (2024)
por: Goel, Arushi, et al.
Publicado: (2024)
Do Audio-Language Models Understand Linguistic Variations?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
por: Gerami, Armin, et al.
Publicado: (2025)
por: Gerami, Armin, et al.
Publicado: (2025)
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024)
por: Lee, Sang-gil, et al.
Publicado: (2024)
TAC: Timestamped Audio Captioning
por: Kumar, Sonal, et al.
Publicado: (2026)
por: Kumar, Sonal, et al.
Publicado: (2026)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
por: Song, Seokwon, et al.
Publicado: (2025)
por: Song, Seokwon, et al.
Publicado: (2025)
ORCA: Open-ended Response Correctness Assessment for Audio Question Answering
por: Sedláček, Šimon, et al.
Publicado: (2025)
por: Sedláček, Šimon, et al.
Publicado: (2025)
Ejemplares similares
-
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
por: Sakshi, S, et al.
Publicado: (2025) -
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025) -
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025) -
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
por: Ghosh, Sreyan, et al.
Publicado: (2024) -
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
por: Sakshi, S, et al.
Publicado: (2024)