Guardado en:
| Autores principales: | Seth, Ashish, Kumar, Sonal, Selvakumar, Ramaneswaran, Anand, Nishit, Tyagi, Utkarsh, Seetharaman, Prem, Duraiswami, Ramani, Manocha, Dinesh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.29263 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
por: Sakshi, S, et al.
Publicado: (2024)
por: Sakshi, S, et al.
Publicado: (2024)
Do Audio-Language Models Understand Linguistic Variations?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
por: Anand, Nishit, et al.
Publicado: (2024)
por: Anand, Nishit, et al.
Publicado: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2025)
por: Seth, Ashish, et al.
Publicado: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Do Audio-Visual Large Language Models Really See and Hear?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
RECAP: Retrieval-Augmented Audio Captioning
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025)
por: Goel, Arushi, et al.
Publicado: (2025)
TAC: Timestamped Audio Captioning
por: Kumar, Sonal, et al.
Publicado: (2026)
por: Kumar, Sonal, et al.
Publicado: (2026)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Generative Audio Extension and Morphing
por: Seetharaman, Prem, et al.
Publicado: (2026)
por: Seetharaman, Prem, et al.
Publicado: (2026)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
por: Gerami, Armin, et al.
Publicado: (2025)
por: Gerami, Armin, et al.
Publicado: (2025)
Taming Audio VAEs via Target-KL Regularization
por: Seetharaman, Prem, et al.
Publicado: (2026)
por: Seetharaman, Prem, et al.
Publicado: (2026)
Analytical Exploration of Spatial Audio Cues: A Differentiable Multi-Sphere Scattering Model
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2026)
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2026)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
AV-RIR: Audio-Visual Room Impulse Response Estimation
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
por: Sridhar, Sripathi, et al.
Publicado: (2026)
por: Sridhar, Sripathi, et al.
Publicado: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
por: Chen, William, et al.
Publicado: (2026)
por: Chen, William, et al.
Publicado: (2026)
Learning Illumination Control in Diffusion Models
por: Anand, Nishit, et al.
Publicado: (2026)
por: Anand, Nishit, et al.
Publicado: (2026)
FLAM: Frame-Wise Language-Audio Modeling
por: Wu, Yusong, et al.
Publicado: (2025)
por: Wu, Yusong, et al.
Publicado: (2025)
Biomimetic Frontend for Differentiable Audio Processing
por: Famularo, Ruolan Leslie, et al.
Publicado: (2024)
por: Famularo, Ruolan Leslie, et al.
Publicado: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
por: O'Reilly, Patrick, et al.
Publicado: (2024)
por: O'Reilly, Patrick, et al.
Publicado: (2024)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
por: Yang, Chao-Han Huck, et al.
Publicado: (2025)
por: Yang, Chao-Han Huck, et al.
Publicado: (2025)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
por: O'Reilly, Patrick, et al.
Publicado: (2025)
por: O'Reilly, Patrick, et al.
Publicado: (2025)
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
por: Sakshi, S, et al.
Publicado: (2025)
por: Sakshi, S, et al.
Publicado: (2025)
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
por: García, Hugo Flores, et al.
Publicado: (2024)
por: García, Hugo Flores, et al.
Publicado: (2024)
Do Vision-Language Models Understand Compound Nouns?
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
ProSE: Diffusion Priors for Speech Enhancement
por: Kumar, Sonal, et al.
Publicado: (2025)
por: Kumar, Sonal, et al.
Publicado: (2025)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
por: Kumar, Sonal, et al.
Publicado: (2025)
por: Kumar, Sonal, et al.
Publicado: (2025)
Applying Automatic Differentiation to Optimize Differential Microphone Array Designs
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2024)
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2024)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
Ejemplares similares
-
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
por: Sakshi, S, et al.
Publicado: (2024) -
Do Audio-Language Models Understand Linguistic Variations?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024) -
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
por: Anand, Nishit, et al.
Publicado: (2024) -
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
por: Seth, Ashish, et al.
Publicado: (2024) -
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2023)