Data-Balanced Curriculum Learning for Audio Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Wijngaard, Gijs, Formisano, Elia, Esposito, Michele, Dumontier, Michel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Audio-Language Datasets of Scenes and Events: A Survey
por: Wijngaard, Gijs, et al.
Publicado: (2024)
por: Wijngaard, Gijs, et al.
Publicado: (2024)
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
por: Wijngaard, Gijs, et al.
Publicado: (2024)
por: Wijngaard, Gijs, et al.
Publicado: (2024)
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
Improving Audio Question Answering with Variational Inference
por: Chen, Haolin
Publicado: (2026)
por: Chen, Haolin
Publicado: (2026)
Towards Spatial Audio Understanding via Question Answering
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
SALT: Standardized Audio event Label Taxonomy
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
por: Stamatiadis, Paraskevas, et al.
Publicado: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
por: Khanjani, Zahra, et al.
Publicado: (2024)
por: Khanjani, Zahra, et al.
Publicado: (2024)
RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity
por: Bertolino, Gaia A., et al.
Publicado: (2026)
por: Bertolino, Gaia A., et al.
Publicado: (2026)
Target Speaker Extraction with Curriculum Learning
por: Liu, Yun, et al.
Publicado: (2024)
por: Liu, Yun, et al.
Publicado: (2024)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
Compositional Audio Representation Learning
por: Sridhar, Sripathi, et al.
Publicado: (2024)
por: Sridhar, Sripathi, et al.
Publicado: (2024)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
por: Xu, Xuenan, et al.
Publicado: (2023)
por: Xu, Xuenan, et al.
Publicado: (2023)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
por: Xu, Qisheng, et al.
Publicado: (2024)
por: Xu, Qisheng, et al.
Publicado: (2024)
Deep Learning for Personalized Binaural Audio Reproduction
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
por: Koo, Junghyun, et al.
Publicado: (2025)
por: Koo, Junghyun, et al.
Publicado: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
Naturalness-Aware Curriculum Learning with Dynamic Temperature for Speech Deepfake Detection
por: Kim, Taewoo, et al.
Publicado: (2025)
por: Kim, Taewoo, et al.
Publicado: (2025)
Leveraging Audio-Only Data for Text-Queried Target Sound Extraction
por: Saijo, Kohei, et al.
Publicado: (2024)
por: Saijo, Kohei, et al.
Publicado: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
por: Xin, Yifei, et al.
Publicado: (2024)
por: Xin, Yifei, et al.
Publicado: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
Class-Incremental Learning for Multi-Label Audio Classification
por: Mulimani, Manjunath, et al.
Publicado: (2024)
por: Mulimani, Manjunath, et al.
Publicado: (2024)
Advancing Continual Learning for Robust Deepfake Audio Classification
por: Dong, Feiyi, et al.
Publicado: (2024)
por: Dong, Feiyi, et al.
Publicado: (2024)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
Unlocking Large Audio-Language Models for Interactive Language Learning
por: Liu, Hongfu, et al.
Publicado: (2026)
por: Liu, Hongfu, et al.
Publicado: (2026)
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
por: Jeong, Wonwoo
Publicado: (2026)
por: Jeong, Wonwoo
Publicado: (2026)
Generalized Fake Audio Detection via Deep Stable Learning
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Ejemplares similares
-
Audio-Language Datasets of Scenes and Events: A Survey
por: Wijngaard, Gijs, et al.
Publicado: (2024) -
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
por: Wijngaard, Gijs, et al.
Publicado: (2024) -
AudioToolAgent: An Agentic Framework for Audio-Language Models
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
Improving Audio Question Answering with Variational Inference
por: Chen, Haolin
Publicado: (2026)