Improving Audio Question Answering with Variational Inference
Fuente:
arXiv
Guardado en:
| Autor principal: | Chen, Haolin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data-Balanced Curriculum Learning for Audio Question Answering
por: Wijngaard, Gijs, et al.
Publicado: (2025)
por: Wijngaard, Gijs, et al.
Publicado: (2025)
Towards Spatial Audio Understanding via Question Answering
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026)
por: Dai, Zheqi, et al.
Publicado: (2026)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
Towards Generalizability to Tone and Content Variations in the Transcription of Amplifier Rendered Electric Guitar Audio
por: Chen, Yu-Hua, et al.
Publicado: (2025)
por: Chen, Yu-Hua, et al.
Publicado: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
VI-PANN: Harnessing Transfer Learning and Uncertainty-Aware Variational Inference for Improved Generalization in Audio Pattern Recognition
por: Fischer, John, et al.
Publicado: (2024)
por: Fischer, John, et al.
Publicado: (2024)
RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity
por: Bertolino, Gaia A., et al.
Publicado: (2026)
por: Bertolino, Gaia A., et al.
Publicado: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
por: Steinmetz, Christian J., et al.
Publicado: (2024)
por: Steinmetz, Christian J., et al.
Publicado: (2024)
Exploring Differences between Human Perception and Model Inference in Audio Event Recognition
por: Tan, Yizhou, et al.
Publicado: (2024)
por: Tan, Yizhou, et al.
Publicado: (2024)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
por: Koo, Junghyun, et al.
Publicado: (2025)
por: Koo, Junghyun, et al.
Publicado: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
por: Lin, Jingru, et al.
Publicado: (2026)
por: Lin, Jingru, et al.
Publicado: (2026)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
por: Jia, Yuhang, et al.
Publicado: (2024)
por: Jia, Yuhang, et al.
Publicado: (2024)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
por: Xin, Yifei, et al.
Publicado: (2023)
por: Xin, Yifei, et al.
Publicado: (2023)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
por: Wang, Zehan, et al.
Publicado: (2025)
por: Wang, Zehan, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Unified Audio Event Detection
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
por: Yang, Mu, et al.
Publicado: (2024)
por: Yang, Mu, et al.
Publicado: (2024)
QuarkAudio Technical Report
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Source Tracing of Audio Deepfake Systems
por: Klein, Nicholas, et al.
Publicado: (2024)
por: Klein, Nicholas, et al.
Publicado: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
Deep Learning for Personalized Binaural Audio Reproduction
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
por: Li, Chenxing, et al.
Publicado: (2024)
por: Li, Chenxing, et al.
Publicado: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Ejemplares similares
-
Data-Balanced Curriculum Learning for Audio Question Answering
por: Wijngaard, Gijs, et al.
Publicado: (2025) -
Towards Spatial Audio Understanding via Question Answering
por: Sudarsanam, Parthasaarathy, et al.
Publicado: (2025) -
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
por: Sridhar, Arvind Krishna, et al.
Publicado: (2024) -
SemanticAudio: Audio Generation and Editing in Semantic Space
por: Dai, Zheqi, et al.
Publicado: (2026) -
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
por: Wang, Xinyu, et al.
Publicado: (2024)