Multi-Source Evidence Fusion for Audio Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Olev, Aivo, Alumäe, Tanel |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge
von: Alumäe, Tanel, et al.
Veröffentlicht: (2025)
von: Alumäe, Tanel, et al.
Veröffentlicht: (2025)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
von: Žavoronkov, Aleksei, et al.
Veröffentlicht: (2025)
von: Žavoronkov, Aleksei, et al.
Veröffentlicht: (2025)
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
von: Sildam, Tiia, et al.
Veröffentlicht: (2024)
von: Sildam, Tiia, et al.
Veröffentlicht: (2024)
Unveiling Audio Deepfake Origins: A Deep Metric learning And Conformer Network Approach With Ensemble Fusion
von: Kulkarni, Ajinkya, et al.
Veröffentlicht: (2025)
von: Kulkarni, Ajinkya, et al.
Veröffentlicht: (2025)
Optimizing Estonian TV Subtitles with Semi-supervised Learning and LLMs
von: Fedorchenko, Artem, et al.
Veröffentlicht: (2025)
von: Fedorchenko, Artem, et al.
Veröffentlicht: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
PixIT: Joint Training of Speaker Diarization and Speech Separation from Real-world Multi-speaker Recordings
von: Kalda, Joonas, et al.
Veröffentlicht: (2024)
von: Kalda, Joonas, et al.
Veröffentlicht: (2024)
Speech DF Arena: A Leaderboard for Speech DeepFake Detection Models
von: Dowerah, Sandipana, et al.
Veröffentlicht: (2025)
von: Dowerah, Sandipana, et al.
Veröffentlicht: (2025)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
von: Yang, Chao-Han Huck, et al.
Veröffentlicht: (2025)
von: Yang, Chao-Han Huck, et al.
Veröffentlicht: (2025)
TalTech-IRIT-LIS Speaker and Language Diarization Systems for DISPLACE 2024
von: Kalda, Joonas, et al.
Veröffentlicht: (2024)
von: Kalda, Joonas, et al.
Veröffentlicht: (2024)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data
von: Xie, Jingran, et al.
Veröffentlicht: (2025)
von: Xie, Jingran, et al.
Veröffentlicht: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
Multimodal Magic Elevating Depression Detection with a Fusion of Text and Audio Intelligence
von: Gan, Lindy, et al.
Veröffentlicht: (2025)
von: Gan, Lindy, et al.
Veröffentlicht: (2025)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
von: Feng, Yangguang
Veröffentlicht: (2024)
von: Feng, Yangguang
Veröffentlicht: (2024)
Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
von: Yang, Runyan, et al.
Veröffentlicht: (2025)
von: Yang, Runyan, et al.
Veröffentlicht: (2025)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
von: Hsu, Tzu-wen, et al.
Veröffentlicht: (2025)
von: Hsu, Tzu-wen, et al.
Veröffentlicht: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Improving Audio Question Answering with Variational Inference
von: Chen, Haolin
Veröffentlicht: (2026)
von: Chen, Haolin
Veröffentlicht: (2026)
Analysing the Language of Neural Audio Codecs
von: Park, Joonyong, et al.
Veröffentlicht: (2025)
von: Park, Joonyong, et al.
Veröffentlicht: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
Data-Balanced Curriculum Learning for Audio Question Answering
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2025)
von: Wijngaard, Gijs, et al.
Veröffentlicht: (2025)
Towards Spatial Audio Understanding via Question Answering
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
Music Flamingo: Scaling Music Understanding in Audio Language Models
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2025)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2025)
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
von: Kang, Wonjune, et al.
Veröffentlicht: (2024)
von: Kang, Wonjune, et al.
Veröffentlicht: (2024)
Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
von: Nachmani, Eliya, et al.
Veröffentlicht: (2023)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
von: Sun, Siqi, et al.
Veröffentlicht: (2024)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
von: Zhao, Xiutian, et al.
Veröffentlicht: (2026)
von: Zhao, Xiutian, et al.
Veröffentlicht: (2026)
Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models
von: Zhao, Xiutian, et al.
Veröffentlicht: (2026)
von: Zhao, Xiutian, et al.
Veröffentlicht: (2026)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
von: Yusuf, Bolaji, et al.
Veröffentlicht: (2024)
von: Yusuf, Bolaji, et al.
Veröffentlicht: (2024)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
von: Core Team, et al.
Veröffentlicht: (2025)
von: Core Team, et al.
Veröffentlicht: (2025)
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2026)
Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
von: Blandón, María Andrea Cruz, et al.
Veröffentlicht: (2025)
von: Blandón, María Andrea Cruz, et al.
Veröffentlicht: (2025)
AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
von: Chen, Guoguo, et al.
Veröffentlicht: (2021)
von: Chen, Guoguo, et al.
Veröffentlicht: (2021)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TalTech Systems for the Interspeech 2025 ML-SUPERB 2.0 Challenge
von: Alumäe, Tanel, et al.
Veröffentlicht: (2025) -
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
von: Žavoronkov, Aleksei, et al.
Veröffentlicht: (2025) -
Finetuning End-to-End Models for Estonian Conversational Spoken Language Translation
von: Sildam, Tiia, et al.
Veröffentlicht: (2024) -
Unveiling Audio Deepfake Origins: A Deep Metric learning And Conformer Network Approach With Ensemble Fusion
von: Kulkarni, Ajinkya, et al.
Veröffentlicht: (2025) -
Optimizing Estonian TV Subtitles with Semi-supervised Learning and LLMs
von: Fedorchenko, Artem, et al.
Veröffentlicht: (2025)