AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Kuan, Chun-Yi, Chang, Kai-Wei, Lee, Hung-yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation
di: Huang, Kuan-Po, et al.
Pubblicazione: (2026)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2026)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
Towards Spatial Audio Understanding via Question Answering
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
Towards General-Purpose Text-Instruction-Guided Voice Conversion
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2023)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2023)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
di: Huang, Kuan-Po, et al.
Pubblicazione: (2025)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2025)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
Improving Audio Question Answering with Variational Inference
di: Chen, Haolin
Pubblicazione: (2026)
di: Chen, Haolin
Pubblicazione: (2026)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
di: Piao, Yen-Ting, et al.
Pubblicazione: (2026)
di: Piao, Yen-Ting, et al.
Pubblicazione: (2026)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2026)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
di: Chung, HaeChun
Pubblicazione: (2025)
di: Chung, HaeChun
Pubblicazione: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026) -
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025) -
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024) -
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025) -
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)