Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kuan, Chun-Yi, Huang, Wei-Ping, Lee, Hung-yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
di: Huang, Hsiao-Ying, et al.
Pubblicazione: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
di: Tseng, Liang-Hsuan, et al.
Pubblicazione: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2024)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2023)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
di: Hsu, Tzu-wen, et al.
Pubblicazione: (2025)
di: Hsu, Tzu-wen, et al.
Pubblicazione: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
di: Lin, Hsi-Che, et al.
Pubblicazione: (2024)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
di: Fu, Yu-Kuan, et al.
Pubblicazione: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2025)
How to Learn a New Language? An Efficient Solution for Self-Supervised Learning Models Unseen Languages Adaption in Low-Resource Scenario
di: Wang, Shih-Heng, et al.
Pubblicazione: (2024)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2024)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
di: Arora, Siddhant, et al.
Pubblicazione: (2024)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
di: Lu, Ke-Han, et al.
Pubblicazione: (2026)
Findings of the 2023 ML-SUPERB Challenge: Pre-Training and Evaluation over More Languages and Beyond
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2024)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
Can Large Language Models Understand Spatial Audio?
di: Tang, Changli, et al.
Pubblicazione: (2024)
di: Tang, Changli, et al.
Pubblicazione: (2024)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024) -
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2025) -
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026) -
How Contrastive Decoding Enhances Large Audio Language Models?
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2026) -
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)