CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Tsung-Han, Gonzalez, Joseph E., Darrell, Trevor, Chan, David M. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
von: Liu, Jizhong, et al.
Veröffentlicht: (2024)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
von: Manakul, Potsawee, et al.
Veröffentlicht: (2025)
von: Manakul, Potsawee, et al.
Veröffentlicht: (2025)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
von: Kim, Jongsuk, et al.
Veröffentlicht: (2024)
von: Kim, Jongsuk, et al.
Veröffentlicht: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
von: Chen, Chen, et al.
Veröffentlicht: (2025)
von: Chen, Chen, et al.
Veröffentlicht: (2025)
Enhancing Temporal Understanding in Audio Question Answering for Large Audio Language Models
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2024)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
von: Huang, Ailin, et al.
Veröffentlicht: (2025)
von: Huang, Ailin, et al.
Veröffentlicht: (2025)
SpeechVerse: A Large-scale Generalizable Audio Language Model
von: Das, Nilaksh, et al.
Veröffentlicht: (2024)
von: Das, Nilaksh, et al.
Veröffentlicht: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
von: Gu, Hao, et al.
Veröffentlicht: (2025)
von: Gu, Hao, et al.
Veröffentlicht: (2025)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2025)
How Contrastive Decoding Enhances Large Audio Language Models?
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
von: Lin, Tzu-Quan, et al.
Veröffentlicht: (2026)
Spatial Audio Processing with Large Language Model on Wearable Devices
von: Mishra, Ayushi, et al.
Veröffentlicht: (2025)
von: Mishra, Ayushi, et al.
Veröffentlicht: (2025)
Direct Simultaneous Translation Activation for Large Audio-Language Models
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
von: Zhang, Pei, et al.
Veröffentlicht: (2025)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
von: Dixit, Satvik, et al.
Veröffentlicht: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
von: Li, Bohan, et al.
Veröffentlicht: (2025)
von: Li, Bohan, et al.
Veröffentlicht: (2025)
Sci-Phi: A Large Language Model Spatial Audio Descriptor
von: Jiang, Xilin, et al.
Veröffentlicht: (2025)
von: Jiang, Xilin, et al.
Veröffentlicht: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
von: Yang, Hao, et al.
Veröffentlicht: (2026)
von: Yang, Hao, et al.
Veröffentlicht: (2026)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
von: Li, Zhu, et al.
Veröffentlicht: (2025)
von: Li, Zhu, et al.
Veröffentlicht: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
von: Mei, Xinhao, et al.
Veröffentlicht: (2023)
von: Mei, Xinhao, et al.
Veröffentlicht: (2023)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2024)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Improving Text-To-Audio Models with Synthetic Captions
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
von: Gao, Yifan, et al.
Veröffentlicht: (2025)
von: Gao, Yifan, et al.
Veröffentlicht: (2025)
MiMo-Audio: Audio Language Models are Few-Shot Learners
von: Core Team, et al.
Veröffentlicht: (2025)
von: Core Team, et al.
Veröffentlicht: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
von: Ma, Ziyang, et al.
Veröffentlicht: (2025)
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation
von: Lu, Ke-Han, et al.
Veröffentlicht: (2026)
von: Lu, Ke-Han, et al.
Veröffentlicht: (2026)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
von: Huang, Hsiao-Ying, et al.
Veröffentlicht: (2025)
RECAP: Retrieval-Augmented Audio Captioning
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
von: Li, Minzhi, et al.
Veröffentlicht: (2025)
von: Li, Minzhi, et al.
Veröffentlicht: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
von: Moslem, Yasmin
Veröffentlicht: (2024)
von: Moslem, Yasmin
Veröffentlicht: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2026)
von: Lin, Yi-Cheng, et al.
Veröffentlicht: (2026)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2025)
Probing Audio-Generation Capabilities of Text-Based Language Models
von: Anbazhagan, Arjun Prasaath, et al.
Veröffentlicht: (2025)
von: Anbazhagan, Arjun Prasaath, et al.
Veröffentlicht: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
von: Wang, Junyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
von: Liu, Jizhong, et al.
Veröffentlicht: (2024) -
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
von: Manakul, Potsawee, et al.
Veröffentlicht: (2025) -
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025) -
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024) -
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
von: Kim, Jongsuk, et al.
Veröffentlicht: (2024)