CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lee, Insung, Jeong, Taeyoung, Yoo, Haejun, Chang, Du-Seong, Koo, Myoung-Wan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
von: Yoo, HaeJun, et al.
Veröffentlicht: (2026)
von: Yoo, HaeJun, et al.
Veröffentlicht: (2026)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
von: Bhattacharya, Debarpan, et al.
Veröffentlicht: (2025)
von: Bhattacharya, Debarpan, et al.
Veröffentlicht: (2025)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026)
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
von: Li, Xiquan, et al.
Veröffentlicht: (2024)
von: Li, Xiquan, et al.
Veröffentlicht: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
von: Choi, Yerin, et al.
Veröffentlicht: (2024)
von: Choi, Yerin, et al.
Veröffentlicht: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
RECAP: Retrieval-Augmented Audio Captioning
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
von: Diwan, Anuj, et al.
Veröffentlicht: (2026)
von: Diwan, Anuj, et al.
Veröffentlicht: (2026)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
von: Lee, Jeehyun, et al.
Veröffentlicht: (2024)
von: Lee, Jeehyun, et al.
Veröffentlicht: (2024)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
von: Guo, Tianyu, et al.
Veröffentlicht: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
von: Takeuchi, Daiki, et al.
Veröffentlicht: (2025)
von: Takeuchi, Daiki, et al.
Veröffentlicht: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
von: Kuan, Chun-Yi, et al.
Veröffentlicht: (2026)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
von: Paissan, Francesco, et al.
Veröffentlicht: (2023)
von: Paissan, Francesco, et al.
Veröffentlicht: (2023)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
von: Yun, Jun-Hak, et al.
Veröffentlicht: (2025)
von: Yun, Jun-Hak, et al.
Veröffentlicht: (2025)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
von: Luo, Jiehui, et al.
Veröffentlicht: (2025)
von: Luo, Jiehui, et al.
Veröffentlicht: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
von: Yin, Han, et al.
Veröffentlicht: (2025)
von: Yin, Han, et al.
Veröffentlicht: (2025)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
von: Tian, Jinchuan, et al.
Veröffentlicht: (2026)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2026)
Revealing the Role of Audio Channels in ASR Performance Degradation
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
von: Huang, Kuan-Tang, et al.
Veröffentlicht: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence
von: Lee, Hyeongkeun, et al.
Veröffentlicht: (2026)
von: Lee, Hyeongkeun, et al.
Veröffentlicht: (2026)
Spatial Audio Motion Understanding and Reasoning
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2025)
von: Sridhar, Arvind Krishna, et al.
Veröffentlicht: (2025)
Fish Audio S2 Technical Report
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
von: Liao, Shijia, et al.
Veröffentlicht: (2026)
Diverse Audio Embeddings -- Bringing Features Back Outperforms CLAP!
von: Verma, Prateek
Veröffentlicht: (2023)
von: Verma, Prateek
Veröffentlicht: (2023)
Audio ControlNet for Fine-Grained Audio Generation and Editing
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
von: Zhu, Haina, et al.
Veröffentlicht: (2026)
Improving Text-To-Audio Models with Synthetic Captions
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
von: Kong, Zhifeng, et al.
Veröffentlicht: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
von: Mahfuz, Rehana, et al.
Veröffentlicht: (2024)
von: Mahfuz, Rehana, et al.
Veröffentlicht: (2024)
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
von: Lee, Junseok, et al.
Veröffentlicht: (2026)
von: Lee, Junseok, et al.
Veröffentlicht: (2026)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
von: Munakata, Hokuto, et al.
Veröffentlicht: (2025)
Classifier-Guided Captioning Across Modalities
von: Shaulov, Ariel, et al.
Veröffentlicht: (2025)
von: Shaulov, Ariel, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
von: Yoo, HaeJun, et al.
Veröffentlicht: (2026) -
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024) -
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
von: Bhattacharya, Debarpan, et al.
Veröffentlicht: (2025) -
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024) -
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
von: Xie, Xinyuan, et al.
Veröffentlicht: (2026)