MACE: Leveraging Audio for Evaluating Audio Captioning Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Dixit, Satvik, Deshmukh, Soham, Raj, Bhiksha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
por: Dixit, Satvik, et al.
Publicado: (2025)
por: Dixit, Satvik, et al.
Publicado: (2025)
Domain Adaptation for Contrastive Audio-Language Models
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Improving Speaker Representations Using Contrastive Losses on Multi-scale Features
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Pengi: An Audio Language Model for Audio Tasks
por: Deshmukh, Soham, et al.
Publicado: (2023)
por: Deshmukh, Soham, et al.
Publicado: (2023)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Natural Language Supervision for General-Purpose Audio Representations
por: Elizalde, Benjamin, et al.
Publicado: (2023)
por: Elizalde, Benjamin, et al.
Publicado: (2023)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024)
por: Bukhari, Hazim, et al.
Publicado: (2024)
ADIFF: Explaining audio difference using natural language
por: Deshmukh, Soham, et al.
Publicado: (2025)
por: Deshmukh, Soham, et al.
Publicado: (2025)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
por: Dixit, Satvik, et al.
Publicado: (2025)
por: Dixit, Satvik, et al.
Publicado: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
por: Wijngaard, Gijs, et al.
Publicado: (2024)
por: Wijngaard, Gijs, et al.
Publicado: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
por: Dinkel, Heinrich, et al.
Publicado: (2025)
por: Dinkel, Heinrich, et al.
Publicado: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
por: Bharadwaj, Shikhar, et al.
Publicado: (2025)
por: Bharadwaj, Shikhar, et al.
Publicado: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
por: Mahfuz, Rehana, et al.
Publicado: (2024)
por: Mahfuz, Rehana, et al.
Publicado: (2024)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
por: Kumar, Sonal, et al.
Publicado: (2025)
por: Kumar, Sonal, et al.
Publicado: (2025)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Human Voice is Unique
por: Singh, Rita, et al.
Publicado: (2025)
por: Singh, Rita, et al.
Publicado: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
por: Xie, Zeyu, et al.
Publicado: (2023)
por: Xie, Zeyu, et al.
Publicado: (2023)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
Improving Audio Captioning Models with Fine-grained Audio Features, Text Embedding Supervision, and LLM Mix-up Augmentation
por: Wu, Shih-Lun, et al.
Publicado: (2023)
por: Wu, Shih-Lun, et al.
Publicado: (2023)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
por: Qiu, Kai, et al.
Publicado: (2024)
por: Qiu, Kai, et al.
Publicado: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
por: Xin, Yifei, et al.
Publicado: (2023)
por: Xin, Yifei, et al.
Publicado: (2023)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
por: Wu, Yusong, et al.
Publicado: (2022)
por: Wu, Yusong, et al.
Publicado: (2022)
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
Did You Hear That? Introducing AADG: A Framework for Generating Benchmark Data in Audio Anomaly Detection
por: Raghavan, Ksheeraja, et al.
Publicado: (2024)
por: Raghavan, Ksheeraja, et al.
Publicado: (2024)
Ejemplares similares
-
AURA Score: A Metric For Holistic Audio Question Answering Evaluation
por: Dixit, Satvik, et al.
Publicado: (2025) -
Domain Adaptation for Contrastive Audio-Language Models
por: Deshmukh, Soham, et al.
Publicado: (2024) -
Mellow: a small audio language model for reasoning
por: Deshmukh, Soham, et al.
Publicado: (2025) -
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024) -
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)