KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jinyoung, Lim, Hyeongsoo, Seo, Eunseo, Jang, Minho, Choi, Keunwoo, Shin, Seungyoun, Yoon, Ji Won |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
Intelli-Z: Toward Intelligible Zero-Shot TTS
di: Jung, Sunghee, et al.
Pubblicazione: (2024)
di: Jung, Sunghee, et al.
Pubblicazione: (2024)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Comparative Evaluation of Acoustic Feature Extraction Tools for Clinical Speech Analysis
di: Choi, Anna Seo Gyeong, et al.
Pubblicazione: (2025)
di: Choi, Anna Seo Gyeong, et al.
Pubblicazione: (2025)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
di: Chen, Yuanjian, et al.
Pubblicazione: (2026)
di: Chen, Yuanjian, et al.
Pubblicazione: (2026)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
di: Chen, Yushen, et al.
Pubblicazione: (2024)
di: Chen, Yushen, et al.
Pubblicazione: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024)
di: Giraldo, José, et al.
Pubblicazione: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
di: Manakul, Potsawee, et al.
Pubblicazione: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhao, Xiaohan, et al.
Pubblicazione: (2025)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
di: Yeom, Jiheum, et al.
Pubblicazione: (2024)
di: Yeom, Jiheum, et al.
Pubblicazione: (2024)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
di: Daeglau, Mareike, et al.
Pubblicazione: (2025)
di: Daeglau, Mareike, et al.
Pubblicazione: (2025)
Towards Spatial Audio Understanding via Question Answering
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Can Large Language Models Understand Spatial Audio?
di: Tang, Changli, et al.
Pubblicazione: (2024)
di: Tang, Changli, et al.
Pubblicazione: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
di: Kuznetsova, Anastasia, et al.
Pubblicazione: (2025)
di: Kuznetsova, Anastasia, et al.
Pubblicazione: (2025)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024) -
Intelli-Z: Toward Intelligible Zero-Shot TTS
di: Jung, Sunghee, et al.
Pubblicazione: (2024) -
TALKPLAY: Multimodal Music Recommendation with Large Language Models
di: Doh, Seungheon, et al.
Pubblicazione: (2025) -
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024) -
TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
di: Doh, Seungheon, et al.
Pubblicazione: (2025)