Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ke, He, Lei, Liu, Kun, Deng, Yan, Wei, Wenning, Zhao, Sheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
di: Wang, Ke, et al.
Pubblicazione: (2025)
di: Wang, Ke, et al.
Pubblicazione: (2025)
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
di: Chen, Yu-Wen, et al.
Pubblicazione: (2023)
di: Chen, Yu-Wen, et al.
Pubblicazione: (2023)
Towards Unsupervised Speech Recognition Without Pronunciation Models
di: Ni, Junrui, et al.
Pubblicazione: (2024)
di: Ni, Junrui, et al.
Pubblicazione: (2024)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
di: Do, Heejin, et al.
Pubblicazione: (2024)
di: Do, Heejin, et al.
Pubblicazione: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
di: Wang, Yujin, et al.
Pubblicazione: (2022)
di: Wang, Yujin, et al.
Pubblicazione: (2022)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
di: Sun, Siqi, et al.
Pubblicazione: (2024)
di: Sun, Siqi, et al.
Pubblicazione: (2024)
IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)
di: Kheir, Yassine El, et al.
Pubblicazione: (2026)
di: Kheir, Yassine El, et al.
Pubblicazione: (2026)
Towards a Unified Benchmark for Arabic Pronunciation Assessment: Quranic Recitation as Case Study
di: Kheir, Yassine El, et al.
Pubblicazione: (2025)
di: Kheir, Yassine El, et al.
Pubblicazione: (2025)
UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
di: Kato, Shuhei
Pubblicazione: (2025)
di: Kato, Shuhei
Pubblicazione: (2025)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
Mispronunciation Detection Without L2 Pronunciation Dataset in Low-Resource Setting: A Case Study in Finland Swedish
di: Phan, Nhan, et al.
Pubblicazione: (2025)
di: Phan, Nhan, et al.
Pubblicazione: (2025)
Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
di: Wang, Bin, et al.
Pubblicazione: (2025)
di: Wang, Bin, et al.
Pubblicazione: (2025)
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
di: Yang, Runyan, et al.
Pubblicazione: (2024)
di: Yang, Runyan, et al.
Pubblicazione: (2024)
Next Tokens Denoising for Speech Synthesis
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
Assessment of L2 Oral Proficiency using Speech Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2024)
di: Xu, Hainan, et al.
Pubblicazione: (2024)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
di: Shao, Qijie, et al.
Pubblicazione: (2025)
di: Shao, Qijie, et al.
Pubblicazione: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
di: Min, Zeping, et al.
Pubblicazione: (2023)
di: Min, Zeping, et al.
Pubblicazione: (2023)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
di: Chen, Sanyuan, et al.
Pubblicazione: (2024)
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
di: Wu, Shangda, et al.
Pubblicazione: (2024)
di: Wu, Shangda, et al.
Pubblicazione: (2024)
Towards Probing Speech-Specific Risks in Large Multimodal Models: A Taxonomy, Benchmark, and Insights
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models
di: Çoban, Enis Berk, et al.
Pubblicazione: (2024)
di: Çoban, Enis Berk, et al.
Pubblicazione: (2024)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
di: Wei, Kun, et al.
Pubblicazione: (2023)
di: Wei, Kun, et al.
Pubblicazione: (2023)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
di: Li, Shuhe, et al.
Pubblicazione: (2025)
di: Li, Shuhe, et al.
Pubblicazione: (2025)
Effective Context in Neural Speech Models
di: Meng, Yen, et al.
Pubblicazione: (2025)
di: Meng, Yen, et al.
Pubblicazione: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
di: Lu, Hao-Chien, et al.
Pubblicazione: (2025)
di: Lu, Hao-Chien, et al.
Pubblicazione: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
di: Wang, Chung-Chun, et al.
Pubblicazione: (2025)
di: Wang, Chung-Chun, et al.
Pubblicazione: (2025)
EMMeTT: Efficient Multimodal Machine Translation Training
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
di: Wang, Ke, et al.
Pubblicazione: (2025) -
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
di: Chen, Yu-Wen, et al.
Pubblicazione: (2023) -
Towards Unsupervised Speech Recognition Without Pronunciation Models
di: Ni, Junrui, et al.
Pubblicazione: (2024) -
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025) -
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)