Enregistré dans:
| Auteurs principaux: | Fu, Kaiqi, Peng, Linkai, Yang, Nan, Zhou, Shuran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.09209 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
par: Chen, Yu-Wen, et autres
Publié: (2023)
par: Chen, Yu-Wen, et autres
Publié: (2023)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
Spoken Language Intelligence of Large Language Models for Language Learning
par: Peng, Linkai, et autres
Publié: (2023)
par: Peng, Linkai, et autres
Publié: (2023)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints
par: Meng, Hao, et autres
Publié: (2026)
par: Meng, Hao, et autres
Publié: (2026)
Towards Efficient and Multifaceted Computer-assisted Pronunciation Training Leveraging Hierarchical Selective State Space Model and Decoupled Cross-entropy Loss
par: Chao, Fu-An, et autres
Publié: (2025)
par: Chao, Fu-An, et autres
Publié: (2025)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing
par: Cheng, Gaofeng, et autres
Publié: (2025)
par: Cheng, Gaofeng, et autres
Publié: (2025)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
par: Nguyen, Tuan-Nam, et autres
Publié: (2025)
par: Nguyen, Tuan-Nam, et autres
Publié: (2025)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
par: Sun, Siqi, et autres
Publié: (2024)
par: Sun, Siqi, et autres
Publié: (2024)
Segmentation-free Goodness of Pronunciation
par: Cao, Xinwei, et autres
Publié: (2025)
par: Cao, Xinwei, et autres
Publié: (2025)
Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation Assessment
par: Choi, Kwanghee, et autres
Publié: (2025)
par: Choi, Kwanghee, et autres
Publié: (2025)
UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
par: Kato, Shuhei
Publié: (2025)
par: Kato, Shuhei
Publié: (2025)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
par: Li, Shuhe, et autres
Publié: (2025)
par: Li, Shuhe, et autres
Publié: (2025)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Multi-stage Large Language Model Correction for Speech Recognition
par: Pu, Jie, et autres
Publié: (2023)
par: Pu, Jie, et autres
Publié: (2023)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Chain of Correction for Full-text Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2025)
par: Tang, Zhiyuan, et autres
Publié: (2025)
Assessment of L2 Oral Proficiency using Speech Large Language Models
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2023)
par: Dutta, Soumya, et autres
Publié: (2023)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
par: Lin, Guan-Ting, et autres
Publié: (2023)
par: Lin, Guan-Ting, et autres
Publié: (2023)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
par: Yan, Bi-Cheng, et autres
Publié: (2025)
par: Yan, Bi-Cheng, et autres
Publié: (2025)
Mispronunciation Detection Without L2 Pronunciation Dataset in Low-Resource Setting: A Case Study in Finland Swedish
par: Phan, Nhan, et autres
Publié: (2025)
par: Phan, Nhan, et autres
Publié: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
M3TCM: Multi-modal Multi-task Context Model for Utterance Classification in Motivational Interviews
par: Hossain, Sayed Muddashir, et autres
Publié: (2024)
par: Hossain, Sayed Muddashir, et autres
Publié: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation
par: Yusuyin, Saierdaer, et autres
Publié: (2025)
par: Yusuyin, Saierdaer, et autres
Publié: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
par: Hao, Hongkun, et autres
Publié: (2023)
par: Hao, Hongkun, et autres
Publié: (2023)
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Large Language Models based ASR Error Correction for Child Conversations
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
par: Liu, Yansong, et autres
Publié: (2025)
par: Liu, Yansong, et autres
Publié: (2025)
Spatial Audio Processing with Large Language Model on Wearable Devices
par: Mishra, Ayushi, et autres
Publié: (2025)
par: Mishra, Ayushi, et autres
Publié: (2025)
Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation
par: Ellinas, Nikolaos, et autres
Publié: (2022)
par: Ellinas, Nikolaos, et autres
Publié: (2022)
Documents similaires
-
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025) -
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025) -
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
par: Chen, Yu-Wen, et autres
Publié: (2023) -
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025) -
Spoken Language Intelligence of Large Language Models for Language Learning
par: Peng, Linkai, et autres
Publié: (2023)