UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Kato, Shuhei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
par: Zheng, Yuang, et autres
Publié: (2026)
par: Zheng, Yuang, et autres
Publié: (2026)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024)
par: Xu, Tianyi, et autres
Publié: (2024)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
par: Qi, Xin, et autres
Publié: (2024)
par: Qi, Xin, et autres
Publié: (2024)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation
par: Lou, Haowei, et autres
Publié: (2025)
par: Lou, Haowei, et autres
Publié: (2025)
Sparsely Shared LoRA on Whisper for Child Speech Recognition
par: Liu, Wei, et autres
Publié: (2023)
par: Liu, Wei, et autres
Publié: (2023)
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
par: Do, Cong-Thanh, et autres
Publié: (2024)
par: Do, Cong-Thanh, et autres
Publié: (2024)
Controlling Emotion in Text-to-Speech with Natural Language Prompts
par: Bott, Thomas, et autres
Publié: (2024)
par: Bott, Thomas, et autres
Publié: (2024)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
par: Sun, Siqi, et autres
Publié: (2024)
par: Sun, Siqi, et autres
Publié: (2024)
XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model
par: Casanova, Edresson, et autres
Publié: (2024)
par: Casanova, Edresson, et autres
Publié: (2024)
MultiPA: A Multi-task Speech Pronunciation Assessment Model for Open Response Scenarios
par: Chen, Yu-Wen, et autres
Publié: (2023)
par: Chen, Yu-Wen, et autres
Publié: (2023)
Cross-lingual Text-To-Speech with Flow-based Voice Conversion for Improved Pronunciation
par: Ellinas, Nikolaos, et autres
Publié: (2022)
par: Ellinas, Nikolaos, et autres
Publié: (2022)
SpeechTaxi: On Multilingual Semantic Speech Classification
par: Keller, Lennart, et autres
Publié: (2024)
par: Keller, Lennart, et autres
Publié: (2024)
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
par: Denisov, Pavel, et autres
Publié: (2024)
par: Denisov, Pavel, et autres
Publié: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
par: Piñeiro-Martín, Andrés, et autres
Publié: (2024)
par: Piñeiro-Martín, Andrés, et autres
Publié: (2024)
PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control
par: Zhang, Shaozuo, et autres
Publié: (2025)
par: Zhang, Shaozuo, et autres
Publié: (2025)
Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond
par: Lee, Beomseok, et autres
Publié: (2024)
par: Lee, Beomseok, et autres
Publié: (2024)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Exploring Spoken Language Identification Strategies for Automatic Transcription of Multilingual Broadcast and Institutional Speech
par: Valente, Martina, et autres
Publié: (2024)
par: Valente, Martina, et autres
Publié: (2024)
CAMEO: Collection of Multilingual Emotional Speech Corpora
par: Christop, Iwona, et autres
Publié: (2025)
par: Christop, Iwona, et autres
Publié: (2025)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
par: Elisha, Shahar, et autres
Publié: (2024)
par: Elisha, Shahar, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
par: Nguyen, Tuan-Nam, et autres
Publié: (2025)
par: Nguyen, Tuan-Nam, et autres
Publié: (2025)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
par: Zheng, Zhisheng, et autres
Publié: (2025)
par: Zheng, Zhisheng, et autres
Publié: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
par: Ferraz, Thomas Palmeira, et autres
Publié: (2023)
Documents similaires
-
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025) -
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
par: Zheng, Yuang, et autres
Publié: (2026) -
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024) -
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
par: Qi, Xin, et autres
Publié: (2024) -
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)