CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Bai, Qibing, Shi, Shuhao, Wang, Shuai, Ju, Yukai, Wang, Yannan, Li, Haizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
di: Bai, Qibing, et al.
Pubblicazione: (2025)
di: Bai, Qibing, et al.
Pubblicazione: (2025)
Controllable Accent Normalization via Discrete Diffusion
di: Bai, Qibing, et al.
Pubblicazione: (2026)
di: Bai, Qibing, et al.
Pubblicazione: (2026)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
Accent-VITS:accent transfer for end-to-end TTS
di: Ma, Linhan, et al.
Pubblicazione: (2023)
di: Ma, Linhan, et al.
Pubblicazione: (2023)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
Study on the Fairness of Speaker Verification Systems on Underrepresented Accents in English
di: Estevez, Mariel, et al.
Pubblicazione: (2022)
di: Estevez, Mariel, et al.
Pubblicazione: (2022)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
di: R, Vinotha, et al.
Pubblicazione: (2024)
di: R, Vinotha, et al.
Pubblicazione: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
Hierarchical Control of Emotion Rendering in Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2025)
di: Inoue, Sho, et al.
Pubblicazione: (2025)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
di: Li, Sirui, et al.
Pubblicazione: (2025)
di: Li, Sirui, et al.
Pubblicazione: (2025)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications
di: Wee, Marcus Yu Zhe, et al.
Pubblicazione: (2025)
di: Wee, Marcus Yu Zhe, et al.
Pubblicazione: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Performant ASR Models for Medical Entities in Accented Speech
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition
di: Mu, Bingshen, et al.
Pubblicazione: (2024)
di: Mu, Bingshen, et al.
Pubblicazione: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation
di: Lei, Ligong, et al.
Pubblicazione: (2026)
di: Lei, Ligong, et al.
Pubblicazione: (2026)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)
di: Sasu, David, et al.
Pubblicazione: (2025)
Convert and Speak: Zero-shot Accent Conversion with Minimum Supervision
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
di: Bai, Qibing, et al.
Pubblicazione: (2025) -
Controllable Accent Normalization via Discrete Diffusion
di: Bai, Qibing, et al.
Pubblicazione: (2026) -
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
di: Inoue, Sho, et al.
Pubblicazione: (2024) -
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024) -
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)