CLARITY: Contextual Linguistic Adaptation and Accent Retrieval for Dual-Bias Mitigation in Text-to-Speech Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Poon, Crystal Min Hui, Ng, Pai Chet, Miao, Xiaoxiao, Loh, Immanuel Jun Kai, Zhang, Bowen, Song, Haoyu, Mcloughlin, Ian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Machine Learning and Language Models for Multimodal Depression Detection
di: Hong, Javier Si Zhao, et al.
Pubblicazione: (2025)
di: Hong, Javier Si Zhao, et al.
Pubblicazione: (2025)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
Optimizing Multilingual Text-To-Speech with Accents & Emotions
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages
di: Maltais, Marie, et al.
Pubblicazione: (2026)
di: Maltais, Marie, et al.
Pubblicazione: (2026)
FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec
di: Halychanskyi, Yurii, et al.
Pubblicazione: (2025)
di: Halychanskyi, Yurii, et al.
Pubblicazione: (2025)
DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
CLAR: CIF-Localized Alignment for Retrieval-Augmented Speech LLM-Based Contextual ASR
di: Huang, Shangkun, et al.
Pubblicazione: (2026)
di: Huang, Shangkun, et al.
Pubblicazione: (2026)
GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
Performant ASR Models for Medical Entities in Accented Speech
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
SecureSpeech: Prompt-based Speaker and Content Protection
di: Hui, Belinda Soh Hui, et al.
Pubblicazione: (2025)
di: Hui, Belinda Soh Hui, et al.
Pubblicazione: (2025)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
di: R, Vinotha, et al.
Pubblicazione: (2024)
di: R, Vinotha, et al.
Pubblicazione: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
Speech Emotion Recognition via Entropy-Aware Score Selection
di: Chua, ChenYi, et al.
Pubblicazione: (2025)
di: Chua, ChenYi, et al.
Pubblicazione: (2025)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2026)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)
di: Sasu, David, et al.
Pubblicazione: (2025)
BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
di: Xing, Jingyuan, et al.
Pubblicazione: (2025)
di: Xing, Jingyuan, et al.
Pubblicazione: (2025)
Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR
di: Magoshi, Ryo, et al.
Pubblicazione: (2026)
di: Magoshi, Ryo, et al.
Pubblicazione: (2026)
ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition
di: Pang, Zi Haur, et al.
Pubblicazione: (2026)
di: Pang, Zi Haur, et al.
Pubblicazione: (2026)
Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
An Efficient Transfer Learning Method Based on Adapter with Local Attributes for Speech Emotion Recognition
di: Song, Haoyu, et al.
Pubblicazione: (2025)
di: Song, Haoyu, et al.
Pubblicazione: (2025)
Online Register for Dual-Mode Self-Supervised Speech Models: Mitigating The Lack of Future Context
di: Goto, Keita, et al.
Pubblicazione: (2026)
di: Goto, Keita, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Exploring Machine Learning and Language Models for Multimodal Depression Detection
di: Hong, Javier Si Zhao, et al.
Pubblicazione: (2025) -
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024) -
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
di: Inoue, Sho, et al.
Pubblicazione: (2024) -
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025) -
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)