Advanced Modeling of Interlanguage Speech Intelligibility Benefit with L1-L2 Multi-Task Learning Using Differentiable K-Means for Accent-Robust Discrete Token-Based ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Onda, Kentaro, Fukayama, Satoru, Saito, Daisuke, Minematsu, Nobuaki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
di: Park, Joonyong, et al.
Pubblicazione: (2024)
di: Park, Joonyong, et al.
Pubblicazione: (2024)
Phonological Tokenizer: Prosody-Aware Phonetic Token via Multi-Objective Fine-Tuning with Differentiable K-Means
di: Onda, Kentaro, et al.
Pubblicazione: (2026)
di: Onda, Kentaro, et al.
Pubblicazione: (2026)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
Contrastive Regularization for Accent-Robust ASR
di: Thai, Van-Phat, et al.
Pubblicazione: (2026)
di: Thai, Van-Phat, et al.
Pubblicazione: (2026)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
di: Suda, Hitoshi, et al.
Pubblicazione: (2025)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026)
di: Sun, Haitong, et al.
Pubblicazione: (2026)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
Discrete Speech Unit Extraction via Independent Component Analysis
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2025)
Performant ASR Models for Medical Entities in Accented Speech
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
di: Bai, Qibing, et al.
Pubblicazione: (2025)
di: Bai, Qibing, et al.
Pubblicazione: (2025)
Advancing African-Accented Speech Recognition: Epistemic Uncertainty-Driven Data Selection for Generalizable ASR Models
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
di: Dossou, Bonaventure F. P.
Pubblicazione: (2023)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
Few-Shot Accent Synthesis for ASR with LLM-Guided Phoneme Editing
di: Halychanskyi, Yurii, et al.
Pubblicazione: (2026)
di: Halychanskyi, Yurii, et al.
Pubblicazione: (2026)
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
di: Owodunni, Abraham Toluwase, et al.
Pubblicazione: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
di: Park, Joonyong, et al.
Pubblicazione: (2025)
di: Park, Joonyong, et al.
Pubblicazione: (2025)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
di: Suda, Hitoshi, et al.
Pubblicazione: (2024)
di: Suda, Hitoshi, et al.
Pubblicazione: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
di: Dekel, Avihu, et al.
Pubblicazione: (2024)
Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token
di: Seki, Shogo, et al.
Pubblicazione: (2025)
di: Seki, Shogo, et al.
Pubblicazione: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
Recent Advances in Discrete Speech Tokens: A Review
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
di: Bafna, Niyati, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025) -
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025) -
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025) -
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2024) -
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
di: Geng, Haopeng, et al.
Pubblicazione: (2025)