Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Onda, Kentaro, Imoto, Keisuke, Fukayama, Satoru, Saito, Daisuke, Minematsu, Nobuaki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
par: Onda, Kentaro, et autres
Publié: (2024)
par: Onda, Kentaro, et autres
Publié: (2024)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
par: Geng, Haopeng, et autres
Publié: (2024)
par: Geng, Haopeng, et autres
Publié: (2024)
Advanced Modeling of Interlanguage Speech Intelligibility Benefit with L1-L2 Multi-Task Learning Using Differentiable K-Means for Accent-Robust Discrete Token-Based ASR
par: Onda, Kentaro, et autres
Publié: (2026)
par: Onda, Kentaro, et autres
Publié: (2026)
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings
par: Geng, Haopeng, et autres
Publié: (2024)
par: Geng, Haopeng, et autres
Publié: (2024)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
par: Geng, Haopeng, et autres
Publié: (2025)
par: Geng, Haopeng, et autres
Publié: (2025)
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
par: Sun, Haitong, et autres
Publié: (2026)
par: Sun, Haitong, et autres
Publié: (2026)
Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora
par: Suda, Hitoshi, et autres
Publié: (2025)
par: Suda, Hitoshi, et autres
Publié: (2025)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
par: Park, Joonyong, et autres
Publié: (2024)
par: Park, Joonyong, et autres
Publié: (2024)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
par: Huang, Zhijie, et autres
Publié: (2026)
par: Huang, Zhijie, et autres
Publié: (2026)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
par: Geng, Haopeng, et autres
Publié: (2026)
par: Geng, Haopeng, et autres
Publié: (2026)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
par: Zhong, Jinzuomu, et autres
Publié: (2026)
par: Zhong, Jinzuomu, et autres
Publié: (2026)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
par: Imoto, Keisuke
Publié: (2025)
par: Imoto, Keisuke
Publié: (2025)
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
par: Bai, Qibing, et autres
Publié: (2025)
par: Bai, Qibing, et autres
Publié: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Discrete Speech Unit Extraction via Independent Component Analysis
par: Nakamura, Tomohiko, et autres
Publié: (2025)
par: Nakamura, Tomohiko, et autres
Publié: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
par: Suda, Hitoshi, et autres
Publié: (2024)
par: Suda, Hitoshi, et autres
Publié: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
par: Poncelet, Jakob, et autres
Publié: (2023)
par: Poncelet, Jakob, et autres
Publié: (2023)
LEAD Dataset: How Can Labels for Sound Event Detection Vary Depending on Annotators?
par: Koga, Naoki, et autres
Publié: (2024)
par: Koga, Naoki, et autres
Publié: (2024)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
par: Chary, Podakanti Satyajith
Publié: (2024)
par: Chary, Podakanti Satyajith
Publié: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
par: Park, Joonyong, et autres
Publié: (2025)
par: Park, Joonyong, et autres
Publié: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
par: Tsubaki, Shunsuke, et autres
Publié: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
PSST! Prosodic Speech Segmentation with Transformers
par: Roll, Nathan, et autres
Publié: (2023)
par: Roll, Nathan, et autres
Publié: (2023)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
par: Chen, Peikun, et autres
Publié: (2024)
par: Chen, Peikun, et autres
Publié: (2024)
How Much Does Machine Identity Matter in Anomalous Sound Detection at Test Time?
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
IdolSongsJp Corpus: A Multi-Singer Song Corpus in the Style of Japanese Idol Groups
par: Suda, Hitoshi, et autres
Publié: (2025)
par: Suda, Hitoshi, et autres
Publié: (2025)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
par: Huang, Wen-Chin, et autres
Publié: (2026)
par: Huang, Wen-Chin, et autres
Publié: (2026)
Context-Aware Query Refinement for Target Sound Extraction: Handling Partially Matched Queries
par: Sato, Ryo, et autres
Publié: (2025)
par: Sato, Ryo, et autres
Publié: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Construction and Analysis of Impression Caption Dataset for Environmental Sounds
par: Okamoto, Yuki, et autres
Publié: (2024)
par: Okamoto, Yuki, et autres
Publié: (2024)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
par: R, Vinotha, et autres
Publié: (2024)
par: R, Vinotha, et autres
Publié: (2024)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
par: Yamauchi, Kazuki, et autres
Publié: (2026)
par: Yamauchi, Kazuki, et autres
Publié: (2026)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
Documents similaires
-
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
par: Onda, Kentaro, et autres
Publié: (2025) -
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025) -
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
par: Onda, Kentaro, et autres
Publié: (2024) -
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
par: Geng, Haopeng, et autres
Publié: (2024) -
Advanced Modeling of Interlanguage Speech Intelligibility Benefit with L1-L2 Multi-Task Learning Using Differentiable K-Means for Accent-Robust Discrete Token-Based ASR
par: Onda, Kentaro, et autres
Publié: (2026)