CC-G2PnP: Streaming Grapheme-to-Phoneme and prosody with Conformer-CTC for unsegmented languages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shirahata, Yuma, Yamamoto, Ryuichi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
par: Ohnaka, Hien, et autres
Publié: (2025)
par: Ohnaka, Hien, et autres
Publié: (2025)
Audio-conditioned phonemic and prosodic annotation for building text-to-speech models from unlabeled speech data
par: Shirahata, Yuma, et autres
Publié: (2024)
par: Shirahata, Yuma, et autres
Publié: (2024)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
par: Kawamura, Masaya, et autres
Publié: (2025)
par: Kawamura, Masaya, et autres
Publié: (2025)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
par: Yamamoto, Ryuichi, et autres
Publié: (2024)
par: Yamamoto, Ryuichi, et autres
Publié: (2024)
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
par: Kawamura, Masaya, et autres
Publié: (2024)
par: Kawamura, Masaya, et autres
Publié: (2024)
SLASH: Self-Supervised Speech Pitch Estimation Leveraging DSP-derived Absolute Pitch
par: Terashima, Ryo, et autres
Publié: (2025)
par: Terashima, Ryo, et autres
Publié: (2025)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
par: Pritzen, Julia, et autres
Publié: (2021)
par: Pritzen, Julia, et autres
Publié: (2021)
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
par: Kolani, Yakov, et autres
Publié: (2025)
par: Kolani, Yakov, et autres
Publié: (2025)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
par: Ohnaka, Hien, et autres
Publié: (2026)
par: Ohnaka, Hien, et autres
Publié: (2026)
Universal Score-based Speech Enhancement with High Content Preservation
par: Scheibler, Robin, et autres
Publié: (2024)
par: Scheibler, Robin, et autres
Publié: (2024)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026)
par: Tsai, Kai-Chen, et autres
Publié: (2026)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
par: Fujita, Yuya, et autres
Publié: (2024)
par: Fujita, Yuya, et autres
Publié: (2024)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
par: Yoneyama, Reo, et autres
Publié: (2025)
par: Yoneyama, Reo, et autres
Publié: (2025)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
Phoneme-based speech recognition driven by large language models and sampling marginalization
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition
par: Hou, Junfeng, et autres
Publié: (2024)
par: Hou, Junfeng, et autres
Publié: (2024)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
par: Yoneyama, Reo, et autres
Publié: (2024)
par: Yoneyama, Reo, et autres
Publié: (2024)
SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment
par: Eom, SooHwan, et autres
Publié: (2026)
par: Eom, SooHwan, et autres
Publié: (2026)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
par: Saon, George, et autres
Publié: (2026)
par: Saon, George, et autres
Publié: (2026)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
Towards a Quantitative Analysis of Coarticulation with a Phoneme-to-Articulatory Model
par: Fan, Chaofei, et autres
Publié: (2024)
par: Fan, Chaofei, et autres
Publié: (2024)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
par: Jin, Sichen, et autres
Publié: (2024)
par: Jin, Sichen, et autres
Publié: (2024)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
Silent Speech Sentence Recognition with Six-Axis Accelerometers using Conformer and CTC Algorithm
par: Xie, Yudong, et autres
Publié: (2025)
par: Xie, Yudong, et autres
Publié: (2025)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
par: Moriya, Takafumi, et autres
Publié: (2025)
par: Moriya, Takafumi, et autres
Publié: (2025)
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
par: Eom, SooHwan, et autres
Publié: (2024)
par: Eom, SooHwan, et autres
Publié: (2024)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026)
par: Liu, Hanwen, et autres
Publié: (2026)
A Phoneme-Scale Assessment of Multichannel Speech Enhancement Algorithms
par: Monir, Nasser-Eddine, et autres
Publié: (2024)
par: Monir, Nasser-Eddine, et autres
Publié: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2025)
par: Salvi, Davide, et autres
Publié: (2025)
Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
Audiobook-CC: Controllable Long-context Speech Generation for Multicast Audiobook
par: Liu, Min, et autres
Publié: (2025)
par: Liu, Min, et autres
Publié: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
par: Zhou, Xuanru, et autres
Publié: (2025)
par: Zhou, Xuanru, et autres
Publié: (2025)
Evaluating Multichannel Speech Enhancement Algorithms at the Phoneme Scale Across Genders
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
GraphemeAug: A Systematic Approach to Synthesized Hard Negative Keyword Spotting Examples
par: Zhang, Harry, et autres
Publié: (2025)
par: Zhang, Harry, et autres
Publié: (2025)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Documents similaires
-
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
par: Ohnaka, Hien, et autres
Publié: (2025) -
Audio-conditioned phonemic and prosodic annotation for building text-to-speech models from unlabeled speech data
par: Shirahata, Yuma, et autres
Publié: (2024) -
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
par: Kawamura, Masaya, et autres
Publié: (2025) -
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
par: Yamamoto, Ryuichi, et autres
Publié: (2024) -
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
par: Kawamura, Masaya, et autres
Publié: (2024)