Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Kolani, Yakov, Melichov, Maxim, Calev, Cobi, Alper, Morris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
di: Pritzen, Julia, et al.
Pubblicazione: (2021)
di: Pritzen, Julia, et al.
Pubblicazione: (2021)
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
di: Ohnaka, Hien, et al.
Pubblicazione: (2025)
di: Ohnaka, Hien, et al.
Pubblicazione: (2025)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
di: Lee, Wonjun, et al.
Pubblicazione: (2025)
DiscoPhon: Benchmarking the Unsupervised Discovery of Phoneme Inventories With Discrete Speech Units
di: Poli, Maxime, et al.
Pubblicazione: (2026)
di: Poli, Maxime, et al.
Pubblicazione: (2026)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
GraphemeAug: A Systematic Approach to Synthesized Hard Negative Keyword Spotting Examples
di: Zhang, Harry, et al.
Pubblicazione: (2025)
di: Zhang, Harry, et al.
Pubblicazione: (2025)
Beyond Unified Models: A Service-Oriented Approach to Low Latency, Context Aware Phonemization for Real Time TTS
di: Fetrat, Mahta, et al.
Pubblicazione: (2025)
di: Fetrat, Mahta, et al.
Pubblicazione: (2025)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
Continuous Speech Tokenizer in Text To Speech
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
Generative Expressive Conversational Speech Synthesis
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
di: Azad, Asif, et al.
Pubblicazione: (2026)
di: Azad, Asif, et al.
Pubblicazione: (2026)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
di: Futami, Hayato, et al.
Pubblicazione: (2025)
di: Futami, Hayato, et al.
Pubblicazione: (2025)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
di: Papi, Sara, et al.
Pubblicazione: (2024)
di: Papi, Sara, et al.
Pubblicazione: (2024)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
Advancing Speech Translation: A Corpus of Mandarin-English Conversational Telephone Speech
di: Wotherspoon, Shannon, et al.
Pubblicazione: (2024)
di: Wotherspoon, Shannon, et al.
Pubblicazione: (2024)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach
di: Poli, Maxime, et al.
Pubblicazione: (2024)
di: Poli, Maxime, et al.
Pubblicazione: (2024)
Speaker-Aware Simulation Improves Conversational Speech Recognition
di: Gedeon, Máté, et al.
Pubblicazione: (2026)
di: Gedeon, Máté, et al.
Pubblicazione: (2026)
Zero-Shot Text-to-Speech for Vietnamese
di: Vu, Thi, et al.
Pubblicazione: (2025)
di: Vu, Thi, et al.
Pubblicazione: (2025)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
di: Liu, Henglyu, et al.
Pubblicazione: (2025)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Computational Narrative Understanding for Expressive Text-to-Speech
di: Michel, Gaspard, et al.
Pubblicazione: (2025)
di: Michel, Gaspard, et al.
Pubblicazione: (2025)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
di: Weise, Tobias, et al.
Pubblicazione: (2024)
di: Weise, Tobias, et al.
Pubblicazione: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
di: Jia, Zhenqi, et al.
Pubblicazione: (2024)
di: Jia, Zhenqi, et al.
Pubblicazione: (2024)
Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison
di: Lam, Tsz Kin, et al.
Pubblicazione: (2025)
di: Lam, Tsz Kin, et al.
Pubblicazione: (2025)
Scaling Analysis of Interleaved Speech-Text Language Models
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
di: Maimon, Gallil, et al.
Pubblicazione: (2025)
End-to-End Speech-to-Text Translation: A Survey
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
di: Sethiya, Nivedita, et al.
Pubblicazione: (2023)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
MunTTS: A Text-to-Speech System for Mundari
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
di: Pritzen, Julia, et al.
Pubblicazione: (2021) -
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
di: Ohnaka, Hien, et al.
Pubblicazione: (2025) -
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025) -
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024) -
HebDB: a Weakly Supervised Dataset for Hebrew Speech Processing
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)