Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zirui, Juvela, Lauri, Kurimo, Mikko |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
Non-native Children's Automatic Speech Assessment Challenge (NOCASA)
par: Getman, Yaroslav, et autres
Publié: (2025)
par: Getman, Yaroslav, et autres
Publié: (2025)
De-crackling Virtual Analog Controls with Asymptotically Stable Recurrent Neural Networks
par: Kallinen, Valtteri, et autres
Publié: (2025)
par: Kallinen, Valtteri, et autres
Publié: (2025)
Collaborative Watermarking for Adversarial Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2023)
par: Juvela, Lauri, et autres
Publié: (2023)
Mispronunciation Detection Without L2 Pronunciation Dataset in Low-Resource Setting: A Case Study in Finland Swedish
par: Phan, Nhan, et autres
Publié: (2025)
par: Phan, Nhan, et autres
Publié: (2025)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
Estimation and Restoration of Unknown Nonlinear Distortion using Diffusion
par: Švento, Michal, et autres
Publié: (2025)
par: Švento, Michal, et autres
Publié: (2025)
Out-of-distribution generalisation in spoken language understanding
par: Porjazovski, Dejan, et autres
Publié: (2024)
par: Porjazovski, Dejan, et autres
Publié: (2024)
Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Solid State Bus-Comp: A Large-Scale and Diverse Dataset for Dynamic Range Compressor Virtual Analog Modeling
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Reconstruction of the Vocal Tract from Speech via Phonetic Representations Using MRI Data
par: Azzouz, Sofiane, et autres
Publié: (2026)
par: Azzouz, Sofiane, et autres
Publié: (2026)
One Whisper to Grade Them All
par: Phan, Nhan, et autres
Publié: (2025)
par: Phan, Nhan, et autres
Publié: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
Aliasing-Free Neural Audio Synthesis
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Speech Codec Probing from Semantic and Phonetic Perspectives
par: Shi, Xuan, et autres
Publié: (2026)
par: Shi, Xuan, et autres
Publié: (2026)
Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
par: Wright, Alec, et autres
Publié: (2024)
par: Wright, Alec, et autres
Publié: (2024)
POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
par: Li, Chin-Jou, et autres
Publié: (2025)
par: Li, Chin-Jou, et autres
Publié: (2025)
Cross-linguistic Prosodic Analysis of Autistic and Non-autistic Child Speech in Finnish, French and Slovak
par: Myllylä, Ida-Lotta, et autres
Publié: (2026)
par: Myllylä, Ida-Lotta, et autres
Publié: (2026)
Classification of Autistic and Non-Autistic Children's Speech: A Cross-Linguistic Study in Finnish, French, and Slovak
par: Kakouros, Sofoklis, et autres
Publié: (2026)
par: Kakouros, Sofoklis, et autres
Publié: (2026)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
Unsupervised Estimation of Nonlinear Audio Effects: Comparing Diffusion-Based and Adversarial approaches
par: Moliner, Eloi, et autres
Publié: (2025)
par: Moliner, Eloi, et autres
Publié: (2025)
PhiNet: Speaker Verification with Phonetic Interpretability
par: Ma, Yi, et autres
Publié: (2026)
par: Ma, Yi, et autres
Publié: (2026)
SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing
par: Hong, Changi, et autres
Publié: (2026)
par: Hong, Changi, et autres
Publié: (2026)
End-to-End Amp Modeling: From Data to Controllable Guitar Amplifier Models
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
par: Gu, Yicheng, et autres
Publié: (2024)
par: Gu, Yicheng, et autres
Publié: (2024)
Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment
par: Lo, Tien-Hong, et autres
Publié: (2024)
par: Lo, Tien-Hong, et autres
Publié: (2024)
Phonetic Segmentation of the UCLA Phonetics Lab Archive
par: Chodroff, Eleanor, et autres
Publié: (2024)
par: Chodroff, Eleanor, et autres
Publié: (2024)
ISSE: An Instruction-Guided Speech Style Editing Dataset And Benchmark
par: Chen, Yun, et autres
Publié: (2025)
par: Chen, Yun, et autres
Publié: (2025)
Phonetic Richness for Improved Automatic Speaker Verification
par: Klein, Nicholas, et autres
Publié: (2024)
par: Klein, Nicholas, et autres
Publié: (2024)
HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
par: Yan, Bi-Cheng, et autres
Publié: (2025)
par: Yan, Bi-Cheng, et autres
Publié: (2025)
Read to Hear: A Zero-Shot Pronunciation Assessment Using Textual Descriptions and LLMs
par: Chen, Yu-Wen, et autres
Publié: (2025)
par: Chen, Yu-Wen, et autres
Publié: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
par: Har-Tuv, Nadav, et autres
Publié: (2025)
par: Har-Tuv, Nadav, et autres
Publié: (2025)
Fine-Grained Quantitative Emotion Editing for Speech Generation
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
par: Zhou, Xuanru, et autres
Publié: (2025)
par: Zhou, Xuanru, et autres
Publié: (2025)
Documents similaires
-
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025) -
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024) -
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2024) -
Non-native Children's Automatic Speech Assessment Challenge (NOCASA)
par: Getman, Yaroslav, et autres
Publié: (2025) -
De-crackling Virtual Analog Controls with Asymptotically Stable Recurrent Neural Networks
par: Kallinen, Valtteri, et autres
Publié: (2025)