Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Saeki, Takaaki, Wang, Gary, Morioka, Nobuyuki, Elias, Isaac, Kastner, Kyle, Biadsy, Fadi, Rosenberg, Andrew, Ramabhadran, Bhuvana, Zen, Heiga, Beaufays, Françoise, Shemtov, Hadar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
ASTRA: Aligning Speech and Text Representations for Asr without Sampling
di: Gaur, Neeraj, et al.
Pubblicazione: (2024)
di: Gaur, Neeraj, et al.
Pubblicazione: (2024)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
Wie werden Wissenschaftler gemacht?
di: Beaufaÿs, Sandra
Pubblicazione: (2020)
di: Beaufaÿs, Sandra
Pubblicazione: (2020)
FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks
di: Ma, Min, et al.
Pubblicazione: (2024)
di: Ma, Min, et al.
Pubblicazione: (2024)
STAB: Speech Tokenizer Assessment Benchmark
di: Vashishth, Shikhar, et al.
Pubblicazione: (2024)
di: Vashishth, Shikhar, et al.
Pubblicazione: (2024)
Schema Augmentation for Zero-Shot Domain Adaptation in Dialogue State Tracking
di: Richardson, Christopher, et al.
Pubblicazione: (2024)
di: Richardson, Christopher, et al.
Pubblicazione: (2024)
Federated Learning of Large ASR Models in the Real World
di: Xiao, Yonghui, et al.
Pubblicazione: (2024)
di: Xiao, Yonghui, et al.
Pubblicazione: (2024)
Automated Long‐Short‐Term Echo State Self‐Attention Network Model for Clone Node Attack Detection in Edge‐Assisted Wireless Sensor Networks
di: S. Bhuvana
Pubblicazione: (2026)
di: S. Bhuvana
Pubblicazione: (2026)
Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration
di: Karita, Shigeki, et al.
Pubblicazione: (2025)
di: Karita, Shigeki, et al.
Pubblicazione: (2025)
Text Injection for Neural Contextual Biasing
di: Meng, Zhong, et al.
Pubblicazione: (2024)
di: Meng, Zhong, et al.
Pubblicazione: (2024)
Hierarchical Recurrent Adapters for Efficient Multi-Task Adaptation of Large Speech Models
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
di: Munkhdalai, Tsendsuren, et al.
Pubblicazione: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
TTSOps: A Closed-Loop Corpus Optimization Framework for Training Multi-Speaker TTS Models from Dark Data
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
Transcribed Glass Market Overview
di: Next Move Strategy Consulting
Pubblicazione: (2025)
di: Next Move Strategy Consulting
Pubblicazione: (2025)
MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research
di: Li, Song, et al.
Pubblicazione: (2024)
di: Li, Song, et al.
Pubblicazione: (2024)
Energy-dependent implementation of secondary electron emission models in continuum kinetic sheath simulations
di: Bradshaw, Kolter, et al.
Pubblicazione: (2023)
di: Bradshaw, Kolter, et al.
Pubblicazione: (2023)
Less is better: various means to reduce protein load in the endoplasmic reticulum
di: Salam Dabsan, et al.
Pubblicazione: (2024)
di: Salam Dabsan, et al.
Pubblicazione: (2024)
Geometric-Averaged Preference Optimization for Soft Preference Labels
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
Rubato: Transcribing Piano Music with Timestamps
di: Tamer, Nazif Can, et al.
Pubblicazione: (2026)
di: Tamer, Nazif Can, et al.
Pubblicazione: (2026)
Speech LLMs are Contextual Reasoning Transcribers
di: Deng, Keqi, et al.
Pubblicazione: (2026)
di: Deng, Keqi, et al.
Pubblicazione: (2026)
Self-Train Before You Transcribe
di: Flynn, Robert, et al.
Pubblicazione: (2024)
di: Flynn, Robert, et al.
Pubblicazione: (2024)
MOSS Transcribe Diarize Technical Report
di: AI, MOSI., et al.
Pubblicazione: (2026)
di: AI, MOSI., et al.
Pubblicazione: (2026)
Transcribing Medieval Manuscripts for Machine Learning
di: Guéville, Estelle, et al.
Pubblicazione: (2022)
di: Guéville, Estelle, et al.
Pubblicazione: (2022)
Extended Scotogenic Model of Neutrino Mass and Proton Decay
di: Nomura, Takaaki, et al.
Pubblicazione: (2024)
di: Nomura, Takaaki, et al.
Pubblicazione: (2024)
Behavior of hypoxic water in Tokyo Bay under the coastal upwelling condition determined by continuous observation system
di: Morioka, Hiroshi
Pubblicazione: (2015)
di: Morioka, Hiroshi
Pubblicazione: (2015)
Preliminary examination on hormone-induced breeding of kabyabya Opsaridium tweddleorum (Pisces: Cyprinidae) (Skelton, 1996) and morphology of newly hatched larvae
di: Matsumoto, S., et al.
Pubblicazione: (2002)
di: Matsumoto, S., et al.
Pubblicazione: (2002)
Otolith features and utility of lapillus for daily increment analysis in Malawian Characidae Hemigrammopetersius barnardi (Herre, 1939)(Pisces: Characidae) collected from Lake Malawi
di: Morioka, S., et al.
Pubblicazione: (2002)
di: Morioka, S., et al.
Pubblicazione: (2002)
Análise de fatores críticos de sucesso de projetos: um estudo de caso no setor varejista
di: Sandra Morioka
Pubblicazione: (2014)
di: Sandra Morioka
Pubblicazione: (2014)
SimulTron: On-Device Simultaneous Speech to Speech Translation
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
di: Agranovich, Alex, et al.
Pubblicazione: (2024)
ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability
di: Nakata, Wataru, et al.
Pubblicazione: (2025)
di: Nakata, Wataru, et al.
Pubblicazione: (2025)
Accretion disc dynamics in extragalactic black hole X-ray binaries: A comprehensive study of M33 X-7, NGC 300 X-1 and IC 10 X-1
di: R., Bhuvana G., et al.
Pubblicazione: (2024)
di: R., Bhuvana G., et al.
Pubblicazione: (2024)
TOGGL: Transcribing Overlapping Speech with Staggered Labeling
di: Li, Chak-Fai, et al.
Pubblicazione: (2024)
di: Li, Chak-Fai, et al.
Pubblicazione: (2024)
Transcribing Rhythmic Patterns of the Guitar Track in Polyphonic Music
di: Lukoianov, Aleksandr, et al.
Pubblicazione: (2025)
di: Lukoianov, Aleksandr, et al.
Pubblicazione: (2025)
Transcribing RNA polymerases: Dynamics of Twin Supercoiled Domains
di: Joyeux, Marc
Pubblicazione: (2024)
di: Joyeux, Marc
Pubblicazione: (2024)
Documenti analoghi
-
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024) -
ASTRA: Aligning Speech and Text Representations for Asr without Sampling
di: Gaur, Neeraj, et al.
Pubblicazione: (2024) -
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
di: Yusuf, Bolaji, et al.
Pubblicazione: (2024) -
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
di: Baskar, Murali Karthick, et al.
Pubblicazione: (2024) -
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
di: Ma, Rao, et al.
Pubblicazione: (2025)