СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ
Fuente:
Zenodo
Salvato in:
| Autori principali: | , , |
|---|---|
| Natura: | Recurso digital |
| Lingua: | russo |
| Pubblicazione: |
Zenodo
2024
|
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
| _version_ | 1866901049368903680 |
|---|---|
| author | Мусаев, Мухаммаджон Махмудович Абдуллаева, Малика Ильхамовна Очило, Маннон Мусинович |
| author_facet | Мусаев, Мухаммаджон Махмудович Абдуллаева, Малика Ильхамовна Очило, Маннон Мусинович |
| contents | <p>В данной статье рассматриваются особенности разработки систем преобразования текста в речь, а также описываются ключевые этапы реализации TTS-системы. Основной целью работы является описание и определение составных модулей, на основе которых была реализована TTS-система узбекского языка, использующая гибридную нейросетевую модель Tacotron2+ParallelWaveGAN. В рамках исследования проведены эксперименты и осуществлена оценка модели синтеза речи, которая составила 4,3 балла из 5, тогда как естественная речь была оценена на 4,7 балла по системе оценивания MOS. Основные результаты показывают, что сочетание моделей Tacotron2+ParallelWaveGAN генерирует более естественные звуковые аудио, в отличие от классической модели Tacotron2+WaveNet. Данные выводы и разработанная TTS-система могут быть использованы в ассистивных системах для людей с ограниченными возможностями. В завершении статьи обсуждаются решения, которые могут положительно повлиять на разработанную систему с точки зрения улучшения естественности и просодики генерируемых аудиофайлов.</p> |
| format | Recurso digital |
| id | zenodo_https___doi_org_10_5281_zenodo_14680025 |
| institution | Zenodo |
| language | rus |
| publishDate | 2024 |
| publisher | Zenodo |
| record_format | zenodo |
| spellingShingle | СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ Мусаев, Мухаммаджон Махмудович Абдуллаева, Малика Ильхамовна Очило, Маннон Мусинович <p>В данной статье рассматриваются особенности разработки систем преобразования текста в речь, а также описываются ключевые этапы реализации TTS-системы. Основной целью работы является описание и определение составных модулей, на основе которых была реализована TTS-система узбекского языка, использующая гибридную нейросетевую модель Tacotron2+ParallelWaveGAN. В рамках исследования проведены эксперименты и осуществлена оценка модели синтеза речи, которая составила 4,3 балла из 5, тогда как естественная речь была оценена на 4,7 балла по системе оценивания MOS. Основные результаты показывают, что сочетание моделей Tacotron2+ParallelWaveGAN генерирует более естественные звуковые аудио, в отличие от классической модели Tacotron2+WaveNet. Данные выводы и разработанная TTS-система могут быть использованы в ассистивных системах для людей с ограниченными возможностями. В завершении статьи обсуждаются решения, которые могут положительно повлиять на разработанную систему с точки зрения улучшения естественности и просодики генерируемых аудиофайлов.</p> |
| title | СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ |
| url | https://doi.org/10.5281/zenodo.14680025 |