СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ

Fuente: Zenodo
Salvato in:
Dettagli Bibliografici
Autori principali: Мусаев, Мухаммаджон Махмудович, Абдуллаева, Малика Ильхамовна, Очило, Маннон Мусинович
Natura: Recurso digital
Lingua:russo
Pubblicazione: Zenodo 2024
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866901049368903680
author Мусаев, Мухаммаджон Махмудович
Абдуллаева, Малика Ильхамовна
Очило, Маннон Мусинович
author_facet Мусаев, Мухаммаджон Махмудович
Абдуллаева, Малика Ильхамовна
Очило, Маннон Мусинович
contents <p>В данной статье рассматриваются особенности разработки систем преобразования текста в речь, а также описываются ключевые этапы реализации TTS-системы. Основной целью работы является описание и определение составных модулей, на основе которых была реализована TTS-система узбекского языка, использующая гибридную нейросетевую модель Tacotron2+ParallelWaveGAN. В рамках исследования проведены эксперименты и осуществлена оценка модели синтеза речи, которая составила 4,3 балла из 5, тогда как естественная речь была оценена на 4,7 балла по системе оценивания MOS. Основные результаты показывают, что сочетание моделей Tacotron2+ParallelWaveGAN генерирует более естественные звуковые аудио, в отличие от классической модели Tacotron2+WaveNet. Данные выводы и разработанная TTS-система могут быть использованы в ассистивных системах для людей с ограниченными возможностями. В завершении статьи обсуждаются решения, которые могут положительно повлиять на разработанную систему с точки зрения улучшения естественности и просодики генерируемых аудиофайлов.</p>
format Recurso digital
id zenodo_https___doi_org_10_5281_zenodo_14680025
institution Zenodo
language rus
publishDate 2024
publisher Zenodo
record_format zenodo
spellingShingle СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ
Мусаев, Мухаммаджон Махмудович
Абдуллаева, Малика Ильхамовна
Очило, Маннон Мусинович
<p>В данной статье рассматриваются особенности разработки систем преобразования текста в речь, а также описываются ключевые этапы реализации TTS-системы. Основной целью работы является описание и определение составных модулей, на основе которых была реализована TTS-система узбекского языка, использующая гибридную нейросетевую модель Tacotron2+ParallelWaveGAN. В рамках исследования проведены эксперименты и осуществлена оценка модели синтеза речи, которая составила 4,3 балла из 5, тогда как естественная речь была оценена на 4,7 балла по системе оценивания MOS. Основные результаты показывают, что сочетание моделей Tacotron2+ParallelWaveGAN генерирует более естественные звуковые аудио, в отличие от классической модели Tacotron2+WaveNet. Данные выводы и разработанная TTS-система могут быть использованы в ассистивных системах для людей с ограниченными возможностями. В завершении статьи обсуждаются решения, которые могут положительно повлиять на разработанную систему с точки зрения улучшения естественности и просодики генерируемых аудиофайлов.</p>
title СИНТЕЗ УЗБЕКСКОЙ РЕЧИ НА БАЗЕ ГИБРИДНОЙ НЕЙРОСЕТЕВОЙ АРХИТЕКТУРЫ
url https://doi.org/10.5281/zenodo.14680025