Towards the Synthesis of Non-speech Vocalizations
Fuente:
arXiv
Salvato in:
| Autori principali: | Hoq, Enjamamul, Nwogu, Ifeoma |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Feature Representations for Automatic Meerkat Vocalization Classification
di: Mahmoud, Imen Ben, et al.
Pubblicazione: (2024)
di: Mahmoud, Imen Ben, et al.
Pubblicazione: (2024)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
di: Kim, Yunsik, et al.
Pubblicazione: (2025)
di: Kim, Yunsik, et al.
Pubblicazione: (2025)
Towards objective and interpretable speech disorder assessment: a comparative analysis of CNN and transformer-based models
di: Maisonneuve, Malo, et al.
Pubblicazione: (2024)
di: Maisonneuve, Malo, et al.
Pubblicazione: (2024)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
di: Maiti, Soumi, et al.
Pubblicazione: (2023)
Selfsupervised learning for pathological speech detection
di: Sheikh, Shakeel Ahmad
Pubblicazione: (2024)
di: Sheikh, Shakeel Ahmad
Pubblicazione: (2024)
Hearing Your Blood Sugar: Non-Invasive Glucose Measurement Through Simple Vocal Signals, Transforming any Speech into a Sensor with Machine Learning
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
Vocal Melody Construction for Persian Lyrics Using LSTM Recurrent Neural Networks
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
di: Jafari, Farshad, et al.
Pubblicazione: (2024)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
JaCappella Corpus: A Japanese a Cappella Vocal Ensemble Corpus
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2022)
di: Nakamura, Tomohiko, et al.
Pubblicazione: (2022)
Machine Learning Approaches to Vocal Register Classification in Contemporary Male Pop Music
di: Kim, Alexander, et al.
Pubblicazione: (2025)
di: Kim, Alexander, et al.
Pubblicazione: (2025)
Improving Inference-Time Optimisation for Vocal Effects Style Transfer with a Gaussian Prior
di: Yu, Chin-Yun, et al.
Pubblicazione: (2025)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2025)
CR-CTC: Consistency regularization on CTC for improved speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
Single-channel speech enhancement using learnable loss mixup
di: Chang, Oscar, et al.
Pubblicazione: (2023)
di: Chang, Oscar, et al.
Pubblicazione: (2023)
Zipformer: A faster and better encoder for automatic speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
Robustifying automatic speech recognition by extracting slowly varying features
di: Pizarro, Matías, et al.
Pubblicazione: (2021)
di: Pizarro, Matías, et al.
Pubblicazione: (2021)
Recurrence-Based Nonlinear Vocal Dynamics as Digital Biomarkers for Depression Detection from Conversational Speech
di: Samanta, Himadri S
Pubblicazione: (2026)
di: Samanta, Himadri S
Pubblicazione: (2026)
A Real-Time Lyrics Alignment System Using Chroma And Phonetic Features For Classical Vocal Performance
di: Park, Jiyun, et al.
Pubblicazione: (2024)
di: Park, Jiyun, et al.
Pubblicazione: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
Boosting keyword spotting through on-device learnable user speech characteristics
di: Cioflan, Cristian, et al.
Pubblicazione: (2024)
di: Cioflan, Cristian, et al.
Pubblicazione: (2024)
Generalizable speech deepfake detection via meta-learned LoRA
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
Acoustic characterization of speech rhythm: going beyond metrics with recurrent neural networks
di: Deloche, François, et al.
Pubblicazione: (2024)
di: Deloche, François, et al.
Pubblicazione: (2024)
Context-aware child-directed speech detection from long-form recordings
di: Charlot, Théo, et al.
Pubblicazione: (2026)
di: Charlot, Théo, et al.
Pubblicazione: (2026)
Dementia classification from spontaneous speech using wrapper-based feature selection
di: Niemelä, Marko, et al.
Pubblicazione: (2025)
di: Niemelä, Marko, et al.
Pubblicazione: (2025)
Fusion approaches for emotion recognition from speech using acoustic and text-based features
di: Pepino, Leonardo, et al.
Pubblicazione: (2024)
di: Pepino, Leonardo, et al.
Pubblicazione: (2024)
An Attention Long Short-Term Memory based system for automatic classification of speech intelligibility
di: Fernández-Díaz, Miguel, et al.
Pubblicazione: (2024)
di: Fernández-Díaz, Miguel, et al.
Pubblicazione: (2024)
SeMaScore : a new evaluation metric for automatic speech recognition tasks
di: Sasindran, Zitha, et al.
Pubblicazione: (2024)
di: Sasindran, Zitha, et al.
Pubblicazione: (2024)
Acoustic-to-articulatory inversion for dysarthric speech: Are pre-trained self-supervised representations favorable?
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2023)
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2023)
CognoSpeak: an automatic, remote assessment of early cognitive decline in real-world conversational speech
di: Pahar, Madhurananda, et al.
Pubblicazione: (2025)
di: Pahar, Madhurananda, et al.
Pubblicazione: (2025)
Objective and subjective evaluation of speech enhancement methods in the UDASE task of the 7th CHiME challenge
di: Leglaive, Simon, et al.
Pubblicazione: (2024)
di: Leglaive, Simon, et al.
Pubblicazione: (2024)
U-Mamba-Net: A highly efficient Mamba-based U-net style network for noisy and reverberant speech separation
di: Dang, Shaoxiang, et al.
Pubblicazione: (2024)
di: Dang, Shaoxiang, et al.
Pubblicazione: (2024)
Online speaker diarization of meetings guided by speech separation
di: Gruttadauria, Elio, et al.
Pubblicazione: (2024)
di: Gruttadauria, Elio, et al.
Pubblicazione: (2024)
Non-verbal information in spontaneous speech -- towards a new framework of analysis
di: Biron, Tirza, et al.
Pubblicazione: (2024)
di: Biron, Tirza, et al.
Pubblicazione: (2024)
A multimodal dynamical variational autoencoder for audiovisual speech representation learning
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
Introduction to speech recognition
di: Dauphin, Gabriel
Pubblicazione: (2024)
di: Dauphin, Gabriel
Pubblicazione: (2024)
Annotation-Free MIDI-to-Audio Synthesis via Concatenative Synthesis and Generative Refinement
di: Take, Osamu, et al.
Pubblicazione: (2024)
di: Take, Osamu, et al.
Pubblicazione: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Recognizing Ornaments in Vocal Indian Art Music with Active Annotation
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
Vocal Tract Length Warped Features for Spoken Keyword Spotting
di: Sarkar, Achintya kr., et al.
Pubblicazione: (2025)
di: Sarkar, Achintya kr., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Feature Representations for Automatic Meerkat Vocalization Classification
di: Mahmoud, Imen Ben, et al.
Pubblicazione: (2024) -
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
di: Kim, Yunsik, et al.
Pubblicazione: (2025) -
Towards objective and interpretable speech disorder assessment: a comparative analysis of CNN and transformer-based models
di: Maisonneuve, Malo, et al.
Pubblicazione: (2024) -
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
di: Maiti, Soumi, et al.
Pubblicazione: (2023) -
Selfsupervised learning for pathological speech detection
di: Sheikh, Shakeel Ahmad
Pubblicazione: (2024)