SeMaScore : a new evaluation metric for automatic speech recognition tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sasindran, Zitha, Yelchuri, Harsha, Prabhakar, T. V. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Zipformer: A faster and better encoder for automatic speech recognition
par: Yao, Zengwei, et autres
Publié: (2023)
par: Yao, Zengwei, et autres
Publié: (2023)
Robustifying automatic speech recognition by extracting slowly varying features
par: Pizarro, Matías, et autres
Publié: (2021)
par: Pizarro, Matías, et autres
Publié: (2021)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023)
par: Maiti, Soumi, et autres
Publié: (2023)
Objective and subjective evaluation of speech enhancement methods in the UDASE task of the 7th CHiME challenge
par: Leglaive, Simon, et autres
Publié: (2024)
par: Leglaive, Simon, et autres
Publié: (2024)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
par: Jezidžić, Marin, et autres
Publié: (2024)
par: Jezidžić, Marin, et autres
Publié: (2024)
Introduction to speech recognition
par: Dauphin, Gabriel
Publié: (2024)
par: Dauphin, Gabriel
Publié: (2024)
An Attention Long Short-Term Memory based system for automatic classification of speech intelligibility
par: Fernández-Díaz, Miguel, et autres
Publié: (2024)
par: Fernández-Díaz, Miguel, et autres
Publié: (2024)
Fusion approaches for emotion recognition from speech using acoustic and text-based features
par: Pepino, Leonardo, et autres
Publié: (2024)
par: Pepino, Leonardo, et autres
Publié: (2024)
CognoSpeak: an automatic, remote assessment of early cognitive decline in real-world conversational speech
par: Pahar, Madhurananda, et autres
Publié: (2025)
par: Pahar, Madhurananda, et autres
Publié: (2025)
Acoustic characterization of speech rhythm: going beyond metrics with recurrent neural networks
par: Deloche, François, et autres
Publié: (2024)
par: Deloche, François, et autres
Publié: (2024)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
par: Sadok, Samir, et autres
Publié: (2023)
par: Sadok, Samir, et autres
Publié: (2023)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
par: Zhang, Yiru, et autres
Publié: (2025)
par: Zhang, Yiru, et autres
Publié: (2025)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
par: Kim, Yunsik, et autres
Publié: (2025)
par: Kim, Yunsik, et autres
Publié: (2025)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
par: Gong, Rong, et autres
Publié: (2024)
par: Gong, Rong, et autres
Publié: (2024)
Selfsupervised learning for pathological speech detection
par: Sheikh, Shakeel Ahmad
Publié: (2024)
par: Sheikh, Shakeel Ahmad
Publié: (2024)
Towards the Synthesis of Non-speech Vocalizations
par: Hoq, Enjamamul, et autres
Publié: (2024)
par: Hoq, Enjamamul, et autres
Publié: (2024)
Cough activity detection for automatic tuberculosis screening
par: van Vüren, Joshua Jansen, et autres
Publié: (2026)
par: van Vüren, Joshua Jansen, et autres
Publié: (2026)
Optimising MFCC parameters for the automatic detection of respiratory diseases
par: Yan, Yuyang, et autres
Publié: (2024)
par: Yan, Yuyang, et autres
Publié: (2024)
Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus
par: Chen, Szu-Jui, et autres
Publié: (2026)
par: Chen, Szu-Jui, et autres
Publié: (2026)
Audio-based automatic mating success prediction of giant pandas
par: Yan, WeiRan, et autres
Publié: (2019)
par: Yan, WeiRan, et autres
Publié: (2019)
Single-channel speech enhancement using learnable loss mixup
par: Chang, Oscar, et autres
Publié: (2023)
par: Chang, Oscar, et autres
Publié: (2023)
Benchmarks and leaderboards for sound demixing tasks
par: Solovyev, Roman, et autres
Publié: (2023)
par: Solovyev, Roman, et autres
Publié: (2023)
Distilling a speech and music encoder with task arithmetic
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
Boosting keyword spotting through on-device learnable user speech characteristics
par: Cioflan, Cristian, et autres
Publié: (2024)
par: Cioflan, Cristian, et autres
Publié: (2024)
Generalizable speech deepfake detection via meta-learned LoRA
par: Laakkonen, Janne, et autres
Publié: (2025)
par: Laakkonen, Janne, et autres
Publié: (2025)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
par: Araiza-Illan, Gloria, et autres
Publié: (2023)
par: Araiza-Illan, Gloria, et autres
Publié: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
par: Ducorroy, Alexandre, et autres
Publié: (2025)
par: Ducorroy, Alexandre, et autres
Publié: (2025)
Context-aware child-directed speech detection from long-form recordings
par: Charlot, Théo, et autres
Publié: (2026)
par: Charlot, Théo, et autres
Publié: (2026)
Dementia classification from spontaneous speech using wrapper-based feature selection
par: Niemelä, Marko, et autres
Publié: (2025)
par: Niemelä, Marko, et autres
Publié: (2025)
Analyzing and reducing the synthetic-to-real transfer gap in Music Information Retrieval: the task of automatic drum transcription
par: Zehren, Mickaël, et autres
Publié: (2024)
par: Zehren, Mickaël, et autres
Publié: (2024)
Towards objective and interpretable speech disorder assessment: a comparative analysis of CNN and transformer-based models
par: Maisonneuve, Malo, et autres
Publié: (2024)
par: Maisonneuve, Malo, et autres
Publié: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
par: Tabatabaee, Saba, et autres
Publié: (2026)
par: Tabatabaee, Saba, et autres
Publié: (2026)
Acoustic-to-articulatory inversion for dysarthric speech: Are pre-trained self-supervised representations favorable?
par: Maharana, Sarthak Kumar, et autres
Publié: (2023)
par: Maharana, Sarthak Kumar, et autres
Publié: (2023)
Test-Time Training for Depression Detection
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
Adaptive ship-radiated noise recognition with learnable fine-grained wavelet transform
par: Xie, Yuan, et autres
Publié: (2023)
par: Xie, Yuan, et autres
Publié: (2023)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
par: Wright, George August, et autres
Publié: (2023)
par: Wright, George August, et autres
Publié: (2023)
Determining the severity of Parkinson's disease in patients using a multi task neural network
par: García-Ordás, María Teresa, et autres
Publié: (2024)
par: García-Ordás, María Teresa, et autres
Publié: (2024)
HRTF Estimation using a Score-based Prior
par: Thuillier, Etienne, et autres
Publié: (2024)
par: Thuillier, Etienne, et autres
Publié: (2024)
KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods
par: Nzeyimana, Antoine
Publié: (2023)
par: Nzeyimana, Antoine
Publié: (2023)
Documents similaires
-
Zipformer: A faster and better encoder for automatic speech recognition
par: Yao, Zengwei, et autres
Publié: (2023) -
Robustifying automatic speech recognition by extracting slowly varying features
par: Pizarro, Matías, et autres
Publié: (2021) -
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
par: Maiti, Soumi, et autres
Publié: (2023) -
Objective and subjective evaluation of speech enhancement methods in the UDASE task of the 7th CHiME challenge
par: Leglaive, Simon, et autres
Publié: (2024) -
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)