Reference-free automatic speech severity evaluation using acoustic unit language modelling
Fuente:
arXiv
Guardado en:
| Autores principales: | Halpern, Bence Mark, Toda, Tomoki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards explainable reference-free speech intelligibility evaluation of people with pathological speech
por: Halpern, Bence Mark, et al.
Publicado: (2026)
por: Halpern, Bence Mark, et al.
Publicado: (2026)
XPPG-PCA: Reference-free automatic speech severity evaluation with principal components
por: Halpern, Bence Mark, et al.
Publicado: (2025)
por: Halpern, Bence Mark, et al.
Publicado: (2025)
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
por: Halpern, Bence Mark, et al.
Publicado: (2026)
por: Halpern, Bence Mark, et al.
Publicado: (2026)
Quantifying the effect of speech pathology on automatic and human speaker verification
por: Halpern, Bence Mark, et al.
Publicado: (2024)
por: Halpern, Bence Mark, et al.
Publicado: (2024)
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
por: Halpern, Bence Mark, et al.
Publicado: (2025)
por: Halpern, Bence Mark, et al.
Publicado: (2025)
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
Investigation of perceptual music similarity focusing on each instrumental part
por: Hashizume, Yuka, et al.
Publicado: (2025)
por: Hashizume, Yuka, et al.
Publicado: (2025)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
por: Chen, Shaowen, et al.
Publicado: (2025)
por: Chen, Shaowen, et al.
Publicado: (2025)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
por: Murata, Masato, et al.
Publicado: (2025)
por: Murata, Masato, et al.
Publicado: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
por: Mi, Jinyi, et al.
Publicado: (2024)
por: Mi, Jinyi, et al.
Publicado: (2024)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
por: Fujimura, Takuya, et al.
Publicado: (2024)
por: Fujimura, Takuya, et al.
Publicado: (2024)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
por: He, Jiajun, et al.
Publicado: (2025)
por: He, Jiajun, et al.
Publicado: (2025)
SeMaScore : a new evaluation metric for automatic speech recognition tasks
por: Sasindran, Zitha, et al.
Publicado: (2024)
por: Sasindran, Zitha, et al.
Publicado: (2024)
Automated evaluation of children's speech fluency for low-resource languages
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
por: Wright, George August, et al.
Publicado: (2023)
por: Wright, George August, et al.
Publicado: (2023)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
por: Huang, Wen-Chin, et al.
Publicado: (2025)
por: Huang, Wen-Chin, et al.
Publicado: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech
por: Deng, Qingkun, et al.
Publicado: (2024)
por: Deng, Qingkun, et al.
Publicado: (2024)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
por: Araiza-Illan, Gloria, et al.
Publicado: (2023)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
Learning Separated Representations for Instrument-based Music Similarity
por: Hashizume, Yuka, et al.
Publicado: (2025)
por: Hashizume, Yuka, et al.
Publicado: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
por: Kuroyanagi, Ibuki, et al.
Publicado: (2025)
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
por: Hashizume, Yuka, et al.
Publicado: (2024)
por: Hashizume, Yuka, et al.
Publicado: (2024)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
por: Yoneyama, Reo, et al.
Publicado: (2024)
por: Yoneyama, Reo, et al.
Publicado: (2024)
An automatic mixing speech enhancement system for multi-track audio
por: Liu, Xiaojing, et al.
Publicado: (2024)
por: Liu, Xiaojing, et al.
Publicado: (2024)
Enhancing CTC-based speech recognition with diverse modeling units
por: Han, Shiyi, et al.
Publicado: (2024)
por: Han, Shiyi, et al.
Publicado: (2024)
Direct Punjabi to English speech translation using discrete units
por: Kaur, Prabhjot, et al.
Publicado: (2024)
por: Kaur, Prabhjot, et al.
Publicado: (2024)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
por: Gong, Rong, et al.
Publicado: (2024)
por: Gong, Rong, et al.
Publicado: (2024)
Phoneme-based speech recognition driven by large language models and sampling marginalization
por: Ma, Te, et al.
Publicado: (2025)
por: Ma, Te, et al.
Publicado: (2025)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
por: Imamura, Takehiro, et al.
Publicado: (2025)
por: Imamura, Takehiro, et al.
Publicado: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
por: Hu, Cheng-Hung, et al.
Publicado: (2025)
por: Hu, Cheng-Hung, et al.
Publicado: (2025)
Transferable speech-to-text large language model alignment module
por: Wu, Boyong, et al.
Publicado: (2024)
por: Wu, Boyong, et al.
Publicado: (2024)
Zipformer: A faster and better encoder for automatic speech recognition
por: Yao, Zengwei, et al.
Publicado: (2023)
por: Yao, Zengwei, et al.
Publicado: (2023)
Robustifying automatic speech recognition by extracting slowly varying features
por: Pizarro, Matías, et al.
Publicado: (2021)
por: Pizarro, Matías, et al.
Publicado: (2021)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
por: Kim, Yunsik, et al.
Publicado: (2025)
por: Kim, Yunsik, et al.
Publicado: (2025)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
por: Okocha, Chibuzor, et al.
Publicado: (2025)
por: Okocha, Chibuzor, et al.
Publicado: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
por: Shi, Xiaohan, et al.
Publicado: (2023)
por: Shi, Xiaohan, et al.
Publicado: (2023)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
por: Cooper, Erica, et al.
Publicado: (2025)
por: Cooper, Erica, et al.
Publicado: (2025)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
por: Yoneyama, Reo, et al.
Publicado: (2025)
por: Yoneyama, Reo, et al.
Publicado: (2025)
Ejemplares similares
-
Towards explainable reference-free speech intelligibility evaluation of people with pathological speech
por: Halpern, Bence Mark, et al.
Publicado: (2026) -
XPPG-PCA: Reference-free automatic speech severity evaluation with principal components
por: Halpern, Bence Mark, et al.
Publicado: (2025) -
PathBench: Speech Intelligibility Benchmark for Automatic Pathological Speech Assessment
por: Halpern, Bence Mark, et al.
Publicado: (2026) -
Quantifying the effect of speech pathology on automatic and human speaker verification
por: Halpern, Bence Mark, et al.
Publicado: (2024) -
Relationship between objective and subjective perceptual measures of speech in individuals with head and neck cancer
por: Halpern, Bence Mark, et al.
Publicado: (2025)