Salvato in:
| Autori principali: | Manocha, Pranay, Williamson, Donald, Finkelstein, Adam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2310.09388 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
A contrastive-learning approach for auditory attention detection
di: Bajestan, Seyed Ali Alavi, et al.
Pubblicazione: (2024)
di: Bajestan, Seyed Ali Alavi, et al.
Pubblicazione: (2024)
Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
di: Tjandra, Andros, et al.
Pubblicazione: (2025)
di: Tjandra, Andros, et al.
Pubblicazione: (2025)
Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
Test-Time Training for Speech Enhancement
di: Behera, Avishkar, et al.
Pubblicazione: (2025)
di: Behera, Avishkar, et al.
Pubblicazione: (2025)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
Voice Quality Dimensions as Interpretable Primitives for Speaking Style for Atypical Speech and Affect
di: Narain, Jaya, et al.
Pubblicazione: (2025)
di: Narain, Jaya, et al.
Pubblicazione: (2025)
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
di: Yang, Zijian, et al.
Pubblicazione: (2026)
di: Yang, Zijian, et al.
Pubblicazione: (2026)
WhiSQA: Non-Intrusive Speech Quality Prediction Using Whisper Encoder Features
di: Close, George, et al.
Pubblicazione: (2025)
di: Close, George, et al.
Pubblicazione: (2025)
EM-TTS: Efficiently Trained Low-Resource Mongolian Lightweight Text-to-Speech
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
di: Yin, Chun, et al.
Pubblicazione: (2024)
di: Yin, Chun, et al.
Pubblicazione: (2024)
Acoustic and Machine Learning Methods for Speech-Based Suicide Risk Assessment: A Systematic Review
di: Marie, Ambre, et al.
Pubblicazione: (2025)
di: Marie, Ambre, et al.
Pubblicazione: (2025)
Optimizing Multi-Stuttered Speech Classification: Leveraging Whisper's Encoder for Efficient Parameter Reduction in Automated Assessment
di: Ameer, Huma, et al.
Pubblicazione: (2024)
di: Ameer, Huma, et al.
Pubblicazione: (2024)
Deep Learning-based Non-Intrusive Multi-Objective Speech Assessment Model with Cross-Domain Features
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2021)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2021)
CogniVoice: Multimodal and Multilingual Fusion Networks for Mild Cognitive Impairment Assessment from Spontaneous Speech
di: Cheng, Jiali, et al.
Pubblicazione: (2024)
di: Cheng, Jiali, et al.
Pubblicazione: (2024)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
Lightweight DNN for Full-Band Speech Denoising on Mobile Devices: Exploiting Long and Short Temporal Patterns
di: Drossos, Konstantinos, et al.
Pubblicazione: (2025)
di: Drossos, Konstantinos, et al.
Pubblicazione: (2025)
Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
HAAQI-Net: A Non-intrusive Neural Music Audio Quality Assessment Model for Hearing Aids
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2024)
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2024)
Impact of Speech Mode in Automatic Pathological Speech Detection
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
Comparative Analysis of Mel-Frequency Cepstral Coefficients and Wavelet Based Audio Signal Processing for Emotion Detection and Mental Health Assessment in Spoken Speech
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
di: Richter, Julius, et al.
Pubblicazione: (2024)
di: Richter, Julius, et al.
Pubblicazione: (2024)
Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
Learning Disentangled Speech Representations
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
di: Brima, Yusuf, et al.
Pubblicazione: (2023)
Speech Diarization and ASR with GMM
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs
di: Fan, Junyi, et al.
Pubblicazione: (2025)
di: Fan, Junyi, et al.
Pubblicazione: (2025)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024) -
A contrastive-learning approach for auditory attention detection
di: Bajestan, Seyed Ali Alavi, et al.
Pubblicazione: (2024) -
Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
di: Tjandra, Andros, et al.
Pubblicazione: (2025) -
Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023) -
Test-Time Training for Speech Enhancement
di: Behera, Avishkar, et al.
Pubblicazione: (2025)