Crowdsourced Multilingual Speech Intelligibility Testing
Fuente:
arXiv
Salvato in:
| Autori principali: | Lechler, Laura, Wojcicki, Kamil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Crowdsourcing MUSHRA Tests in the Age of Generative Speech Technologies: A Comparative Analysis of Subjective and Objective Testing Methods
di: Lechler, Laura, et al.
Pubblicazione: (2025)
di: Lechler, Laura, et al.
Pubblicazione: (2025)
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
Speech Boosting: Low-Latency Live Speech Enhancement for TWS Earbuds
di: Bae, Hanbin, et al.
Pubblicazione: (2024)
di: Bae, Hanbin, et al.
Pubblicazione: (2024)
Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
Speech Enhancement Based on Drifting Models
di: Xu, Liang, et al.
Pubblicazione: (2026)
di: Xu, Liang, et al.
Pubblicazione: (2026)
Construction and Evaluation of Mandarin Multimodal Emotional Speech Database
di: Ting, Zhu, et al.
Pubblicazione: (2024)
di: Ting, Zhu, et al.
Pubblicazione: (2024)
On the Parameter Estimation of Sinusoidal Models for Speech and Audio Signals
di: Kafentzis, George P.
Pubblicazione: (2024)
di: Kafentzis, George P.
Pubblicazione: (2024)
A Hybrid Model for Weakly-Supervised Speech Dereverberation
di: Bahrman, Louis, et al.
Pubblicazione: (2025)
di: Bahrman, Louis, et al.
Pubblicazione: (2025)
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
di: Mack, Wolfgang, et al.
Pubblicazione: (2025)
di: Mack, Wolfgang, et al.
Pubblicazione: (2025)
JenGAN: Stacked Shifted Filters in GAN-Based Speech Synthesis
di: Cho, Hyunjae, et al.
Pubblicazione: (2024)
di: Cho, Hyunjae, et al.
Pubblicazione: (2024)
Toward Fully-End-to-End Listened Speech Decoding from EEG Signals
di: Lee, Jihwan, et al.
Pubblicazione: (2024)
di: Lee, Jihwan, et al.
Pubblicazione: (2024)
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
di: Kim, Minje, et al.
Pubblicazione: (2024)
di: Kim, Minje, et al.
Pubblicazione: (2024)
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
di: Kheddar, Hamza, et al.
Pubblicazione: (2024)
di: Kheddar, Hamza, et al.
Pubblicazione: (2024)
Predicting Heart Activity from Speech using Data-driven and Knowledge-based features
di: Elbanna, Gasser, et al.
Pubblicazione: (2024)
di: Elbanna, Gasser, et al.
Pubblicazione: (2024)
EEG-Based Speech Decoding: A Novel Approach Using Multi-Kernel Ensemble Diffusion Models
di: Kim, Soowon, et al.
Pubblicazione: (2024)
di: Kim, Soowon, et al.
Pubblicazione: (2024)
Advances in Intelligent Hearing Aids: Deep Learning Approaches to Selective Noise Cancellation
di: Khan, Haris, et al.
Pubblicazione: (2025)
di: Khan, Haris, et al.
Pubblicazione: (2025)
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025)
Recent Advances in Discrete Speech Tokens: A Review
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Transferable Adversarial Attacks against ASR
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
An Investigation of Noise Robustness for Flow-Matching-Based Zero-Shot TTS
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
di: Wang, Xiaofei, et al.
Pubblicazione: (2024)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
Text-Aware Adapter for Few-Shot Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
Relational Proxy Loss for Audio-Text based Keyword Spotting
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
di: Jung, Youngmoon, et al.
Pubblicazione: (2024)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
Neural Spectral Band Generation for Audio Coding
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
Scattering Transform for Auditory Attention Decoding
di: Pallenberg, René, et al.
Pubblicazione: (2026)
di: Pallenberg, René, et al.
Pubblicazione: (2026)
Explainable AI in Speaker Recognition -- Making Latent Representations Understandable
di: Xu, Yanze, et al.
Pubblicazione: (2026)
di: Xu, Yanze, et al.
Pubblicazione: (2026)
Enhancing dysarthria speech feature representation with empirical mode decomposition and Walsh-Hadamard transform
di: Zhu, Ting, et al.
Pubblicazione: (2023)
di: Zhu, Ting, et al.
Pubblicazione: (2023)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction
di: Lee, Jihwan, et al.
Pubblicazione: (2025)
di: Lee, Jihwan, et al.
Pubblicazione: (2025)
A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection
di: Ali, Hashim, et al.
Pubblicazione: (2026)
di: Ali, Hashim, et al.
Pubblicazione: (2026)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Deep Active Speech Cancellation with Mamba-Masking Network
di: Mishaly, Yehuda, et al.
Pubblicazione: (2025)
di: Mishaly, Yehuda, et al.
Pubblicazione: (2025)
Scaling Transformers for Low-Bitrate High-Quality Speech Coding
di: Parker, Julian D, et al.
Pubblicazione: (2024)
di: Parker, Julian D, et al.
Pubblicazione: (2024)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Crowdsourcing MUSHRA Tests in the Age of Generative Speech Technologies: A Comparative Analysis of Subjective and Objective Testing Methods
di: Lechler, Laura, et al.
Pubblicazione: (2025) -
MultiGen: Child-Friendly Multilingual Speech Generator with LLMs
di: Gao, Xiaoxue, et al.
Pubblicazione: (2025) -
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024) -
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026) -
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
di: Kim, Miseul, et al.
Pubblicazione: (2025)