Reduce, Reuse, Recycle: Is Perturbed Data better than Other Language augmentation for Low Resource Self-Supervised Speech Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ullah, Asad, Ragano, Alessandro, Hines, Andrew |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SCOREQ: Speech Quality Assessment with Contrastive Regression
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
di: Ragano, Alessandro, et al.
Pubblicazione: (2023)
BINAQUAL: A Full-Reference Objective Localization Similarity Metric for Binaural Audio
di: Panah, Davoud Shariat, et al.
Pubblicazione: (2025)
di: Panah, Davoud Shariat, et al.
Pubblicazione: (2025)
Binamix -- A Python Library for Generating Binaural Audio Datasets
di: Barry, Dan, et al.
Pubblicazione: (2025)
di: Barry, Dan, et al.
Pubblicazione: (2025)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
Low-Resource Self-Supervised Learning with SSL-Enhanced TTS
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
di: Chung, Raymond
Pubblicazione: (2026)
di: Chung, Raymond
Pubblicazione: (2026)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
di: Kutsakov, Aleksandr, et al.
Pubblicazione: (2025)
di: Kutsakov, Aleksandr, et al.
Pubblicazione: (2025)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
di: Poncelet, Jakob, et al.
Pubblicazione: (2023)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
di: Li, Hengyu, et al.
Pubblicazione: (2024)
di: Li, Hengyu, et al.
Pubblicazione: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
di: Ayrapetyan, Alexan, et al.
Pubblicazione: (2025)
di: Ayrapetyan, Alexan, et al.
Pubblicazione: (2025)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
di: Stahl, Benjamin, et al.
Pubblicazione: (2025)
di: Stahl, Benjamin, et al.
Pubblicazione: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
di: Poncelet, Jakob, et al.
Pubblicazione: (2024)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
di: Dao, Alan, et al.
Pubblicazione: (2025)
di: Dao, Alan, et al.
Pubblicazione: (2025)
A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2025)
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2025)
Extending Multilingual Speech Synthesis to 100+ Languages without Transcribed Data
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
di: Saeki, Takaaki, et al.
Pubblicazione: (2024)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
di: Dong, Lukuan, et al.
Pubblicazione: (2024)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
di: Shi, Jiatong, et al.
Pubblicazione: (2023)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
Documenti analoghi
-
SCOREQ: Speech Quality Assessment with Contrastive Regression
di: Ragano, Alessandro, et al.
Pubblicazione: (2024) -
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
di: Ragano, Alessandro, et al.
Pubblicazione: (2023) -
BINAQUAL: A Full-Reference Objective Localization Similarity Metric for Binaural Audio
di: Panah, Davoud Shariat, et al.
Pubblicazione: (2025) -
Binamix -- A Python Library for Generating Binaural Audio Datasets
di: Barry, Dan, et al.
Pubblicazione: (2025) -
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)