Custom Data Augmentation for low resource ASR using Bark and Retrieval-Based Voice Conversion
Fuente:
arXiv
Guardado en:
| Autores principales: | Kamble, Anand, Tathe, Aniket, Kumbharkar, Suyash, Bhandare, Atharva, Mitra, Anirban C. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBART
por: Tathe, Aniket, et al.
Publicado: (2024)
por: Tathe, Aniket, et al.
Publicado: (2024)
End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2
por: Tathe, Aniket, et al.
Publicado: (2024)
por: Tathe, Aniket, et al.
Publicado: (2024)
Complexity boosted adaptive training for better low resource ASR performance
por: Lu, Hongxuan, et al.
Publicado: (2024)
por: Lu, Hongxuan, et al.
Publicado: (2024)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
persoDA: Personalized Data Augmentation for Personalized ASR
por: Parada, Pablo Peso, et al.
Publicado: (2025)
por: Parada, Pablo Peso, et al.
Publicado: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
por: Byun, Kyungguen, et al.
Publicado: (2025)
por: Byun, Kyungguen, et al.
Publicado: (2025)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
por: Wang, Huimeng, et al.
Publicado: (2024)
por: Wang, Huimeng, et al.
Publicado: (2024)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
por: Seki, Kentaro, et al.
Publicado: (2024)
por: Seki, Kentaro, et al.
Publicado: (2024)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
por: Yamashita, Natsuo, et al.
Publicado: (2026)
por: Yamashita, Natsuo, et al.
Publicado: (2026)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
por: Cao, Songjun, et al.
Publicado: (2025)
por: Cao, Songjun, et al.
Publicado: (2025)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
por: Li, Chin-Jou, et al.
Publicado: (2025)
por: Li, Chin-Jou, et al.
Publicado: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)
por: Guan, Wenhao, et al.
Publicado: (2025)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
Selective Attention Merging for low resource tasks: A case study of Child ASR
por: Shankar, Natarajan Balaji, et al.
Publicado: (2025)
por: Shankar, Natarajan Balaji, et al.
Publicado: (2025)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025)
por: Guo, Zhao, et al.
Publicado: (2025)
Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech
por: Hajal, Karl El, et al.
Publicado: (2025)
por: Hajal, Karl El, et al.
Publicado: (2025)
Unsupervised Rhythm and Voice Conversion of Dysarthric to Healthy Speech for ASR
por: Hajal, Karl El, et al.
Publicado: (2025)
por: Hajal, Karl El, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)
por: Du, Zongyang, et al.
Publicado: (2024)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
por: Cheng, Yao-Fei, et al.
Publicado: (2024)
por: Cheng, Yao-Fei, et al.
Publicado: (2024)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
por: Li, Shaojun, et al.
Publicado: (2024)
por: Li, Shaojun, et al.
Publicado: (2024)
Strategies for improving low resource speech to text translation relying on pre-trained ASR models
por: Kesiraju, Santosh, et al.
Publicado: (2023)
por: Kesiraju, Santosh, et al.
Publicado: (2023)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
por: Zhou, Jiaming, et al.
Publicado: (2023)
por: Zhou, Jiaming, et al.
Publicado: (2023)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
por: Tu, Huu Tuong, et al.
Publicado: (2025)
por: Tu, Huu Tuong, et al.
Publicado: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
por: Kim, Heeseung, et al.
Publicado: (2025)
por: Kim, Heeseung, et al.
Publicado: (2025)
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses
por: Li, Chia-Yu, et al.
Publicado: (2024)
por: Li, Chia-Yu, et al.
Publicado: (2024)
Voice Conversion-based Privacy through Adversarial Information Hiding
por: Webber, Jacob J, et al.
Publicado: (2024)
por: Webber, Jacob J, et al.
Publicado: (2024)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
por: Bargum, Anders R., et al.
Publicado: (2024)
por: Bargum, Anders R., et al.
Publicado: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
por: Bai, Bingsong, et al.
Publicado: (2024)
por: Bai, Bingsong, et al.
Publicado: (2024)
ASR-FAIRBENCH: Measuring and Benchmarking Equity Across Speech Recognition Systems
por: Rai, Anand, et al.
Publicado: (2025)
por: Rai, Anand, et al.
Publicado: (2025)
Ejemplares similares
-
Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBART
por: Tathe, Aniket, et al.
Publicado: (2024) -
End to end Hindi to English speech conversion using Bark, mBART and a finetuned XLSR Wav2Vec2
por: Tathe, Aniket, et al.
Publicado: (2024) -
Complexity boosted adaptive training for better low resource ASR performance
por: Lu, Hongxuan, et al.
Publicado: (2024) -
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025) -
persoDA: Personalized Data Augmentation for Personalized ASR
por: Parada, Pablo Peso, et al.
Publicado: (2025)