Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yamashita, Natsuo, Nagatsuka, Koichi, Kokubo, Hiroaki, Dohi, Kota, Ho, Tuan Vu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context
par: Yamashita, Natsuo, et autres
Publié: (2025)
par: Yamashita, Natsuo, et autres
Publié: (2025)
Retaining Mixture Representations for Domain Generalized Anomalous Sound Detection
par: Saengthong, Phurich, et autres
Publié: (2025)
par: Saengthong, Phurich, et autres
Publié: (2025)
Stream-based Active Learning for Anomalous Sound Detection in Machine Condition Monitoring
par: Ho, Tuan Vu, et autres
Publié: (2024)
par: Ho, Tuan Vu, et autres
Publié: (2024)
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
par: Ho, Tuan Vu, et autres
Publié: (2025)
par: Ho, Tuan Vu, et autres
Publié: (2025)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
persoDA: Personalized Data Augmentation for Personalized ASR
par: Parada, Pablo Peso, et autres
Publié: (2025)
par: Parada, Pablo Peso, et autres
Publié: (2025)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
par: Ma, Yingyi, et autres
Publié: (2024)
par: Ma, Yingyi, et autres
Publié: (2024)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
Timbre Difference Capturing in Anomalous Sound Detection
par: Nishida, Tomoya, et autres
Publié: (2024)
par: Nishida, Tomoya, et autres
Publié: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
Distributed collaborative anomalous sound detection by embedding sharing
par: Dohi, Kota, et autres
Publié: (2024)
par: Dohi, Kota, et autres
Publié: (2024)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
par: Kothawade, Suraj, et autres
Publié: (2021)
par: Kothawade, Suraj, et autres
Publié: (2021)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
par: Tran, Minh, et autres
Publié: (2025)
par: Tran, Minh, et autres
Publié: (2025)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
par: Rangappa, Pradeep, et autres
Publié: (2025)
par: Rangappa, Pradeep, et autres
Publié: (2025)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
PhiNet: Speaker Verification with Phonetic Interpretability
par: Ma, Yi, et autres
Publié: (2026)
par: Ma, Yi, et autres
Publié: (2026)
Phonetic Richness for Improved Automatic Speaker Verification
par: Klein, Nicholas, et autres
Publié: (2024)
par: Klein, Nicholas, et autres
Publié: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
par: Mehmood, Haaris, et autres
Publié: (2025)
par: Mehmood, Haaris, et autres
Publié: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
par: Bondaruk, Łukasz, et autres
Publié: (2024)
par: Bondaruk, Łukasz, et autres
Publié: (2024)
Revealing the Hidden Temporal Structure of HubertSoft Embeddings based on the Russian Phonetic Corpus
par: Ananeva, Anastasia, et autres
Publié: (2025)
par: Ananeva, Anastasia, et autres
Publié: (2025)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Phonetic Segmentation of the UCLA Phonetics Lab Archive
par: Chodroff, Eleanor, et autres
Publié: (2024)
par: Chodroff, Eleanor, et autres
Publié: (2024)
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
par: Biswas, Swadhin, et autres
Publié: (2025)
par: Biswas, Swadhin, et autres
Publié: (2025)
Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space
par: Quintas, Sebastião, et autres
Publié: (2024)
par: Quintas, Sebastião, et autres
Publié: (2024)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
par: Damianos, Dimitrios, et autres
Publié: (2025)
par: Damianos, Dimitrios, et autres
Publié: (2025)
MIMII-Gen: Generative Modeling Approach for Simulated Evaluation of Anomalous Sound Detection System
par: Purohit, Harsh, et autres
Publié: (2024)
par: Purohit, Harsh, et autres
Publié: (2024)
Documents similaires
-
LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context
par: Yamashita, Natsuo, et autres
Publié: (2025) -
Retaining Mixture Representations for Domain Generalized Anomalous Sound Detection
par: Saengthong, Phurich, et autres
Publié: (2025) -
Stream-based Active Learning for Anomalous Sound Detection in Machine Condition Monitoring
par: Ho, Tuan Vu, et autres
Publié: (2024) -
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
par: Ho, Tuan Vu, et autres
Publié: (2025) -
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)