Better Pseudo-labeling with Multi-ASR Fusion and Error Correction by SpeechLLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Prakash, Jeena, Kumar, Blessingh, Hacioglu, Kadri, Sharma, Bidisha, Gopalan, Sindhuja, Chetlur, Malolan, Venkatesan, Shankar, Stolcke, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unifying Streaming and Non-streaming Zipformer-based ASR
par: Sharma, Bidisha, et autres
Publié: (2025)
par: Sharma, Bidisha, et autres
Publié: (2025)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
par: Rangappa, Pradeep, et autres
Publié: (2025)
par: Rangappa, Pradeep, et autres
Publié: (2025)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025)
par: Carofilis, Andres, et autres
Publié: (2025)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
par: C, Anandh, et autres
Publié: (2025)
par: C, Anandh, et autres
Publié: (2025)
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026)
par: Carofilis, Andrés, et autres
Publié: (2026)
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
par: Shankar, Natarajan Balaji, et autres
Publié: (2025)
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
par: Kumar, Shashi, et autres
Publié: (2025)
par: Kumar, Shashi, et autres
Publié: (2025)
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
par: Kumar, Shashi, et autres
Publié: (2026)
par: Kumar, Shashi, et autres
Publié: (2026)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
par: Burdisso, Sergio, et autres
Publié: (2026)
par: Burdisso, Sergio, et autres
Publié: (2026)
When Voice Matters: Evidence of Gender Disparity in Positional Bias of SpeechLLMs
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2025)
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2025)
Streaming Speech-to-Text Translation with a SpeechLLM
par: Parcollet, Titouan, et autres
Publié: (2026)
par: Parcollet, Titouan, et autres
Publié: (2026)
Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR
par: Shi, Mohan, et autres
Publié: (2025)
par: Shi, Mohan, et autres
Publié: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
par: Damianos, Dimitrios, et autres
Publié: (2025)
par: Damianos, Dimitrios, et autres
Publié: (2025)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
par: Satish, Shree Harsha Bokkahalli, et autres
Publié: (2026)
Robust ASR Error Correction with Conservative Data Filtering
par: Udagawa, Takuma, et autres
Publié: (2024)
par: Udagawa, Takuma, et autres
Publié: (2024)
Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones
par: Teleki, Maria, et autres
Publié: (2025)
par: Teleki, Maria, et autres
Publié: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Speech Diarization and ASR with GMM
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
Large Language Models based ASR Error Correction for Child Conversations
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
par: Wu, Ya-Tse, et autres
Publié: (2026)
par: Wu, Ya-Tse, et autres
Publié: (2026)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
par: Zheng, Xiuwen, et autres
Publié: (2026)
par: Zheng, Xiuwen, et autres
Publié: (2026)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Slot Filling as a Reasoning Task for SpeechLLMs
par: Hacioglu, Kadri, et autres
Publié: (2025)
par: Hacioglu, Kadri, et autres
Publié: (2025)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Towards a Single ASR Model That Generalizes to Disordered Speech
par: Tobin, Jimmy, et autres
Publié: (2024)
par: Tobin, Jimmy, et autres
Publié: (2024)
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
par: Pusateri, Ernest, et autres
Publié: (2024)
par: Pusateri, Ernest, et autres
Publié: (2024)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
par: Velikovich, Leonid, et autres
Publié: (2024)
par: Velikovich, Leonid, et autres
Publié: (2024)
Evolutionary Prompt Design for LLM-Based Post-ASR Error Correction
par: Sachdev, Rithik, et autres
Publié: (2024)
par: Sachdev, Rithik, et autres
Publié: (2024)
Documents similaires
-
Unifying Streaming and Non-streaming Zipformer-based ASR
par: Sharma, Bidisha, et autres
Publié: (2025) -
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
par: Rangappa, Pradeep, et autres
Publié: (2025) -
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025) -
Improving endpoint detection in end-to-end streaming ASR for conversational speech
par: C, Anandh, et autres
Publié: (2025) -
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026)