Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
Fuente:
arXiv
Guardado en:
| Autores principales: | Velikovich, Leonid, Li, Christopher, Caseiro, Diamantino, Kumar, Shankar, Rondon, Pat, Joshi, Kandarp, Velez, Xavier |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
High-precision Voice Search Query Correction via Retrievable Speech-text Embedings
por: Li, Christopher, et al.
Publicado: (2024)
por: Li, Christopher, et al.
Publicado: (2024)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
por: Zhuang, Ziyang, et al.
Publicado: (2024)
por: Zhuang, Ziyang, et al.
Publicado: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
por: Shankar, Natarajan Balaji, et al.
Publicado: (2024)
por: Shankar, Natarajan Balaji, et al.
Publicado: (2024)
Unifying Streaming and Non-streaming Zipformer-based ASR
por: Sharma, Bidisha, et al.
Publicado: (2025)
por: Sharma, Bidisha, et al.
Publicado: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)
por: Guan, Wenhao, et al.
Publicado: (2025)
Semi-Autoregressive Streaming ASR With Label Context
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
por: Huang, W. Ronny, et al.
Publicado: (2024)
por: Huang, W. Ronny, et al.
Publicado: (2024)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
por: Zheng, Xiuwen, et al.
Publicado: (2026)
por: Zheng, Xiuwen, et al.
Publicado: (2026)
E1 TTS: Simple and Fast Non-Autoregressive TTS
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
Learning When to Trust Which Teacher for Weakly Supervised ASR
por: Agrawal, Aakriti, et al.
Publicado: (2023)
por: Agrawal, Aakriti, et al.
Publicado: (2023)
Target Speaker ASR with Whisper
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
Index-ASR Technical Report
por: Song, Zheshu, et al.
Publicado: (2025)
por: Song, Zheshu, et al.
Publicado: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
Efficient Scaling for LLM-based ASR
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
por: Wu, Minghui, et al.
Publicado: (2024)
por: Wu, Minghui, et al.
Publicado: (2024)
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications
por: Pulikodan, Sujith, et al.
Publicado: (2025)
por: Pulikodan, Sujith, et al.
Publicado: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
persoDA: Personalized Data Augmentation for Personalized ASR
por: Parada, Pablo Peso, et al.
Publicado: (2025)
por: Parada, Pablo Peso, et al.
Publicado: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
por: Zhao, Qiuming, et al.
Publicado: (2024)
por: Zhao, Qiuming, et al.
Publicado: (2024)
Consistency Based Unsupervised Self-training For ASR Personalisation
por: Zhang, Jisi, et al.
Publicado: (2024)
por: Zhang, Jisi, et al.
Publicado: (2024)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
por: Adedeji, Ayo, et al.
Publicado: (2024)
por: Adedeji, Ayo, et al.
Publicado: (2024)
Transformer-based Model for ASR N-Best Rescoring and Rewriting
por: Kang, Iwen E., et al.
Publicado: (2024)
por: Kang, Iwen E., et al.
Publicado: (2024)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
por: Wang, Zilai, et al.
Publicado: (2026)
por: Wang, Zilai, et al.
Publicado: (2026)
Selective Attention Merging for low resource tasks: A case study of Child ASR
por: Shankar, Natarajan Balaji, et al.
Publicado: (2025)
por: Shankar, Natarajan Balaji, et al.
Publicado: (2025)
ASR Error Correction using Large Language Models
por: Ma, Rao, et al.
Publicado: (2024)
por: Ma, Rao, et al.
Publicado: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
Joint ASR and Speaker Role Tagging with Serialized Output Training
por: Xu, Anfeng, et al.
Publicado: (2025)
por: Xu, Anfeng, et al.
Publicado: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
por: He, Xiluo, et al.
Publicado: (2025)
por: He, Xiluo, et al.
Publicado: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
por: Hong, Mengze, et al.
Publicado: (2025)
por: Hong, Mengze, et al.
Publicado: (2025)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
por: Mu, Bingshen, et al.
Publicado: (2026)
por: Mu, Bingshen, et al.
Publicado: (2026)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
por: Mujtaba, Dena, et al.
Publicado: (2025)
por: Mujtaba, Dena, et al.
Publicado: (2025)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
por: Pražák, Aleš, et al.
Publicado: (2025)
por: Pražák, Aleš, et al.
Publicado: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
por: Yang, Yufeng, et al.
Publicado: (2024)
por: Yang, Yufeng, et al.
Publicado: (2024)
Complexity boosted adaptive training for better low resource ASR performance
por: Lu, Hongxuan, et al.
Publicado: (2024)
por: Lu, Hongxuan, et al.
Publicado: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
por: Wang, Weiqing, et al.
Publicado: (2024)
por: Wang, Weiqing, et al.
Publicado: (2024)
Ejemplares similares
-
High-precision Voice Search Query Correction via Retrievable Speech-text Embedings
por: Li, Christopher, et al.
Publicado: (2024) -
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
por: Zhuang, Ziyang, et al.
Publicado: (2024) -
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
por: Shankar, Natarajan Balaji, et al.
Publicado: (2024) -
Unifying Streaming and Non-streaming Zipformer-based ASR
por: Sharma, Bidisha, et al.
Publicado: (2025) -
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
por: Guan, Wenhao, et al.
Publicado: (2025)