Revisiting ASR Error Correction with Specialized Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Gu, Zijin, Likhomanenko, Tatiana, Bai, He, McDermott, Erik, Collobert, Ronan, Jaitly, Navdeep |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeakStream: Streaming Text-to-Speech with Interleaved Data
por: Bai, Richard He, et al.
Publicado: (2025)
por: Bai, Richard He, et al.
Publicado: (2025)
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
por: Likhomanenko, Tatiana, et al.
Publicado: (2023)
por: Likhomanenko, Tatiana, et al.
Publicado: (2023)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025)
por: Gu, Zijin, et al.
Publicado: (2025)
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)
por: Bai, Richard He, et al.
Publicado: (2024)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
ASR Error Correction using Large Language Models
por: Ma, Rao, et al.
Publicado: (2024)
por: Ma, Rao, et al.
Publicado: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
por: Wei, Victor Junqiu, et al.
Publicado: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
por: Gupta, Akshita, et al.
Publicado: (2024)
por: Gupta, Akshita, et al.
Publicado: (2024)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
Evolutionary Prompt Design for LLM-Based Post-ASR Error Correction
por: Sachdev, Rithik, et al.
Publicado: (2024)
por: Sachdev, Rithik, et al.
Publicado: (2024)
Closing the Gap Between Text and Speech Understanding in LLMs
por: Cuervo, Santiago, et al.
Publicado: (2025)
por: Cuervo, Santiago, et al.
Publicado: (2025)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
Revisiting Acoustic Features for Robust ASR
por: Shah, Muhammad A., et al.
Publicado: (2024)
por: Shah, Muhammad A., et al.
Publicado: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
por: Ko, Yuka, et al.
Publicado: (2024)
por: Ko, Yuka, et al.
Publicado: (2024)
Radif Corpus: A Symbolic Dataset for Non-Metric Iranian Classical Music
por: Kanani, Maziar, et al.
Publicado: (2025)
por: Kanani, Maziar, et al.
Publicado: (2025)
Causal Structure Discovery for Error Diagnostics of Children's ASR
por: Singh, Vishwanath Pratap, et al.
Publicado: (2025)
por: Singh, Vishwanath Pratap, et al.
Publicado: (2025)
Advocating Character Error Rate for Multilingual ASR Evaluation
por: K, Thennal D, et al.
Publicado: (2024)
por: K, Thennal D, et al.
Publicado: (2024)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
por: He, Jiajun, et al.
Publicado: (2025)
por: He, Jiajun, et al.
Publicado: (2025)
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)
por: Jung, Donghyuk, et al.
Publicado: (2026)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
por: Aldeneh, Zakaria, et al.
Publicado: (2024)
por: Aldeneh, Zakaria, et al.
Publicado: (2024)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
por: Velikovich, Leonid, et al.
Publicado: (2024)
por: Velikovich, Leonid, et al.
Publicado: (2024)
Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator
por: Sun, Guangzhi, et al.
Publicado: (2022)
por: Sun, Guangzhi, et al.
Publicado: (2022)
FlanEC: Exploring Flan-T5 for Post-ASR Error Correction
por: La Quatra, Moreno, et al.
Publicado: (2025)
por: La Quatra, Moreno, et al.
Publicado: (2025)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
por: Nguyen, Thai-Binh, et al.
Publicado: (2024)
Optimizing Byte-level Representation for End-to-end ASR
por: Hsiao, Roger, et al.
Publicado: (2024)
por: Hsiao, Roger, et al.
Publicado: (2024)
The Multicultural Medical Assistant: Can LLMs Improve Medical ASR Errors Across Borders?
por: Adedeji, Ayo, et al.
Publicado: (2025)
por: Adedeji, Ayo, et al.
Publicado: (2025)
Speech Denoising with Auditory Models
por: Saddler, Mark R., et al.
Publicado: (2020)
por: Saddler, Mark R., et al.
Publicado: (2020)
PromptASR for contextualized ASR with controllable style
por: Yang, Xiaoyu, et al.
Publicado: (2023)
por: Yang, Xiaoyu, et al.
Publicado: (2023)
Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models
por: Chen, Li-Wei, et al.
Publicado: (2024)
por: Chen, Li-Wei, et al.
Publicado: (2024)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
por: Jajoria, Pushkar, et al.
Publicado: (2024)
por: Jajoria, Pushkar, et al.
Publicado: (2024)
ManWav: The First Manchu ASR Model
por: Seo, Jean, et al.
Publicado: (2024)
por: Seo, Jean, et al.
Publicado: (2024)
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
por: Gu, Yue, et al.
Publicado: (2025)
por: Gu, Yue, et al.
Publicado: (2025)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
por: Shu, Yuchun, et al.
Publicado: (2024)
por: Shu, Yuchun, et al.
Publicado: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
por: Tang, Zhiyuan, et al.
Publicado: (2024)
por: Tang, Zhiyuan, et al.
Publicado: (2024)
Performant ASR Models for Medical Entities in Accented Speech
por: Afonja, Tejumade, et al.
Publicado: (2024)
por: Afonja, Tejumade, et al.
Publicado: (2024)
WER We Stand: Benchmarking Urdu ASR Models
por: Arif, Samee, et al.
Publicado: (2024)
por: Arif, Samee, et al.
Publicado: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
por: Gündüz, Ahmet, et al.
Publicado: (2024)
por: Gündüz, Ahmet, et al.
Publicado: (2024)
Romanization Encoding For Multilingual ASR
por: Ding, Wen, et al.
Publicado: (2024)
por: Ding, Wen, et al.
Publicado: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
por: Xie, Yuan, et al.
Publicado: (2026)
por: Xie, Yuan, et al.
Publicado: (2026)
Ejemplares similares
-
SpeakStream: Streaming Text-to-Speech with Interleaved Data
por: Bai, Richard He, et al.
Publicado: (2025) -
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
por: Likhomanenko, Tatiana, et al.
Publicado: (2023) -
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025) -
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024) -
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)