MedASR: An Open-Source Model for High-Accuracy Medical Dictation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Ke, Variani, Ehsan, Bagby, Tom, Reddy, Shashir, Pilgrim, Rory |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scalable Offline ASR for Command-Style Dictation in Courtrooms
di: Nethil, Kumarmanas, et al.
Pubblicazione: (2025)
di: Nethil, Kumarmanas, et al.
Pubblicazione: (2025)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026)
di: Yen, Hao, et al.
Pubblicazione: (2026)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
di: Adedeji, Ayo, et al.
Pubblicazione: (2024)
di: Adedeji, Ayo, et al.
Pubblicazione: (2024)
Reverb: Open-Source ASR and Diarization from Rev
di: Bhandari, Nishchal, et al.
Pubblicazione: (2024)
di: Bhandari, Nishchal, et al.
Pubblicazione: (2024)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
di: Xu, Kai-Tuo, et al.
Pubblicazione: (2025)
di: Xu, Kai-Tuo, et al.
Pubblicazione: (2025)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
di: Zhuang, Ziyang, et al.
Pubblicazione: (2024)
di: Zhuang, Ziyang, et al.
Pubblicazione: (2024)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
di: Răgman, Teodora, et al.
Pubblicazione: (2026)
di: Răgman, Teodora, et al.
Pubblicazione: (2026)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Towards a Single ASR Model That Generalizes to Disordered Speech
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
Performant ASR Models for Medical Entities in Accented Speech
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
di: Afonja, Tejumade, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Open-Source System for Multilingual Translation and Cloned Speech Synthesis
di: Cámara, Mateo, et al.
Pubblicazione: (2025)
di: Cámara, Mateo, et al.
Pubblicazione: (2025)
SOT Triggered Neural Clustering for Speaker Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
DNCASR: End-to-End Training for Speaker-Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
An investigation of modularity for noise robustness in conformer-based ASR
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
di: de Gibson, Louise Coppieters, et al.
Pubblicazione: (2024)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
di: Chhibber, Manasi, et al.
Pubblicazione: (2025)
di: Chhibber, Manasi, et al.
Pubblicazione: (2025)
FLAMO: An Open-Source Library for Frequency-Domain Differentiable Audio Processing
di: Santo, Gloria Dal, et al.
Pubblicazione: (2024)
di: Santo, Gloria Dal, et al.
Pubblicazione: (2024)
Speaker Adaptation for Quantised End-to-End ASR Models
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
di: Wu, Minghui, et al.
Pubblicazione: (2024)
di: Wu, Minghui, et al.
Pubblicazione: (2024)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
Auto-Landmark: Acoustic Landmark Dataset and Open-Source Toolkit for Landmark Extraction
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
di: Saon, George, et al.
Pubblicazione: (2026)
di: Saon, George, et al.
Pubblicazione: (2026)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
Tradition or Innovation: A Comparison of Modern ASR Methods for Forced Alignment
di: Rousso, Rotem, et al.
Pubblicazione: (2024)
di: Rousso, Rotem, et al.
Pubblicazione: (2024)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
di: Murray, Ellison, et al.
Pubblicazione: (2025)
di: Murray, Ellison, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Scalable Offline ASR for Command-Style Dictation in Courtrooms
di: Nethil, Kumarmanas, et al.
Pubblicazione: (2025) -
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026) -
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
di: Adedeji, Ayo, et al.
Pubblicazione: (2024) -
Reverb: Open-Source ASR and Diarization from Rev
di: Bhandari, Nishchal, et al.
Pubblicazione: (2024) -
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
di: Xu, Kai-Tuo, et al.
Pubblicazione: (2025)