MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | Yen, Hao, Ku, Pin-Jui, Jukić, Ante, Siniscalchi, Sabato Marco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024)
di: Yen, Hao, et al.
Pubblicazione: (2024)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
di: Ho, Chun-Wei, et al.
Pubblicazione: (2025)
di: Ho, Chun-Wei, et al.
Pubblicazione: (2025)
Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
di: Ku, Pin-Jui, et al.
Pubblicazione: (2025)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2025)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
di: Langman, Ryan, et al.
Pubblicazione: (2024)
di: Langman, Ryan, et al.
Pubblicazione: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
FlanEC: Exploring Flan-T5 for Post-ASR Error Correction
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
Schrödinger Bridge for Generative Speech Enhancement
di: Jukić, Ante, et al.
Pubblicazione: (2024)
di: Jukić, Ante, et al.
Pubblicazione: (2024)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
di: Dhawan, Kunal, et al.
Pubblicazione: (2024)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
di: Zhuang, Ziyang, et al.
Pubblicazione: (2024)
di: Zhuang, Ziyang, et al.
Pubblicazione: (2024)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2026)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2026)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
di: Jukić, Ante, et al.
Pubblicazione: (2024)
di: Jukić, Ante, et al.
Pubblicazione: (2024)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
voc2vec: A Foundation Model for Non-Verbal Vocalization
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
di: Koudounas, Alkis, et al.
Pubblicazione: (2025)
Bayesian adaptive learning to latent variables via Variational Bayes and Maximum a Posteriori
di: Hu, Hu, et al.
Pubblicazione: (2024)
di: Hu, Hu, et al.
Pubblicazione: (2024)
MedASR: An Open-Source Model for High-Accuracy Medical Dictation
di: Wu, Ke, et al.
Pubblicazione: (2026)
di: Wu, Ke, et al.
Pubblicazione: (2026)
Spelling Correction through Rewriting of Non-Autoregressive ASR Lattices
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
di: Velikovich, Leonid, et al.
Pubblicazione: (2024)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
di: Saon, George, et al.
Pubblicazione: (2026)
di: Saon, George, et al.
Pubblicazione: (2026)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
di: Ho, Chun-wei, et al.
Pubblicazione: (2026)
di: Ho, Chun-wei, et al.
Pubblicazione: (2026)
MaLa-ASR: Multimedia-Assisted LLM-Based ASR
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
Semi-Autoregressive Streaming ASR With Label Context
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
di: Arora, Siddhant, et al.
Pubblicazione: (2023)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2024)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2024)
Align-Consistency: Improving Non-autoregressive and Semi-supervised ASR with Consistency Regularization
di: Huang, Wanting, et al.
Pubblicazione: (2026)
di: Huang, Wanting, et al.
Pubblicazione: (2026)
BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding
di: Boccato, Tommaso, et al.
Pubblicazione: (2026)
di: Boccato, Tommaso, et al.
Pubblicazione: (2026)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
di: Huang, W. Ronny, et al.
Pubblicazione: (2024)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Bilingual Dual-Head Deep Model for Parkinson's Disease Detection from Speech
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Variational Bayesian Adaptive Learning of Deep Latent Variables for Acoustic Knowledge Transfer
di: Hu, Hu, et al.
Pubblicazione: (2025)
di: Hu, Hu, et al.
Pubblicazione: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
di: Wei, Linye, et al.
Pubblicazione: (2025)
di: Wei, Linye, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025) -
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
di: Yen, Hao, et al.
Pubblicazione: (2024) -
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024) -
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
di: Ho, Chun-Wei, et al.
Pubblicazione: (2025) -
Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
di: Ku, Pin-Jui, et al.
Pubblicazione: (2025)