Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saon, George, Thomas, Samuel, Fukuda, Takashi, Nagano, Tohru, Dekel, Avihu, Lastras, Luis |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
par: Dekel, Avihu, et autres
Publié: (2026)
par: Dekel, Avihu, et autres
Publié: (2026)
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
par: Novitasari, Sashi, et autres
Publié: (2026)
par: Novitasari, Sashi, et autres
Publié: (2026)
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
par: Aronowitz, Hagai, et autres
Publié: (2026)
par: Aronowitz, Hagai, et autres
Publié: (2026)
Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities
par: Saon, George, et autres
Publié: (2025)
par: Saon, George, et autres
Publié: (2025)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
par: Shechtman, Slava, et autres
Publié: (2024)
par: Shechtman, Slava, et autres
Publié: (2024)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
par: Moriya, Takafumi, et autres
Publié: (2025)
par: Moriya, Takafumi, et autres
Publié: (2025)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
par: Fujita, Yuya, et autres
Publié: (2024)
par: Fujita, Yuya, et autres
Publié: (2024)
Model-free Speculative Decoding for Transformer-based ASR with Token Map Drafting
par: Ho, Tuan Vu, et autres
Publié: (2025)
par: Ho, Tuan Vu, et autres
Publié: (2025)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
par: Dekel, Avihu, et autres
Publié: (2024)
par: Dekel, Avihu, et autres
Publié: (2024)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026)
par: Tsai, Kai-Chen, et autres
Publié: (2026)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
par: Zhou, Wei, et autres
Publié: (2024)
par: Zhou, Wei, et autres
Publié: (2024)
A Non-autoregressive Model for Joint STT and TTS
par: Sunder, Vishal, et autres
Publié: (2025)
par: Sunder, Vishal, et autres
Publié: (2025)
CTC-Assisted LLM-Based Contextual ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026)
par: Fan, Xulin, et autres
Publié: (2026)
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026)
par: Liu, Hanwen, et autres
Publié: (2026)
CTC Blank Triggered Dynamic Layer-Skipping for Efficient CTC-based Speech Recognition
par: Hou, Junfeng, et autres
Publié: (2024)
par: Hou, Junfeng, et autres
Publié: (2024)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
par: Yen, Hao, et autres
Publié: (2026)
par: Yen, Hao, et autres
Publié: (2026)
Exploring the limits of decoder-only models trained on public speech recognition corpora
par: Gupta, Ankit, et autres
Publié: (2024)
par: Gupta, Ankit, et autres
Publié: (2024)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
Spoken question answering for visual queries
par: Shabtay, Nimrod, et autres
Publié: (2025)
par: Shabtay, Nimrod, et autres
Publié: (2025)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
par: Zheng, Yuang, et autres
Publié: (2026)
par: Zheng, Yuang, et autres
Publié: (2026)
DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition
par: Polok, Alexander, et autres
Publié: (2025)
par: Polok, Alexander, et autres
Publié: (2025)
Improving Automatic Speech Recognition with Decoder-Centric Regularisation in Encoder-Decoder Models
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Separate and Reconstruct: Asymmetric Encoder-Decoder for Speech Separation
par: Shin, Ui-Hyeop, et autres
Publié: (2024)
par: Shin, Ui-Hyeop, et autres
Publié: (2024)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
WCTC-Biasing: Retraining-free Contextual Biasing ASR with Wildcard CTC-based Keyword Spotting and Inter-layer Biasing
par: Nakagome, Yu, et autres
Publié: (2025)
par: Nakagome, Yu, et autres
Publié: (2025)
Documents similaires
-
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
par: Dekel, Avihu, et autres
Publié: (2026) -
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
par: Novitasari, Sashi, et autres
Publié: (2026) -
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
par: Aronowitz, Hagai, et autres
Publié: (2026) -
Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities
par: Saon, George, et autres
Publié: (2025) -
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
par: Shechtman, Slava, et autres
Publié: (2024)