Efficient Scaling for LLM-based ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mu, Bingshen, Shao, Yiwen, Wei, Kun, Yu, Dong, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
par: Mu, Bingshen, et autres
Publié: (2024)
par: Mu, Bingshen, et autres
Publié: (2024)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2024)
par: Mu, Bingshen, et autres
Publié: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
par: Geng, Xuelong, et autres
Publié: (2024)
par: Geng, Xuelong, et autres
Publié: (2024)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
par: Mu, Bingshen, et autres
Publié: (2026)
par: Mu, Bingshen, et autres
Publié: (2026)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
par: Xia, Kangxiang, et autres
Publié: (2026)
par: Xia, Kangxiang, et autres
Publié: (2026)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
par: Zhuo, Jianheng, et autres
Publié: (2025)
par: Zhuo, Jianheng, et autres
Publié: (2025)
SpatialEmb: Extract and Encode Spatial Information for 1-Stage Multi-channel Multi-speaker ASR on Arbitrary Microphone Arrays
par: Shao, Yiwen, et autres
Publié: (2026)
par: Shao, Yiwen, et autres
Publié: (2026)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
par: Shao, Yiwen, et autres
Publié: (2025)
par: Shao, Yiwen, et autres
Publié: (2025)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
par: Guo, Pengcheng, et autres
Publié: (2024)
par: Guo, Pengcheng, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
par: Wei, Linye, et autres
Publié: (2025)
par: Wei, Linye, et autres
Publié: (2025)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
par: Wang, Chengyou, et autres
Publié: (2026)
par: Wang, Chengyou, et autres
Publié: (2026)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025)
par: Gong, Xun, et autres
Publié: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
par: Zheng, Xiuwen, et autres
Publié: (2026)
par: Zheng, Xiuwen, et autres
Publié: (2026)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
par: Yamashita, Natsuo, et autres
Publié: (2026)
par: Yamashita, Natsuo, et autres
Publié: (2026)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
par: Lin, Zhennan, et autres
Publié: (2026)
par: Lin, Zhennan, et autres
Publié: (2026)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
par: Shao, Qijie, et autres
Publié: (2025)
par: Shao, Qijie, et autres
Publié: (2025)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding
par: Boccato, Tommaso, et autres
Publié: (2026)
par: Boccato, Tommaso, et autres
Publié: (2026)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Efficient Rehearsal for Continual Learning in ASR via Singular Value Tuning
par: Eeckt, Steven Vander, et autres
Publié: (2026)
par: Eeckt, Steven Vander, et autres
Publié: (2026)
Documents similaires
-
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
par: Mu, Bingshen, et autres
Publié: (2024) -
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025) -
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026) -
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2025) -
MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2024)