Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kong, YuXiang, Hou, JunFeng, Tang, Jian, Zhu, Bingqing, Zhang, Jicheng, Xue, Shaofei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025)
par: Gong, Xun, et autres
Publié: (2025)
Improving ASR Contextual Biasing with Guided Attention
par: Tang, Jiyang, et autres
Publié: (2024)
par: Tang, Jiyang, et autres
Publié: (2024)
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
par: Novitasari, Sashi, et autres
Publié: (2026)
par: Novitasari, Sashi, et autres
Publié: (2026)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026)
par: Tsai, Kai-Chen, et autres
Publié: (2026)
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems
par: Ren, Bo, et autres
Publié: (2025)
par: Ren, Bo, et autres
Publié: (2025)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
par: Ren, Bo, et autres
Publié: (2026)
par: Ren, Bo, et autres
Publié: (2026)
WCTC-Biasing: Retraining-free Contextual Biasing ASR with Wildcard CTC-based Keyword Spotting and Inter-layer Biasing
par: Nakagome, Yu, et autres
Publié: (2025)
par: Nakagome, Yu, et autres
Publié: (2025)
CTC-Assisted LLM-Based Contextual ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Minimising Biasing Word Errors for Contextual ASR with the Tree-Constrained Pointer Generator
par: Sun, Guangzhi, et autres
Publié: (2022)
par: Sun, Guangzhi, et autres
Publié: (2022)
VHASR: A Multimodal Speech Recognition System With Vision Hotwords
par: Hu, Jiliang, et autres
Publié: (2024)
par: Hu, Jiliang, et autres
Publié: (2024)
MaLa-ASR: Multimedia-Assisted LLM-Based ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
H-PRM: A Pluggable Hotword Pre-Retrieval Module for Various Speech Recognition Systems
par: Dai, Huangyu, et autres
Publié: (2025)
par: Dai, Huangyu, et autres
Publié: (2025)
Enhancing the Robustness of Contextual ASR to Varying Biasing Information Volumes Through Purified Semantic Correlation Joint Modeling
par: Gu, Yue, et autres
Publié: (2025)
par: Gu, Yue, et autres
Publié: (2025)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
par: Li, Li, et autres
Publié: (2026)
par: Li, Li, et autres
Publié: (2026)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
par: Yen, Hao, et autres
Publié: (2026)
par: Yen, Hao, et autres
Publié: (2026)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
par: Dekel, Avihu, et autres
Publié: (2026)
par: Dekel, Avihu, et autres
Publié: (2026)
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
par: Xu, Kai-Tuo, et autres
Publié: (2025)
par: Xu, Kai-Tuo, et autres
Publié: (2025)
ROAR: Reinforcing Original to Augmented Data Ratio Dynamics for Wav2Vec2.0 Based ASR
par: Singh, Vishwanath Pratap, et autres
Publié: (2024)
par: Singh, Vishwanath Pratap, et autres
Publié: (2024)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
par: Saon, George, et autres
Publié: (2026)
par: Saon, George, et autres
Publié: (2026)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
par: Gao, Changfeng, et autres
Publié: (2025)
par: Gao, Changfeng, et autres
Publié: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing
par: Cheng, Gaofeng, et autres
Publié: (2025)
par: Cheng, Gaofeng, et autres
Publié: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
par: Geng, Xuelong, et autres
Publié: (2024)
par: Geng, Xuelong, et autres
Publié: (2024)
Contextualization of ASR with LLM using phonetic retrieval-based augmentation
par: Lei, Zhihong, et autres
Publié: (2024)
par: Lei, Zhihong, et autres
Publié: (2024)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
Retrieval Augmented Generation based context discovery for ASR
par: Siskos, Dimitrios, et autres
Publié: (2025)
par: Siskos, Dimitrios, et autres
Publié: (2025)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
par: Moriya, Takafumi, et autres
Publié: (2025)
par: Moriya, Takafumi, et autres
Publié: (2025)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
par: Liu, Yinghao, et autres
Publié: (2026)
par: Liu, Yinghao, et autres
Publié: (2026)
Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models
par: Lyu, Pengbo, et autres
Publié: (2026)
par: Lyu, Pengbo, et autres
Publié: (2026)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Target Speaker Extraction by Directly Exploiting Contextual Information in the Time-Frequency Domain
par: Yang, Xue, et autres
Publié: (2024)
par: Yang, Xue, et autres
Publié: (2024)
Documents similaires
-
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025) -
Improving ASR Contextual Biasing with Guided Attention
par: Tang, Jiyang, et autres
Publié: (2024) -
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
par: Novitasari, Sashi, et autres
Publié: (2026) -
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026) -
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems
par: Ren, Bo, et autres
Publié: (2025)