RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ren, Bo, Fan, Ruchao, Shen, Yelong, Chen, Weizhu, Li, Jinyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems
par: Ren, Bo, et autres
Publié: (2025)
par: Ren, Bo, et autres
Publié: (2025)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
par: Shi, Mohan, et autres
Publié: (2025)
par: Shi, Mohan, et autres
Publié: (2025)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
par: Wu, Haibin, et autres
Publié: (2025)
par: Wu, Haibin, et autres
Publié: (2025)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
par: Kong, YuXiang, et autres
Publié: (2025)
par: Kong, YuXiang, et autres
Publié: (2025)
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
par: Hu, Yuxuan, et autres
Publié: (2025)
par: Hu, Yuxuan, et autres
Publié: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
CTC-GMM: CTC guided modality matching for fast and accurate streaming speech translation
par: Zhao, Rui, et autres
Publié: (2024)
par: Zhao, Rui, et autres
Publié: (2024)
Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction
par: Novitasari, Sashi, et autres
Publié: (2026)
par: Novitasari, Sashi, et autres
Publié: (2026)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026)
par: Tsai, Kai-Chen, et autres
Publié: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
A Survey on Speech Large Language Models for Understanding
par: Peng, Jing, et autres
Publié: (2024)
par: Peng, Jing, et autres
Publié: (2024)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025)
par: Gong, Xun, et autres
Publié: (2025)
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024)
par: Huang, Ruizhe, et autres
Publié: (2024)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
par: Liu, Yansong, et autres
Publié: (2025)
par: Liu, Yansong, et autres
Publié: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
par: Wang, Chaoren, et autres
Publié: (2026)
par: Wang, Chaoren, et autres
Publié: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
par: Hao, Hongkun, et autres
Publié: (2023)
par: Hao, Hongkun, et autres
Publié: (2023)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
par: Tao, Dehua, et autres
Publié: (2026)
par: Tao, Dehua, et autres
Publié: (2026)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Position: Towards Responsible Evaluation for Text-to-Speech
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
PHRASED: Phrase Dictionary Biasing for Speech Translation
par: Wang, Peidong, et autres
Publié: (2025)
par: Wang, Peidong, et autres
Publié: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
par: Wang, Qiongqiong, et autres
Publié: (2025)
par: Wang, Qiongqiong, et autres
Publié: (2025)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
par: Ling, Shaoshi, et autres
Publié: (2025)
par: Ling, Shaoshi, et autres
Publié: (2025)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
par: Liu, Wenrui, et autres
Publié: (2025)
par: Liu, Wenrui, et autres
Publié: (2025)
Group Relative Policy Optimization for Text-to-Speech with Large Language Models
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
par: Cohen, Eyal, et autres
Publié: (2025)
par: Cohen, Eyal, et autres
Publié: (2025)
Improving ASR Contextual Biasing with Guided Attention
par: Tang, Jiyang, et autres
Publié: (2024)
par: Tang, Jiyang, et autres
Publié: (2024)
Silent Speech Interfaces in the Era of Large Language Models: A Comprehensive Taxonomy and Systematic Review
par: Xu, Kele, et autres
Publié: (2026)
par: Xu, Kele, et autres
Publié: (2026)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
Large Model Empowered Streaming Speech Semantic Communications
par: Weng, Zhenzi, et autres
Publié: (2025)
par: Weng, Zhenzi, et autres
Publié: (2025)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
par: Wang, Haoxu, et autres
Publié: (2026)
par: Wang, Haoxu, et autres
Publié: (2026)
Documents similaires
-
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
par: Fan, Ruchao, et autres
Publié: (2024) -
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems
par: Ren, Bo, et autres
Publié: (2025) -
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
par: Shi, Mohan, et autres
Publié: (2025) -
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
par: Wu, Haibin, et autres
Publié: (2025) -
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)