Enhancing Speech Large Language Models through Reinforced Behavior Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yansong, Li, Jiateng, Liu, Yuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025)
por: Xie, Jingran, et al.
Publicado: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
por: Sun, Chunyu, et al.
Publicado: (2025)
por: Sun, Chunyu, et al.
Publicado: (2025)
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
por: Wang, Chen, et al.
Publicado: (2023)
por: Wang, Chen, et al.
Publicado: (2023)
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition
por: Tseng, Yuan, et al.
Publicado: (2025)
por: Tseng, Yuan, et al.
Publicado: (2025)
Chain of Correction for Full-text Speech Recognition with Large Language Models
por: Tang, Zhiyuan, et al.
Publicado: (2025)
por: Tang, Zhiyuan, et al.
Publicado: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
por: Guo, Shoutao, et al.
Publicado: (2025)
por: Guo, Shoutao, et al.
Publicado: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
por: Liu, Henglyu, et al.
Publicado: (2025)
por: Liu, Henglyu, et al.
Publicado: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
por: Meng, Yangyang, et al.
Publicado: (2025)
por: Meng, Yangyang, et al.
Publicado: (2025)
Multi-stage Large Language Model Correction for Speech Recognition
por: Pu, Jie, et al.
Publicado: (2023)
por: Pu, Jie, et al.
Publicado: (2023)
SSR: Alignment-Aware Modality Connector for Speech Language Models
por: Tan, Weiting, et al.
Publicado: (2024)
por: Tan, Weiting, et al.
Publicado: (2024)
ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models
por: Liu, Zefang, et al.
Publicado: (2026)
por: Liu, Zefang, et al.
Publicado: (2026)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
por: Fu, Li, et al.
Publicado: (2025)
por: Fu, Li, et al.
Publicado: (2025)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
por: Fang, Yuanbo, et al.
Publicado: (2025)
por: Fang, Yuanbo, et al.
Publicado: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
por: Gao, Yifan, et al.
Publicado: (2025)
por: Gao, Yifan, et al.
Publicado: (2025)
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
por: Kang, Wonjune, et al.
Publicado: (2024)
por: Kang, Wonjune, et al.
Publicado: (2024)
MTLM: Incorporating Bidirectional Text Information to Enhance Language Model Training in Speech Recognition Systems
por: Meng, Qingliang, et al.
Publicado: (2025)
por: Meng, Qingliang, et al.
Publicado: (2025)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
por: Nozawa, Kento, et al.
Publicado: (2024)
por: Nozawa, Kento, et al.
Publicado: (2024)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
por: Zhao, Xiutian, et al.
Publicado: (2026)
por: Zhao, Xiutian, et al.
Publicado: (2026)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
por: Tang, Zhiyuan, et al.
Publicado: (2024)
por: Tang, Zhiyuan, et al.
Publicado: (2024)
An End-to-End Speech Summarization Using Large Language Model
por: Shang, Hengchao, et al.
Publicado: (2024)
por: Shang, Hengchao, et al.
Publicado: (2024)
Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
por: Das, Nilaksh, et al.
Publicado: (2024)
por: Das, Nilaksh, et al.
Publicado: (2024)
Enhancing Multilingual Voice Toxicity Detection with Speech-Text Alignment
por: Liu, Joseph, et al.
Publicado: (2024)
por: Liu, Joseph, et al.
Publicado: (2024)
Linguistic Changes in Spontaneous Speech for Detecting Parkinsons Disease Using Large Language Models
por: Crawford, Jonathan
Publicado: (2024)
por: Crawford, Jonathan
Publicado: (2024)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
por: Lin, Yi-Cheng, et al.
Publicado: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
por: Lin, Guan-Ting, et al.
Publicado: (2023)
por: Lin, Guan-Ting, et al.
Publicado: (2023)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
por: Wu, Haibin, et al.
Publicado: (2025)
por: Wu, Haibin, et al.
Publicado: (2025)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data
por: Ding, Wen, et al.
Publicado: (2025)
por: Ding, Wen, et al.
Publicado: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
por: Ling, Shaoshi, et al.
Publicado: (2025)
por: Ling, Shaoshi, et al.
Publicado: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
por: Wagner, Dominik, et al.
Publicado: (2024)
por: Wagner, Dominik, et al.
Publicado: (2024)
Ejemplares similares
-
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024) -
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
por: Xie, Jingran, et al.
Publicado: (2025) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025) -
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
por: Sun, Chunyu, et al.
Publicado: (2025) -
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
por: Wang, Chen, et al.
Publicado: (2023)