Recent Advances in Speech Language Models: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cui, Wenqian, Yu, Dianzhi, Jiao, Xiaoqi, Meng, Ziqiao, Zhang, Guangyan, Wang, Qichao, Guo, Yiwen, King, Irwin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
par: Wang, Qichao, et autres
Publié: (2025)
par: Wang, Qichao, et autres
Publié: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026)
par: Cui, Wenqian, et autres
Publié: (2026)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
par: Tu, Zehai, et autres
Publié: (2024)
par: Tu, Zehai, et autres
Publié: (2024)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
par: Yang, Zhengdong, et autres
Publié: (2025)
par: Yang, Zhengdong, et autres
Publié: (2025)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
par: Shao, Yiwen, et autres
Publié: (2025)
par: Shao, Yiwen, et autres
Publié: (2025)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
par: Wang, Dingdong, et autres
Publié: (2024)
par: Wang, Dingdong, et autres
Publié: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
par: Osakuade, Opeyemi, et autres
Publié: (2024)
par: Osakuade, Opeyemi, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia
par: Geng, Xuelong, et autres
Publié: (2025)
par: Geng, Xuelong, et autres
Publié: (2025)
Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
par: Ma, Zhengrui, et autres
Publié: (2025)
par: Ma, Zhengrui, et autres
Publié: (2025)
Effective Context in Neural Speech Models
par: Meng, Yen, et autres
Publié: (2025)
par: Meng, Yen, et autres
Publié: (2025)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Direct Speech-to-Speech Neural Machine Translation: A Survey
par: Gupta, Mahendra, et autres
Publié: (2024)
par: Gupta, Mahendra, et autres
Publié: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
par: Cui, Ziyun, et autres
Publié: (2024)
par: Cui, Ziyun, et autres
Publié: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
par: Wang, Yuanyuan, et autres
Publié: (2026)
par: Wang, Yuanyuan, et autres
Publié: (2026)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
par: Zhu, Yongxin, et autres
Publié: (2024)
par: Zhu, Yongxin, et autres
Publié: (2024)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
par: Sharif, Muhammad, et autres
Publié: (2024)
par: Sharif, Muhammad, et autres
Publié: (2024)
Transformers in Speech Processing: A Survey
par: Latif, Siddique, et autres
Publié: (2023)
par: Latif, Siddique, et autres
Publié: (2023)
Summarizing Speech: A Comprehensive Survey
par: Retkowski, Fabian, et autres
Publié: (2025)
par: Retkowski, Fabian, et autres
Publié: (2025)
UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization
par: Wang, Yuejiao, et autres
Publié: (2024)
par: Wang, Yuejiao, et autres
Publié: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Documents similaires
-
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
par: Cui, Wenqian, et autres
Publié: (2025) -
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
par: Wang, Qichao, et autres
Publié: (2025) -
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026) -
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
par: Tu, Zehai, et autres
Publié: (2024) -
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
par: Cui, Wenqian, et autres
Publié: (2025)