Recent Advances in Speech Language Models: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Wenqian, Yu, Dianzhi, Jiao, Xiaoqi, Meng, Ziqiao, Zhang, Guangyan, Wang, Qichao, Guo, Yiwen, King, Irwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
di: Wang, Qichao, et al.
Pubblicazione: (2025)
di: Wang, Qichao, et al.
Pubblicazione: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
di: Tu, Zehai, et al.
Pubblicazione: (2024)
di: Tu, Zehai, et al.
Pubblicazione: (2024)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
di: Shao, Yiwen, et al.
Pubblicazione: (2025)
di: Shao, Yiwen, et al.
Pubblicazione: (2025)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
di: Geng, Xuelong, et al.
Pubblicazione: (2025)
Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
di: Ma, Zhengrui, et al.
Pubblicazione: (2025)
di: Ma, Zhengrui, et al.
Pubblicazione: (2025)
Effective Context in Neural Speech Models
di: Meng, Yen, et al.
Pubblicazione: (2025)
di: Meng, Yen, et al.
Pubblicazione: (2025)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective
di: Wang, Hankun, et al.
Pubblicazione: (2024)
di: Wang, Hankun, et al.
Pubblicazione: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
Direct Speech-to-Speech Neural Machine Translation: A Survey
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
di: Gupta, Mahendra, et al.
Pubblicazione: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Recent Advances in End-to-End Simultaneous Speech Translation
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
di: Peng, Yifan, et al.
Pubblicazione: (2024)
di: Peng, Yifan, et al.
Pubblicazione: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
di: Wang, Yuanyuan, et al.
Pubblicazione: (2026)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2026)
Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
di: Zhu, Yongxin, et al.
Pubblicazione: (2024)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
di: Sharif, Muhammad, et al.
Pubblicazione: (2024)
di: Sharif, Muhammad, et al.
Pubblicazione: (2024)
Transformers in Speech Processing: A Survey
di: Latif, Siddique, et al.
Pubblicazione: (2023)
di: Latif, Siddique, et al.
Pubblicazione: (2023)
Summarizing Speech: A Comprehensive Survey
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
di: Retkowski, Fabian, et al.
Pubblicazione: (2025)
UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization
di: Wang, Yuejiao, et al.
Pubblicazione: (2024)
di: Wang, Yuejiao, et al.
Pubblicazione: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
di: Kando, Shunsuke, et al.
Pubblicazione: (2025)
di: Kando, Shunsuke, et al.
Pubblicazione: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
LAST: Language Model Aware Speech Tokenization
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
di: Turetzky, Arnon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025) -
NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction
di: Wang, Qichao, et al.
Pubblicazione: (2025) -
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026) -
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
di: Tu, Zehai, et al.
Pubblicazione: (2024) -
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
di: Cui, Wenqian, et al.
Pubblicazione: (2025)