PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Mitsui, Kentaro, Mitsuda, Koh, Wakatsuki, Toshiaki, Hono, Yukiya, Sawada, Kei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
por: Hono, Yukiya, et al.
Publicado: (2023)
por: Hono, Yukiya, et al.
Publicado: (2023)
Release of Pre-Trained Models for the Japanese Language
por: Sawada, Kei, et al.
Publicado: (2024)
por: Sawada, Kei, et al.
Publicado: (2024)
PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
por: Hono, Yukiya, et al.
Publicado: (2024)
por: Hono, Yukiya, et al.
Publicado: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
por: Ai, Yang, et al.
Publicado: (2024)
por: Ai, Yang, et al.
Publicado: (2024)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)
por: Nakata, Wataru, et al.
Publicado: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
por: Xia, Kangxiang, et al.
Publicado: (2026)
por: Xia, Kangxiang, et al.
Publicado: (2026)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
por: Lu, Haitian, et al.
Publicado: (2025)
por: Lu, Haitian, et al.
Publicado: (2025)
Ultra-Low Latency Speech Enhancement - A Comprehensive Study
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
por: Li, Jingyi, et al.
Publicado: (2026)
por: Li, Jingyi, et al.
Publicado: (2026)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
por: Seki, Kentaro, et al.
Publicado: (2025)
por: Seki, Kentaro, et al.
Publicado: (2025)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
por: Udupa, Sathvik, et al.
Publicado: (2025)
por: Udupa, Sathvik, et al.
Publicado: (2025)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
por: Xie, Hanke, et al.
Publicado: (2025)
por: Xie, Hanke, et al.
Publicado: (2025)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
por: Li, Mohan, et al.
Publicado: (2024)
por: Li, Mohan, et al.
Publicado: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
por: Nespoli, Francesco, et al.
Publicado: (2024)
por: Nespoli, Francesco, et al.
Publicado: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
por: Ivry, Amir, et al.
Publicado: (2026)
por: Ivry, Amir, et al.
Publicado: (2026)
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
por: Xing, Jingyuan, et al.
Publicado: (2025)
por: Xing, Jingyuan, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Semantic MIMO Systems for Speech-to-Text Transmission
por: Weng, Zhenzi, et al.
Publicado: (2024)
por: Weng, Zhenzi, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
por: Chen, Yifu, et al.
Publicado: (2025)
por: Chen, Yifu, et al.
Publicado: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
por: Wan, Genshun, et al.
Publicado: (2026)
por: Wan, Genshun, et al.
Publicado: (2026)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
por: Raghu, Ananya, et al.
Publicado: (2025)
por: Raghu, Ananya, et al.
Publicado: (2025)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)
por: Guo, Hao-Han, et al.
Publicado: (2024)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
por: Kim, Youngjae, et al.
Publicado: (2024)
por: Kim, Youngjae, et al.
Publicado: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
por: Huang, Kuan-Po, et al.
Publicado: (2025)
por: Huang, Kuan-Po, et al.
Publicado: (2025)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
por: Wang, Xiong, et al.
Publicado: (2024)
por: Wang, Xiong, et al.
Publicado: (2024)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
por: Wagner, Dominik, et al.
Publicado: (2023)
por: Wagner, Dominik, et al.
Publicado: (2023)
Ejemplares similares
-
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
por: Hono, Yukiya, et al.
Publicado: (2023) -
Release of Pre-Trained Models for the Japanese Language
por: Sawada, Kei, et al.
Publicado: (2024) -
PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
por: Hono, Yukiya, et al.
Publicado: (2024) -
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
por: Ai, Yang, et al.
Publicado: (2024) -
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
por: Nakata, Wataru, et al.
Publicado: (2024)