Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Haibin, Hu, Yuxuan, Fan, Ruchao, Wang, Xiaofei, Kumatani, Kenichi, Ren, Bo, Yu, Jianwei, Lu, Heng, Wang, Lijuan, Qian, Yao, Li, Jinyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
par: Hu, Yuxuan, et autres
Publié: (2025)
par: Hu, Yuxuan, et autres
Publié: (2025)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
par: Ren, Bo, et autres
Publié: (2026)
par: Ren, Bo, et autres
Publié: (2026)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
par: Shi, Mohan, et autres
Publié: (2025)
par: Shi, Mohan, et autres
Publié: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Position: Towards Responsible Evaluation for Text-to-Speech
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
par: Shankar, Natarajan Balaji, et autres
Publié: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
par: Ma, Linhan, et autres
Publié: (2025)
par: Ma, Linhan, et autres
Publié: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
par: Park, Joonyong, et autres
Publié: (2025)
par: Park, Joonyong, et autres
Publié: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
par: Le, Chenyang, et autres
Publié: (2024)
par: Le, Chenyang, et autres
Publié: (2024)
Isochrony-Controlled Speech-to-Text Translation: A study on translating from Sino-Tibetan to Indo-European Languages
par: Yousefi, Midia, et autres
Publié: (2024)
par: Yousefi, Midia, et autres
Publié: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
VINP: Variational Bayesian Inference with Neural Speech Prior for Joint ASR-Effective Speech Dereverberation and Blind RIR Identification
par: Wang, Pengyu, et autres
Publié: (2025)
par: Wang, Pengyu, et autres
Publié: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
par: Zhou, Wei, et autres
Publié: (2024)
par: Zhou, Wei, et autres
Publié: (2024)
Ultra-Low Latency Speech Enhancement - A Comprehensive Study
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026)
par: Pei, Hanchen, et autres
Publié: (2026)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
par: Kuhlmann, Michael, et autres
Publié: (2026)
par: Kuhlmann, Michael, et autres
Publié: (2026)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
par: Ren, Yong, et autres
Publié: (2026)
par: Ren, Yong, et autres
Publié: (2026)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
par: Zheng, Qixi, et autres
Publié: (2025)
par: Zheng, Qixi, et autres
Publié: (2025)
CTC-GMM: CTC guided modality matching for fast and accurate streaming speech translation
par: Zhao, Rui, et autres
Publié: (2024)
par: Zhao, Rui, et autres
Publié: (2024)
Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024)
par: Dai, Wang, et autres
Publié: (2024)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
Documents similaires
-
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
par: Hu, Yuxuan, et autres
Publié: (2025) -
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
par: Fan, Ruchao, et autres
Publié: (2024) -
RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models
par: Ren, Bo, et autres
Publié: (2026) -
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
par: Shi, Mohan, et autres
Publié: (2025) -
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)