Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Zijian, Zhang, Yang, Yuan, Yougen, Yan, Yuming, Liu, Jinjiang, Wu, Zhiyong, Hu, Pengfei, Yu, Qun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
Decoding Order Matters in Autoregressive Speech Synthesis
por: Zhao, Minghui, et al.
Publicado: (2026)
por: Zhao, Minghui, et al.
Publicado: (2026)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
por: Zhuang, Ziyang, et al.
Publicado: (2024)
por: Zhuang, Ziyang, et al.
Publicado: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
por: Wang, Hankun, et al.
Publicado: (2024)
por: Wang, Hankun, et al.
Publicado: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
por: Niu, Rui, et al.
Publicado: (2025)
por: Niu, Rui, et al.
Publicado: (2025)
A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
por: Ye, Runchuan, et al.
Publicado: (2025)
por: Ye, Runchuan, et al.
Publicado: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
por: Cai, Runyuan, et al.
Publicado: (2026)
por: Cai, Runyuan, et al.
Publicado: (2026)
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
Magnetoencephalography (MEG) Based Non-Invasive Chinese Speech Decoding
por: Jia, Zhihong, et al.
Publicado: (2025)
por: Jia, Zhihong, et al.
Publicado: (2025)
Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis
por: Lin, Weiwei, et al.
Publicado: (2025)
por: Lin, Weiwei, et al.
Publicado: (2025)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
por: Jin, Jiawei, et al.
Publicado: (2025)
por: Jin, Jiawei, et al.
Publicado: (2025)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
por: Zhao, Junchuan, et al.
Publicado: (2026)
por: Zhao, Junchuan, et al.
Publicado: (2026)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
por: Du, Chenpeng, et al.
Publicado: (2024)
por: Du, Chenpeng, et al.
Publicado: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
por: Chen, Peikun, et al.
Publicado: (2024)
por: Chen, Peikun, et al.
Publicado: (2024)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
por: Chen, Xueyuan, et al.
Publicado: (2025)
por: Chen, Xueyuan, et al.
Publicado: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
CDSD: Chinese Dysarthria Speech Database
por: Wang, Yan, et al.
Publicado: (2023)
por: Wang, Yan, et al.
Publicado: (2023)
PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
por: Lin, Bin, et al.
Publicado: (2026)
por: Lin, Bin, et al.
Publicado: (2026)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
por: Lei, Shun, et al.
Publicado: (2023)
por: Lei, Shun, et al.
Publicado: (2023)
Deep Speech Synthesis from Multimodal Articulatory Representations
por: Wu, Peter, et al.
Publicado: (2024)
por: Wu, Peter, et al.
Publicado: (2024)
UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment
por: Wang, Yuanyuan, et al.
Publicado: (2026)
por: Wang, Yuanyuan, et al.
Publicado: (2026)
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)
por: Li, Zhipeng, et al.
Publicado: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization
por: Sun, Xiaohui, et al.
Publicado: (2025)
por: Sun, Xiaohui, et al.
Publicado: (2025)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
por: Li, Hanzhao, et al.
Publicado: (2025)
por: Li, Hanzhao, et al.
Publicado: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
por: Zhou, Rui, et al.
Publicado: (2024)
por: Zhou, Rui, et al.
Publicado: (2024)
Ejemplares similares
-
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025) -
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024) -
Decoding Order Matters in Autoregressive Speech Synthesis
por: Zhao, Minghui, et al.
Publicado: (2026) -
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022) -
EffectiveASR: A Single-Step Non-Autoregressive Mandarin Speech Recognition Architecture with High Accuracy and Inference Speed
por: Zhuang, Ziyang, et al.
Publicado: (2024)