Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Bohan, Wang, Hankun, Zhang, Situo, Guo, Yiwei, Yu, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction
por: Guichoux, Téo, et al.
Publicado: (2025)
por: Guichoux, Téo, et al.
Publicado: (2025)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
por: Li, Bohan, et al.
Publicado: (2026)
por: Li, Bohan, et al.
Publicado: (2026)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
por: Wang, Hankun, et al.
Publicado: (2024)
por: Wang, Hankun, et al.
Publicado: (2024)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
por: Liu, Yisi, et al.
Publicado: (2024)
por: Liu, Yisi, et al.
Publicado: (2024)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
por: Niizumi, Daisuke, et al.
Publicado: (2024)
por: Niizumi, Daisuke, et al.
Publicado: (2024)
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
por: Niizumi, Daisuke, et al.
Publicado: (2024)
por: Niizumi, Daisuke, et al.
Publicado: (2024)
Recent Advances in Discrete Speech Tokens: A Review
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
por: Du, Chenpeng, et al.
Publicado: (2024)
por: Du, Chenpeng, et al.
Publicado: (2024)
Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis
por: Salehi, Pegah, et al.
Publicado: (2024)
por: Salehi, Pegah, et al.
Publicado: (2024)
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
por: Niizumi, Daisuke, et al.
Publicado: (2024)
por: Niizumi, Daisuke, et al.
Publicado: (2024)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
Incremental FastPitch: Chunk-based High Quality Text to Speech
por: Du, Muyang, et al.
Publicado: (2024)
por: Du, Muyang, et al.
Publicado: (2024)
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
por: Zhang, Hanglei, et al.
Publicado: (2025)
por: Zhang, Hanglei, et al.
Publicado: (2025)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
Decoding Order Matters in Autoregressive Speech Synthesis
por: Zhao, Minghui, et al.
Publicado: (2026)
por: Zhao, Minghui, et al.
Publicado: (2026)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
por: Roy, Abhinaba, et al.
Publicado: (2025)
por: Roy, Abhinaba, et al.
Publicado: (2025)
MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition
por: Jon, Hyo Jin, et al.
Publicado: (2025)
por: Jon, Hyo Jin, et al.
Publicado: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
por: Niizumi, Daisuke, et al.
Publicado: (2025)
por: Niizumi, Daisuke, et al.
Publicado: (2025)
Towards Pre-training an Effective Respiratory Audio Foundation Model
por: Niizumi, Daisuke, et al.
Publicado: (2025)
por: Niizumi, Daisuke, et al.
Publicado: (2025)
BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models
por: Liang, Susan, et al.
Publicado: (2025)
por: Liang, Susan, et al.
Publicado: (2025)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
por: Zhu, Tao, et al.
Publicado: (2025)
por: Zhu, Tao, et al.
Publicado: (2025)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
por: Wang, Helin, et al.
Publicado: (2025)
por: Wang, Helin, et al.
Publicado: (2025)
Apollo: Band-sequence Modeling for High-Quality Audio Restoration
por: Li, Kai, et al.
Publicado: (2024)
por: Li, Kai, et al.
Publicado: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
por: Cai, Runyuan, et al.
Publicado: (2026)
por: Cai, Runyuan, et al.
Publicado: (2026)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing
por: Sioros, Vassilis, et al.
Publicado: (2025)
por: Sioros, Vassilis, et al.
Publicado: (2025)
A Speech Enhancement Method Using Fast Fourier Transform and Convolutional Autoencoder
por: Kow, Pu-Yun, et al.
Publicado: (2025)
por: Kow, Pu-Yun, et al.
Publicado: (2025)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
por: Mai, Jialong, et al.
Publicado: (2025)
por: Mai, Jialong, et al.
Publicado: (2025)
Ejemplares similares
-
Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction
por: Guichoux, Téo, et al.
Publicado: (2025) -
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
por: Li, Bohan, et al.
Publicado: (2026) -
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024) -
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025) -
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)