Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Nguyen, Tan Dat, Kim, Ji-Hoon, Choi, Jeongsoo, Choi, Shukjae, Park, Jinseok, Lee, Younglo, Chung, Joon Son |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
por: Nguyen, Tan Dat, et al.
Publicado: (2025)
por: Nguyen, Tan Dat, et al.
Publicado: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor
por: Lee, Younglo, et al.
Publicado: (2024)
por: Lee, Younglo, et al.
Publicado: (2024)
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
por: Choi, Jeongsoo, et al.
Publicado: (2024)
por: Choi, Jeongsoo, et al.
Publicado: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
por: Jung, Jaemin, et al.
Publicado: (2024)
por: Jung, Jaemin, et al.
Publicado: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
por: Kim, Jaehun, et al.
Publicado: (2025)
por: Kim, Jaehun, et al.
Publicado: (2025)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
por: Pham, The Hieu, et al.
Publicado: (2025)
por: Pham, The Hieu, et al.
Publicado: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis
por: Nguyen, Tan Dat, et al.
Publicado: (2026)
por: Nguyen, Tan Dat, et al.
Publicado: (2026)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
por: Kim, Ji-Hoon, et al.
Publicado: (2023)
por: Kim, Ji-Hoon, et al.
Publicado: (2023)
RepCodec: A Speech Representation Codec for Speech Tokenization
por: Huang, Zhichao, et al.
Publicado: (2023)
por: Huang, Zhichao, et al.
Publicado: (2023)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
por: Kwak, Doyeop, et al.
Publicado: (2025)
por: Kwak, Doyeop, et al.
Publicado: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
por: Jung, Jihoo, et al.
Publicado: (2026)
por: Jung, Jihoo, et al.
Publicado: (2026)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
por: Kim, Ji-Hoon, et al.
Publicado: (2024)
por: Kim, Ji-Hoon, et al.
Publicado: (2024)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
por: Chung, Soo-Whan, et al.
Publicado: (2025)
por: Chung, Soo-Whan, et al.
Publicado: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
Probing the Robustness Properties of Neural Speech Codecs
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
Lightweight Audio Segmentation for Long-form Speech Translation
por: Lee, Jaesong, et al.
Publicado: (2024)
por: Lee, Jaesong, et al.
Publicado: (2024)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
por: Chen, Peijie, et al.
Publicado: (2025)
por: Chen, Peijie, et al.
Publicado: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Ejemplares similares
-
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
por: Nguyen, Tan Dat, et al.
Publicado: (2025) -
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
por: Choi, Jeongsoo, et al.
Publicado: (2025) -
Boosting Unknown-number Speaker Separation with Transformer Decoder-based Attractor
por: Lee, Younglo, et al.
Publicado: (2024) -
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
por: Choi, Jeongsoo, et al.
Publicado: (2025) -
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
por: Choi, Jeongsoo, et al.
Publicado: (2024)