DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Tao, Ge, Wenshuo, Wang, Zhichao, Cui, Zihao, Ma, Yong, Gao, Yingying, Deng, Chao, Zhang, Shilei, Feng, Junlan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
por: Luo, Xiaoxue, et al.
Publicado: (2025)
por: Luo, Xiaoxue, et al.
Publicado: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language Modeling
por: Si, Yuke, et al.
Publicado: (2025)
por: Si, Yuke, et al.
Publicado: (2025)
On Calibration of Speech Classification Models: Insights from Energy-Based Model Investigations
por: Hao, Yaqian, et al.
Publicado: (2024)
por: Hao, Yaqian, et al.
Publicado: (2024)
PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models
por: Yang, Runyan, et al.
Publicado: (2024)
por: Yang, Runyan, et al.
Publicado: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
por: Huang, Zhichao, et al.
Publicado: (2023)
por: Huang, Zhichao, et al.
Publicado: (2023)
MFSN: Multi-perspective Fusion Search Network For Pre-training Knowledge in Speech Emotion Recognition
por: Sun, Haiyang, et al.
Publicado: (2023)
por: Sun, Haiyang, et al.
Publicado: (2023)
FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec
por: Halychanskyi, Yurii, et al.
Publicado: (2025)
por: Halychanskyi, Yurii, et al.
Publicado: (2025)
GenDistiller: Distilling Pre-trained Language Models based on an Autoregressive Generative Model
por: Gao, Yingying, et al.
Publicado: (2024)
por: Gao, Yingying, et al.
Publicado: (2024)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026)
por: Shi, Jiacheng, et al.
Publicado: (2026)
DisSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration
por: Liang, Ziqi, et al.
Publicado: (2026)
por: Liang, Ziqi, et al.
Publicado: (2026)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ
por: Meng, Zhaoyang, et al.
Publicado: (2026)
por: Meng, Zhaoyang, et al.
Publicado: (2026)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Fewer-token Neural Speech Codec with Time-invariant Codes
por: Ren, Yong, et al.
Publicado: (2023)
por: Ren, Yong, et al.
Publicado: (2023)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
por: Wang, Yuancheng, et al.
Publicado: (2024)
por: Wang, Yuancheng, et al.
Publicado: (2024)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
por: Yang, Runyan, et al.
Publicado: (2025)
por: Yang, Runyan, et al.
Publicado: (2025)
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
por: Yang, Xusheng, et al.
Publicado: (2025)
por: Yang, Xusheng, et al.
Publicado: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
por: Wang, Linqin, et al.
Publicado: (2024)
por: Wang, Linqin, et al.
Publicado: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
por: Nespoli, Francesco, et al.
Publicado: (2024)
por: Nespoli, Francesco, et al.
Publicado: (2024)
BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
por: Xing, Jingyuan, et al.
Publicado: (2025)
por: Xing, Jingyuan, et al.
Publicado: (2025)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
por: Nishimura, Yuto, et al.
Publicado: (2024)
por: Nishimura, Yuto, et al.
Publicado: (2024)
B-GRPO: Unsupervised Speech Emotion Recognition based on Batched-Group Relative Policy Optimization
por: Gao, Yingying, et al.
Publicado: (2026)
por: Gao, Yingying, et al.
Publicado: (2026)
ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec
por: Liu, Fei, et al.
Publicado: (2026)
por: Liu, Fei, et al.
Publicado: (2026)
Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning
por: Wang, Junyi, et al.
Publicado: (2026)
por: Wang, Junyi, et al.
Publicado: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
por: Karapiperis, Sotirios, et al.
Publicado: (2024)
por: Karapiperis, Sotirios, et al.
Publicado: (2024)
MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt
por: Wu, Zhichao, et al.
Publicado: (2025)
por: Wu, Zhichao, et al.
Publicado: (2025)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Zero-Shot Text-to-Speech for Vietnamese
por: Vu, Thi, et al.
Publicado: (2025)
por: Vu, Thi, et al.
Publicado: (2025)
Ejemplares similares
-
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024) -
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
por: Luo, Xiaoxue, et al.
Publicado: (2025) -
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026) -
HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language Modeling
por: Si, Yuke, et al.
Publicado: (2025) -
On Calibration of Speech Classification Models: Insights from Energy-Based Model Investigations
por: Hao, Yaqian, et al.
Publicado: (2024)