RepCodec: A Speech Representation Codec for Speech Tokenization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Zhichao, Meng, Chutong, Ko, Tom |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
Towards Audio Codec-based Speech Separation
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
par: Ji, Shengpeng, et autres
Publié: (2023)
par: Ji, Shengpeng, et autres
Publié: (2023)
Personalized Neural Speech Codec
par: Jang, Inseon, et autres
Publié: (2024)
par: Jang, Inseon, et autres
Publié: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
par: Wang, Linqin, et autres
Publié: (2024)
par: Wang, Linqin, et autres
Publié: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
par: Zheng, Youqiang, et autres
Publié: (2024)
par: Zheng, Youqiang, et autres
Publié: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
par: Wang, Xiaofei, et autres
Publié: (2023)
par: Wang, Xiaofei, et autres
Publié: (2023)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
par: Chen, Peijie, et autres
Publié: (2025)
par: Chen, Peijie, et autres
Publié: (2025)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
Towards Generalized Source Tracing for Codec-Based Deepfake Speech
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
SpatialCodec: Neural Spatial Speech Coding
par: Xu, Zhongweiyang, et autres
Publié: (2023)
par: Xu, Zhongweiyang, et autres
Publié: (2023)
Probing the Robustness Properties of Neural Speech Codecs
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
par: Tseng, Wei-Cheng, et autres
Publié: (2025)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
par: Huang, Wen-Chin, et autres
Publié: (2026)
par: Huang, Wen-Chin, et autres
Publié: (2026)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
par: Wang, Hankun, et autres
Publié: (2025)
par: Wang, Hankun, et autres
Publié: (2025)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
par: Karapiperis, Sotirios, et autres
Publié: (2024)
par: Karapiperis, Sotirios, et autres
Publié: (2024)
Latent Granular Resynthesis using Neural Audio Codecs
par: Tokui, Nao, et autres
Publié: (2025)
par: Tokui, Nao, et autres
Publié: (2025)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
par: Wang, Yuancheng, et autres
Publié: (2024)
par: Wang, Yuancheng, et autres
Publié: (2024)
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
SNAC: Multi-Scale Neural Audio Codec
par: Siuzdak, Hubert, et autres
Publié: (2024)
par: Siuzdak, Hubert, et autres
Publié: (2024)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
par: Della Libera, Luca, et autres
Publié: (2025)
par: Della Libera, Luca, et autres
Publié: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Fewer-token Neural Speech Codec with Time-invariant Codes
par: Ren, Yong, et autres
Publié: (2023)
par: Ren, Yong, et autres
Publié: (2023)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
par: Ju, Zeqian, et autres
Publié: (2024)
par: Ju, Zeqian, et autres
Publié: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026)
par: Pei, Hanchen, et autres
Publié: (2026)
Documents similaires
-
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025) -
Towards Audio Codec-based Speech Separation
par: Yip, Jia Qi, et autres
Publié: (2024) -
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
par: Ji, Shengpeng, et autres
Publié: (2024) -
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
par: Ji, Shengpeng, et autres
Publié: (2023) -
Personalized Neural Speech Codec
par: Jang, Inseon, et autres
Publié: (2024)