Speaking Clearly: A Simplified Whisper-Based Codec for Low-Bitrate Speech Coding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xin, Li, Lin, Lu, Xiangni, Liu, Jianquan, Lee, Kong Aik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
MuCodec: Ultra Low-Bitrate Music Codec
por: Xu, Yaoxun, et al.
Publicado: (2024)
por: Xu, Yaoxun, et al.
Publicado: (2024)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
SACodec: Asymmetric Quantization with Semantic Anchoring for Low-Bitrate High-Fidelity Neural Speech Codecs
por: Dong, Zhongren, et al.
Publicado: (2025)
por: Dong, Zhongren, et al.
Publicado: (2025)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
por: Yang, Peiji, et al.
Publicado: (2024)
por: Yang, Peiji, et al.
Publicado: (2024)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)
por: Chae, Yunkee, et al.
Publicado: (2025)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
UniSRCodec: Unified and Low-Bitrate Single Codebook Codec with Sub-Band Reconstruction
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
U3-xi: Pushing the Boundaries of Speaker Recognition by Incorporating Uncertainty
por: Li, Junjie, et al.
Publicado: (2026)
por: Li, Junjie, et al.
Publicado: (2026)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
Scaling Transformers for Low-Bitrate High-Quality Speech Coding
por: Parker, Julian D, et al.
Publicado: (2024)
por: Parker, Julian D, et al.
Publicado: (2024)
FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
por: Wan, Zixiang, et al.
Publicado: (2025)
por: Wan, Zixiang, et al.
Publicado: (2025)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026)
por: Shi, Jiacheng, et al.
Publicado: (2026)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
por: Zhang, Li, et al.
Publicado: (2024)
por: Zhang, Li, et al.
Publicado: (2024)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
por: Casanova, Edresson, et al.
Publicado: (2024)
por: Casanova, Edresson, et al.
Publicado: (2024)
Fewer-token Neural Speech Codec with Time-invariant Codes
por: Ren, Yong, et al.
Publicado: (2023)
por: Ren, Yong, et al.
Publicado: (2023)
AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ
por: Meng, Zhaoyang, et al.
Publicado: (2026)
por: Meng, Zhaoyang, et al.
Publicado: (2026)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
por: Wang, Siyu, et al.
Publicado: (2025)
por: Wang, Siyu, et al.
Publicado: (2025)
DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
por: Li, Tao, et al.
Publicado: (2025)
por: Li, Tao, et al.
Publicado: (2025)
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
por: Yang, Xusheng, et al.
Publicado: (2025)
por: Yang, Xusheng, et al.
Publicado: (2025)
Addressing Gradient Misalignment in Data-Augmented Training for Robust Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
por: Truong, Duc-Tuan, et al.
Publicado: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
por: Brendel, Andreas, et al.
Publicado: (2024)
por: Brendel, Andreas, et al.
Publicado: (2024)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
por: Lin, Weiwei, et al.
Publicado: (2024)
por: Lin, Weiwei, et al.
Publicado: (2024)
Towards Generalized Source Tracing for Codec-Based Deepfake Speech
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Adversarial speech for voice privacy protection from Personalized Speech generation
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
Cosine Scoring with Uncertainty for Neural Speaker Embedding
por: Wang, Qiongqiong, et al.
Publicado: (2024)
por: Wang, Qiongqiong, et al.
Publicado: (2024)
Ejemplares similares
-
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024) -
MuCodec: Ultra Low-Bitrate Music Codec
por: Xu, Yaoxun, et al.
Publicado: (2024) -
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025) -
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024) -
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025)