CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hankun, Guo, Yiwei, Shao, Chongtian, Li, Bohan, Yu, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
di: Zhang, Hanglei, et al.
Pubblicazione: (2025)
di: Zhang, Hanglei, et al.
Pubblicazione: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
di: Wang, Haoran, et al.
Pubblicazione: (2025)
di: Wang, Haoran, et al.
Pubblicazione: (2025)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)
di: Jang, Inseon, et al.
Pubblicazione: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
di: Zheng, Youqiang, et al.
Pubblicazione: (2024)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
di: Xin, Detai, et al.
Pubblicazione: (2024)
di: Xin, Detai, et al.
Pubblicazione: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
SpatialCodec: Neural Spatial Speech Coding
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2023)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2023)
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
di: Yang, Peiji, et al.
Pubblicazione: (2024)
di: Yang, Peiji, et al.
Pubblicazione: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Probing the Robustness Properties of Neural Speech Codecs
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Recent Advances in Discrete Speech Tokens: A Review
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
di: Chen, Xuanjun, et al.
Pubblicazione: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
SECodec: Structural Entropy-based Compressive Speech Representation Codec for Speech Language Models
di: Wang, Linqin, et al.
Pubblicazione: (2024)
di: Wang, Linqin, et al.
Pubblicazione: (2024)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
di: Guo, Haohan, et al.
Pubblicazione: (2024)
di: Guo, Haohan, et al.
Pubblicazione: (2024)
Codec-SUPERB: An In-Depth Analysis of Sound Codec Models
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
di: Chen, Peijie, et al.
Pubblicazione: (2025)
di: Chen, Peijie, et al.
Pubblicazione: (2025)
Low Frame-rate Speech Codec: a Codec Designed for Fast High-quality Speech LLM Training and Inference
di: Casanova, Edresson, et al.
Pubblicazione: (2024)
di: Casanova, Edresson, et al.
Pubblicazione: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
Fewer-token Neural Speech Codec with Time-invariant Codes
di: Ren, Yong, et al.
Pubblicazione: (2023)
di: Ren, Yong, et al.
Pubblicazione: (2023)
MuCodec: Ultra Low-Bitrate Music Codec
di: Xu, Yaoxun, et al.
Pubblicazione: (2024)
di: Xu, Yaoxun, et al.
Pubblicazione: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
RADE: A Neural Codec for Transmitting Speech over HF Radio Channels
di: Rowe, David, et al.
Pubblicazione: (2025)
di: Rowe, David, et al.
Pubblicazione: (2025)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
di: Xue, Rongkun, et al.
Pubblicazione: (2025)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
di: Guo, Haohan, et al.
Pubblicazione: (2024)
di: Guo, Haohan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
di: Zhang, Hanglei, et al.
Pubblicazione: (2025) -
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
di: Wang, Haoran, et al.
Pubblicazione: (2025) -
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
di: Guo, Yiwei, et al.
Pubblicazione: (2024) -
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2025) -
Personalized Neural Speech Codec
di: Jang, Inseon, et al.
Pubblicazione: (2024)