APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Hui-Peng, Ai, Yang, Zheng, Rui-Chen, Ling, Zhen-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
par: Ahn, Sunghwan, et autres
Publié: (2024)
par: Ahn, Sunghwan, et autres
Publié: (2024)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
par: Wang, Jin, et autres
Publié: (2025)
par: Wang, Jin, et autres
Publié: (2025)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
par: Liu, Fei, et autres
Publié: (2024)
par: Liu, Fei, et autres
Publié: (2024)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
ComplexDec: A Domain-robust High-fidelity Neural Audio Codec with Complex Spectrum Modeling
par: Wu, Yi-Chiao, et autres
Publié: (2025)
par: Wu, Yi-Chiao, et autres
Publié: (2025)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
par: Zheng, Rui-Chen, et autres
Publié: (2025)
par: Zheng, Rui-Chen, et autres
Publié: (2025)
Pitch-and-Spectrum-Aware Singing Quality Assessment with Bias Correction and Model Fusion
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
Code Drift: Towards Idempotent Neural Audio Codecs
par: O'Reilly, Patrick, et autres
Publié: (2024)
par: O'Reilly, Patrick, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
par: Wang, Hankun, et autres
Publié: (2025)
par: Wang, Hankun, et autres
Publié: (2025)
High-Fidelity Generative Audio Compression at 0.275kbps
par: Ma, Hao, et autres
Publié: (2026)
par: Ma, Hao, et autres
Publié: (2026)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
par: Xue, Rongkun, et autres
Publié: (2025)
par: Xue, Rongkun, et autres
Publié: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023)
par: Lu, Ye-Xin, et autres
Publié: (2023)
Towards Neural Audio Codec Source Parsing
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
ERVQ: Enhanced Residual Vector Quantization with Intra-and-Inter-Codebook Optimization for Neural Audio Codecs
par: Zheng, Rui-Chen, et autres
Publié: (2024)
par: Zheng, Rui-Chen, et autres
Publié: (2024)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain
par: Wan, Zixiang, et autres
Publié: (2025)
par: Wan, Zixiang, et autres
Publié: (2025)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
par: Chen, Peijie, et autres
Publié: (2025)
par: Chen, Peijie, et autres
Publié: (2025)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
SpatialCodec: Neural Spatial Speech Coding
par: Xu, Zhongweiyang, et autres
Publié: (2023)
par: Xu, Zhongweiyang, et autres
Publié: (2023)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
On the Language and Gender Biases in PSTN, VoIP and Neural Audio Codecs
par: Altwlkany, Kemal, et autres
Publié: (2025)
par: Altwlkany, Kemal, et autres
Publié: (2025)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
par: Jiang, Yidi, et autres
Publié: (2025)
par: Jiang, Yidi, et autres
Publié: (2025)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
par: Zheng, Youqiang, et autres
Publié: (2024)
par: Zheng, Youqiang, et autres
Publié: (2024)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Documents similaires
-
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024) -
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
par: Jiang, Xiao-Hang, et autres
Publié: (2024) -
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025) -
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
par: Ahn, Sunghwan, et autres
Publié: (2024) -
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
par: Wang, Jin, et autres
Publié: (2025)