CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Ruifan, Gong, Yitian, Gao, Qinghui, Jin, Luozhijie, Cheng, Qinyuan, Fei, Zhaoye, Li, Shimin, Qiu, Xipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)
por: Chen, Wenxi, et al.
Publicado: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
por: Wang, Jin, et al.
Publicado: (2025)
por: Wang, Jin, et al.
Publicado: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
MOSS Transcribe Diarize Technical Report
por: AI, MOSI., et al.
Publicado: (2026)
por: AI, MOSI., et al.
Publicado: (2026)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
por: Huang, Wen-Chin, et al.
Publicado: (2026)
por: Huang, Wen-Chin, et al.
Publicado: (2026)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
por: Chen, Huakang, et al.
Publicado: (2026)
por: Chen, Huakang, et al.
Publicado: (2026)
Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival Estimation
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
MuCodec: Ultra Low-Bitrate Music Codec
por: Xu, Yaoxun, et al.
Publicado: (2024)
por: Xu, Yaoxun, et al.
Publicado: (2024)
Codec-SUPERB: An In-Depth Analysis of Sound Codec Models
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
por: Zhang, Dong, et al.
Publicado: (2024)
por: Zhang, Dong, et al.
Publicado: (2024)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
por: Jiang, Yidi, et al.
Publicado: (2025)
por: Jiang, Yidi, et al.
Publicado: (2025)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
Code Drift: Towards Idempotent Neural Audio Codecs
por: O'Reilly, Patrick, et al.
Publicado: (2024)
por: O'Reilly, Patrick, et al.
Publicado: (2024)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
por: Shi, Yu-Fei, et al.
Publicado: (2024)
por: Shi, Yu-Fei, et al.
Publicado: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
por: Hussein, Amir, et al.
Publicado: (2025)
por: Hussein, Amir, et al.
Publicado: (2025)
A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model
por: Xiang, Yang, et al.
Publicado: (2025)
por: Xiang, Yang, et al.
Publicado: (2025)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
por: Chen, Peijie, et al.
Publicado: (2025)
por: Chen, Peijie, et al.
Publicado: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Evaluation of Virtual Acoustic Environments with Different Acoustic Level of Detail
por: Fichna, Stefan, et al.
Publicado: (2023)
por: Fichna, Stefan, et al.
Publicado: (2023)
SpeechAlign: Aligning Speech Generation to Human Preferences
por: Zhang, Dong, et al.
Publicado: (2024)
por: Zhang, Dong, et al.
Publicado: (2024)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
por: Liu, Wenrui, et al.
Publicado: (2024)
por: Liu, Wenrui, et al.
Publicado: (2024)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Probing the Robustness Properties of Neural Speech Codecs
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
por: Tseng, Wei-Cheng, et al.
Publicado: (2025)
Toward a Sparse and Interpretable Audio Codec
por: Vinyard, John
Publicado: (2025)
por: Vinyard, John
Publicado: (2025)
Ejemplares similares
-
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025) -
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
por: Huang, Kexin, et al.
Publicado: (2025) -
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026) -
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024) -
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)