Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Hanglei, Guo, Yiwei, Li, Zhihan, Hao, Xiang, Chen, Xie, Yu, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
Recent Advances in Discrete Speech Tokens: A Review
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025)
por: Wang, Haoran, et al.
Publicado: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
por: Li, Bohan, et al.
Publicado: (2026)
por: Li, Bohan, et al.
Publicado: (2026)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
On the Design of Diffusion-based Neural Speech Codecs
por: Foti, Pietro, et al.
Publicado: (2025)
por: Foti, Pietro, et al.
Publicado: (2025)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
por: Wang, Shih-Heng, et al.
Publicado: (2026)
por: Wang, Shih-Heng, et al.
Publicado: (2026)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
por: Juvela, Lauri, et al.
Publicado: (2024)
por: Juvela, Lauri, et al.
Publicado: (2024)
HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling
por: Xue, Rongkun, et al.
Publicado: (2025)
por: Xue, Rongkun, et al.
Publicado: (2025)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
por: Kim, Minje, et al.
Publicado: (2024)
por: Kim, Minje, et al.
Publicado: (2024)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
VoiceFlow: Efficient Text-to-Speech with Rectified Flow Matching
por: Guo, Yiwei, et al.
Publicado: (2023)
por: Guo, Yiwei, et al.
Publicado: (2023)
SpectroStream: A Versatile Neural Codec for General Audio
por: Li, Yunpeng, et al.
Publicado: (2025)
por: Li, Yunpeng, et al.
Publicado: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
ASD-Diffusion: Anomalous Sound Detection with Diffusion Models
por: Zhang, Fengrun, et al.
Publicado: (2024)
por: Zhang, Fengrun, et al.
Publicado: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
por: Qiang, Chunyu, et al.
Publicado: (2025)
por: Qiang, Chunyu, et al.
Publicado: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Quantizer-Aware Hierarchical Neural Codec Modeling for Speech Deepfake Detection
por: Wu, Jinyang, et al.
Publicado: (2026)
por: Wu, Jinyang, et al.
Publicado: (2026)
Unlocking Speech Instruction Data Potential with Query Rewriting
por: Hei, Yonghua, et al.
Publicado: (2025)
por: Hei, Yonghua, et al.
Publicado: (2025)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
por: Jiang, Yicong, et al.
Publicado: (2024)
por: Jiang, Yicong, et al.
Publicado: (2024)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS
por: Susladkar, Onkar Kishor, et al.
Publicado: (2024)
por: Susladkar, Onkar Kishor, et al.
Publicado: (2024)
Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation
por: Xu, Mohan, et al.
Publicado: (2024)
por: Xu, Mohan, et al.
Publicado: (2024)
MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling
por: Tang, Jingjing, et al.
Publicado: (2025)
por: Tang, Jingjing, et al.
Publicado: (2025)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
por: Chen, Guo, et al.
Publicado: (2025)
por: Chen, Guo, et al.
Publicado: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
Ejemplares similares
-
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024) -
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025) -
Recent Advances in Discrete Speech Tokens: A Review
por: Guo, Yiwei, et al.
Publicado: (2025) -
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
por: Wang, Haoran, et al.
Publicado: (2025) -
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
por: Guo, Yiwei, et al.
Publicado: (2025)