Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Seki, Shogo, Dang, Shaoxiang, Li, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
par: Yamauchi, Kazuki, et autres
Publié: (2026)
par: Yamauchi, Kazuki, et autres
Publié: (2026)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
par: Li, Li, et autres
Publié: (2024)
par: Li, Li, et autres
Publié: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
RepCodec: A Speech Representation Codec for Speech Tokenization
par: Huang, Zhichao, et autres
Publié: (2023)
par: Huang, Zhichao, et autres
Publié: (2023)
SACodec: Asymmetric Quantization with Semantic Anchoring for Low-Bitrate High-Fidelity Neural Speech Codecs
par: Dong, Zhongren, et autres
Publié: (2025)
par: Dong, Zhongren, et autres
Publié: (2025)
ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec
par: Liu, Fei, et autres
Publié: (2026)
par: Liu, Fei, et autres
Publié: (2026)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
Audio Spotforming Using Nonnegative Tensor Factorization with Attractor-Based Regularization
par: Ayano, Shoma, et autres
Publié: (2024)
par: Ayano, Shoma, et autres
Publié: (2024)
U-Codec: Ultra Low Frame-rate Neural Speech Codec for Fast High-fidelity Speech Generation
par: Yang, Xusheng, et autres
Publié: (2025)
par: Yang, Xusheng, et autres
Publié: (2025)
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec
par: Li, Tao, et autres
Publié: (2025)
par: Li, Tao, et autres
Publié: (2025)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
par: Wang, Jin, et autres
Publié: (2025)
par: Wang, Jin, et autres
Publié: (2025)
AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ
par: Meng, Zhaoyang, et autres
Publié: (2026)
par: Meng, Zhaoyang, et autres
Publié: (2026)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
par: Shi, Jiacheng, et autres
Publié: (2026)
par: Shi, Jiacheng, et autres
Publié: (2026)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
Universal Discrete-Domain Speech Enhancement
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
par: Wang, Haoran, et autres
Publié: (2025)
par: Wang, Haoran, et autres
Publié: (2025)
NoLACE: Improving Low-Complexity Speech Codec Enhancement Through Adaptive Temporal Shaping
par: Büthe, Jan, et autres
Publié: (2023)
par: Büthe, Jan, et autres
Publié: (2023)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
HILCodec: High-Fidelity and Lightweight Neural Audio Codec
par: Ahn, Sunghwan, et autres
Publié: (2024)
par: Ahn, Sunghwan, et autres
Publié: (2024)
High-Fidelity Music Vocoder using Neural Audio Codecs
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
par: Song, Yakun, et autres
Publié: (2025)
par: Song, Yakun, et autres
Publié: (2025)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
par: Yamamoto, Katsuhiko, et autres
Publié: (2025)
par: Yamamoto, Katsuhiko, et autres
Publié: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
Hierarchical Codec Diffusion for Video-to-Speech Generation
par: Ye, Jiaxin, et autres
Publié: (2026)
par: Ye, Jiaxin, et autres
Publié: (2026)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens for Neural Codec Language Models
par: Liu, Wenrui, et autres
Publié: (2024)
par: Liu, Wenrui, et autres
Publié: (2024)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
par: Li, Jizhen, et autres
Publié: (2024)
par: Li, Jizhen, et autres
Publié: (2024)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
SuperCodec: A Neural Speech Codec with Selective Back-Projection Network
par: Zheng, Youqiang, et autres
Publié: (2024)
par: Zheng, Youqiang, et autres
Publié: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model
par: Xiang, Yang, et autres
Publié: (2025)
par: Xiang, Yang, et autres
Publié: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
par: Gong, Yitian, et autres
Publié: (2025)
par: Gong, Yitian, et autres
Publié: (2025)
Documents similaires
-
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
par: Yamauchi, Kazuki, et autres
Publié: (2026) -
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
par: Li, Li, et autres
Publié: (2024) -
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025) -
RepCodec: A Speech Representation Codec for Speech Tokenization
par: Huang, Zhichao, et autres
Publié: (2023) -
SACodec: Asymmetric Quantization with Semantic Anchoring for Low-Bitrate High-Fidelity Neural Speech Codecs
par: Dong, Zhongren, et autres
Publié: (2025)