High-Fidelity Speech Enhancement via Discrete Audio Tokens
Fuente:
arXiv
Guardado en:
| Autores principales: | Lanzendörfer, Luca A., Berdoz, Frédéric, Asonitis, Antonis, Wattenhofer, Roger |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-bit Audio Watermarking
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Parametric Neural Amp Modeling with Active Learning
por: Grötschla, Florian, et al.
Publicado: (2025)
por: Grötschla, Florian, et al.
Publicado: (2025)
SNAC: Multi-Scale Neural Audio Codec
por: Siuzdak, Hubert, et al.
Publicado: (2024)
por: Siuzdak, Hubert, et al.
Publicado: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
por: Grötschla, Florian, et al.
Publicado: (2024)
por: Grötschla, Florian, et al.
Publicado: (2024)
MaskBeat: Loopable Drum Beat Generation
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
por: Ulgen, Ismail Rasim, et al.
Publicado: (2025)
por: Ulgen, Ismail Rasim, et al.
Publicado: (2025)
Scalable Speech Enhancement with Dynamic Channel Pruning
por: Miccini, Riccardo, et al.
Publicado: (2024)
por: Miccini, Riccardo, et al.
Publicado: (2024)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
por: Jain, Arnav, et al.
Publicado: (2024)
por: Jain, Arnav, et al.
Publicado: (2024)
Adaptive Slimming for Scalable and Efficient Speech Enhancement
por: Miccini, Riccardo, et al.
Publicado: (2025)
por: Miccini, Riccardo, et al.
Publicado: (2025)
Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration
por: Sun, Esther, et al.
Publicado: (2026)
por: Sun, Esther, et al.
Publicado: (2026)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
RepCodec: A Speech Representation Codec for Speech Tokenization
por: Huang, Zhichao, et al.
Publicado: (2023)
por: Huang, Zhichao, et al.
Publicado: (2023)
On-device Streaming Discrete Speech Units
por: Choi, Kwanghee, et al.
Publicado: (2025)
por: Choi, Kwanghee, et al.
Publicado: (2025)
Test-Time Training for Speech Enhancement
por: Behera, Avishkar, et al.
Publicado: (2025)
por: Behera, Avishkar, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
Drax: Speech Recognition with Discrete Flow Matching
por: Navon, Aviv, et al.
Publicado: (2025)
por: Navon, Aviv, et al.
Publicado: (2025)
From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement Networks
por: Miccini, Riccardo, et al.
Publicado: (2026)
por: Miccini, Riccardo, et al.
Publicado: (2026)
Diffusion Buffer for Online Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2025)
por: Lay, Bunlong, et al.
Publicado: (2025)
An Analysis of the Variance of Diffusion-based Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
The PESQetarian: On the Relevance of Goodhart's Law for Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
por: Reszka, Joanna, et al.
Publicado: (2024)
por: Reszka, Joanna, et al.
Publicado: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
por: Guimarães, Heitor R., et al.
Publicado: (2025)
por: Guimarães, Heitor R., et al.
Publicado: (2025)
Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?
por: Makarov, Rostislav, et al.
Publicado: (2025)
por: Makarov, Rostislav, et al.
Publicado: (2025)
Investigating the Design Space of Diffusion Models for Speech Enhancement
por: Gonzalez, Philippe, et al.
Publicado: (2023)
por: Gonzalez, Philippe, et al.
Publicado: (2023)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
por: Richter, Julius, et al.
Publicado: (2022)
por: Richter, Julius, et al.
Publicado: (2022)
TSELM: Target Speaker Extraction using Discrete Tokens and Language Models
por: Tang, Beilong, et al.
Publicado: (2024)
por: Tang, Beilong, et al.
Publicado: (2024)
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
por: Sarkar, Eklavya, et al.
Publicado: (2024)
por: Sarkar, Eklavya, et al.
Publicado: (2024)
WorldSpeech: A Multilingual Speech Corpus from Around the World
por: Asonitis, Antonis, et al.
Publicado: (2026)
por: Asonitis, Antonis, et al.
Publicado: (2026)
Posterior Transition Modeling for Unsupervised Diffusion-Based Speech Enhancement
por: Sadeghi, Mostafa, et al.
Publicado: (2025)
por: Sadeghi, Mostafa, et al.
Publicado: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Token-Based Audio Inpainting via Discrete Diffusion
por: Dror, Tali, et al.
Publicado: (2025)
por: Dror, Tali, et al.
Publicado: (2025)
Ejemplares similares
-
Multi-bit Audio Watermarking
por: Lanzendörfer, Luca A., et al.
Publicado: (2025) -
Parametric Neural Amp Modeling with Active Learning
por: Grötschla, Florian, et al.
Publicado: (2025) -
SNAC: Multi-Scale Neural Audio Codec
por: Siuzdak, Hubert, et al.
Publicado: (2024) -
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024) -
Autoregressive Speech Enhancement via Acoustic Tokens
por: Della Libera, Luca, et al.
Publicado: (2025)