High-Resolution Speech Restoration with Latent Diffusion Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Dhyani, Tushar, Lux, Florian, Mancusi, Michele, Fabbro, Giorgio, Hohl, Fritz, Vu, Ngoc Thang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Controlling Emotion in Text-to-Speech with Natural Language Prompts
por: Bott, Thomas, et al.
Publicado: (2024)
por: Bott, Thomas, et al.
Publicado: (2024)
Probing the Feasibility of Multilingual Speaker Anonymization
por: Meyer, Sarina, et al.
Publicado: (2024)
por: Meyer, Sarina, et al.
Publicado: (2024)
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
por: Koo, Junghyun, et al.
Publicado: (2025)
por: Koo, Junghyun, et al.
Publicado: (2025)
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
por: Denisov, Pavel, et al.
Publicado: (2024)
por: Denisov, Pavel, et al.
Publicado: (2024)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
por: Mancusi, Michele, et al.
Publicado: (2024)
por: Mancusi, Michele, et al.
Publicado: (2024)
COCOLA: Coherence-Oriented Contrastive Learning of Musical Audio Representations
por: Ciranni, Ruben, et al.
Publicado: (2024)
por: Ciranni, Ruben, et al.
Publicado: (2024)
WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration
por: Santoso, Kevin Putra, et al.
Publicado: (2025)
por: Santoso, Kevin Putra, et al.
Publicado: (2025)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Multi-Source Diffusion Models for Simultaneous Music Generation and Separation
por: Mariani, Giorgio, et al.
Publicado: (2023)
por: Mariani, Giorgio, et al.
Publicado: (2023)
STAGE: Stemmed Accompaniment Generation through Prefix-Based Conditioning
por: Strano, Giorgio, et al.
Publicado: (2025)
por: Strano, Giorgio, et al.
Publicado: (2025)
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses
por: Li, Chia-Yu, et al.
Publicado: (2024)
por: Li, Chia-Yu, et al.
Publicado: (2024)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
por: Lux, Florian, et al.
Publicado: (2024)
por: Lux, Florian, et al.
Publicado: (2024)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
por: Zhao, Junchuan, et al.
Publicado: (2026)
por: Zhao, Junchuan, et al.
Publicado: (2026)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
por: Chen, Xueyuan, et al.
Publicado: (2025)
por: Chen, Xueyuan, et al.
Publicado: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
por: Guimarães, Heitor R., et al.
Publicado: (2025)
por: Guimarães, Heitor R., et al.
Publicado: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
por: Xin, Detai, et al.
Publicado: (2026)
por: Xin, Detai, et al.
Publicado: (2026)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
por: Cerovaz, Luca, et al.
Publicado: (2026)
por: Cerovaz, Luca, et al.
Publicado: (2026)
Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis
por: Mayer, Paul, et al.
Publicado: (2025)
por: Mayer, Paul, et al.
Publicado: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
por: Cao, Tianyu, et al.
Publicado: (2026)
por: Cao, Tianyu, et al.
Publicado: (2026)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
por: Lee, Yongjoon, et al.
Publicado: (2024)
por: Lee, Yongjoon, et al.
Publicado: (2024)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
por: Byun, Kyungguen, et al.
Publicado: (2025)
por: Byun, Kyungguen, et al.
Publicado: (2025)
Generating Moving 3D Soundscapes with Latent Diffusion Models
por: Templin, Christian, et al.
Publicado: (2025)
por: Templin, Christian, et al.
Publicado: (2025)
Apollo: Band-sequence Modeling for High-Quality Audio Restoration
por: Li, Kai, et al.
Publicado: (2024)
por: Li, Kai, et al.
Publicado: (2024)
STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
por: Yuan, Jiajun, et al.
Publicado: (2025)
por: Yuan, Jiajun, et al.
Publicado: (2025)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
por: Yu, Chin-Yun, et al.
Publicado: (2022)
por: Yu, Chin-Yun, et al.
Publicado: (2022)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
por: Kirdey, Stanislav
Publicado: (2025)
por: Kirdey, Stanislav
Publicado: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
por: wu, Weihao, et al.
Publicado: (2025)
por: wu, Weihao, et al.
Publicado: (2025)
A High-Fidelity Speech Super Resolution Network using a Complex Global Attention Module with Spectro-Temporal Loss
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
por: Tamiti, Tarikul Islam, et al.
Publicado: (2025)
Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models
por: Nistal, Javier, et al.
Publicado: (2024)
por: Nistal, Javier, et al.
Publicado: (2024)
Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
por: Chen, Jingyi, et al.
Publicado: (2025)
por: Chen, Jingyi, et al.
Publicado: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
DeepFense: A Unified, Modular, and Extensible Framework for Robust Deepfake Audio Detection
por: Kheir, Yassine El, et al.
Publicado: (2026)
por: Kheir, Yassine El, et al.
Publicado: (2026)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
por: Kameoka, Hirokazu, et al.
Publicado: (2025)
The CCF AATC 2025 Speech Restoration Challenge: A Retrospective
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
por: Li, Yingahao Aaron, et al.
Publicado: (2024)
A Comprehensive Survey with Critical Analysis for Deepfake Speech Detection
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
Ejemplares similares
-
Controlling Emotion in Text-to-Speech with Natural Language Prompts
por: Bott, Thomas, et al.
Publicado: (2024) -
Probing the Feasibility of Multilingual Speaker Anonymization
por: Meyer, Sarina, et al.
Publicado: (2024) -
ITO-Master: Inference-Time Optimization for Audio Effects Modeling of Music Mastering Processors
por: Koo, Junghyun, et al.
Publicado: (2025) -
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
por: Denisov, Pavel, et al.
Publicado: (2024) -
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
por: Mancusi, Michele, et al.
Publicado: (2024)