DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guimarães, Heitor R., Su, Jiaqi, Kumar, Rithesh, Falk, Tiago H., Jin, Zeyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
par: Li, Yingahao Aaron, et autres
Publié: (2024)
par: Li, Yingahao Aaron, et autres
Publié: (2024)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
par: Lin, Jackie, et autres
Publié: (2026)
par: Lin, Jackie, et autres
Publié: (2026)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
par: Guimarães, Heitor R., et autres
Publié: (2024)
par: Guimarães, Heitor R., et autres
Publié: (2024)
PromptSep: Generative Audio Separation via Multimodal Prompting
par: Wen, Yutong, et autres
Publié: (2025)
par: Wen, Yutong, et autres
Publié: (2025)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
par: Cao, Tianyu, et autres
Publié: (2026)
par: Cao, Tianyu, et autres
Publié: (2026)
BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications
par: Guimarães, Heitor R., et autres
Publié: (2026)
par: Guimarães, Heitor R., et autres
Publié: (2026)
AUDDT: Audio Unified Deepfake Detection Benchmark Toolkit
par: Zhu, Yi, et autres
Publié: (2025)
par: Zhu, Yi, et autres
Publié: (2025)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
par: O'Reilly, Patrick, et autres
Publié: (2025)
par: O'Reilly, Patrick, et autres
Publié: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
UrBAN: Urban Beehive Acoustics and PheNotyping Dataset
par: Abdollahi, Mahsa, et autres
Publié: (2024)
par: Abdollahi, Mahsa, et autres
Publié: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
par: Song, Tianyu, et autres
Publié: (2025)
par: Song, Tianyu, et autres
Publié: (2025)
Absorbing Discrete Diffusion for Speech Enhancement
par: Gonzalez, Philippe
Publié: (2026)
par: Gonzalez, Philippe
Publié: (2026)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
par: Li, Chenda, et autres
Publié: (2024)
par: Li, Chenda, et autres
Publié: (2024)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
par: Yang, Da-Hee, et autres
Publié: (2026)
par: Yang, Da-Hee, et autres
Publié: (2026)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
par: Yang, Yudong, et autres
Publié: (2024)
par: Yang, Yudong, et autres
Publié: (2024)
STSR: High-Fidelity Speech Super-Resolution via Spectral-Transient Context Modeling
par: Yuan, Jiajun, et autres
Publié: (2025)
par: Yuan, Jiajun, et autres
Publié: (2025)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
par: Hirano, Masato, et autres
Publié: (2023)
par: Hirano, Masato, et autres
Publié: (2023)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
par: Xue, Ke, et autres
Publié: (2026)
par: Xue, Ke, et autres
Publié: (2026)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
par: Zhao, Haixin, et autres
Publié: (2025)
par: Zhao, Haixin, et autres
Publié: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
par: Li, Yi, et autres
Publié: (2024)
par: Li, Yi, et autres
Publié: (2024)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
Investigating Training Objectives for Generative Speech Enhancement
par: Richter, Julius, et autres
Publié: (2024)
par: Richter, Julius, et autres
Publié: (2024)
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026)
par: Asai, Kohei, et autres
Publié: (2026)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
par: Sun, Xingwei, et autres
Publié: (2025)
par: Sun, Xingwei, et autres
Publié: (2025)
Code Drift: Towards Idempotent Neural Audio Codecs
par: O'Reilly, Patrick, et autres
Publié: (2024)
par: O'Reilly, Patrick, et autres
Publié: (2024)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
par: Zeng, Bang, et autres
Publié: (2024)
par: Zeng, Bang, et autres
Publié: (2024)
Diffusion Buffer for Online Generative Speech Enhancement
par: Lay, Bunlong, et autres
Publié: (2025)
par: Lay, Bunlong, et autres
Publié: (2025)
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Documents similaires
-
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
par: Li, Yingahao Aaron, et autres
Publié: (2024) -
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
par: Lin, Jackie, et autres
Publié: (2026) -
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026) -
An Efficient End-to-End Approach to Noise Invariant Speech Features via Multi-Task Learning
par: Guimarães, Heitor R., et autres
Publié: (2024) -
PromptSep: Generative Audio Separation via Multimodal Prompting
par: Wen, Yutong, et autres
Publié: (2025)