Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Hao, Lu, Xugang, Shimada, Kazuki, Kawahara, Tatsuya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
di: Shi, Hao, et al.
Pubblicazione: (2023)
di: Shi, Hao, et al.
Pubblicazione: (2023)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025)
di: Gao, Yuan, et al.
Pubblicazione: (2025)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Zero- and Few-shot Sound Event Localization and Detection
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
Universal Score-based Speech Enhancement with High Content Preservation
di: Scheibler, Robin, et al.
Pubblicazione: (2024)
di: Scheibler, Robin, et al.
Pubblicazione: (2024)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
di: Xue, Ke, et al.
Pubblicazione: (2026)
di: Xue, Ke, et al.
Pubblicazione: (2026)
Absorbing Discrete Diffusion for Speech Enhancement
di: Gonzalez, Philippe
Pubblicazione: (2026)
di: Gonzalez, Philippe
Pubblicazione: (2026)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge
di: Goswami, Nabarun, et al.
Pubblicazione: (2025)
di: Goswami, Nabarun, et al.
Pubblicazione: (2025)
Integrated Multi-Level Knowledge Distillation for Enhanced Speaker Verification
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Retrieval-Augmented Speech Recognition Approach for Domain Challenges
di: Shen, Peng, et al.
Pubblicazione: (2025)
di: Shen, Peng, et al.
Pubblicazione: (2025)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
di: Hirano, Masato, et al.
Pubblicazione: (2023)
di: Hirano, Masato, et al.
Pubblicazione: (2023)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
di: Richter, Julius, et al.
Pubblicazione: (2025)
di: Richter, Julius, et al.
Pubblicazione: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
di: Li, Yi, et al.
Pubblicazione: (2024)
di: Li, Yi, et al.
Pubblicazione: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
Diffusion-Based Speech Enhancement in Matched and Mismatched Conditions Using a Heun-Based Sampler
di: Gonzalez, Philippe, et al.
Pubblicazione: (2023)
di: Gonzalez, Philippe, et al.
Pubblicazione: (2023)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
di: Wen, Wen, et al.
Pubblicazione: (2024)
di: Wen, Wen, et al.
Pubblicazione: (2024)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
di: Wang, Siyi, et al.
Pubblicazione: (2024)
di: Wang, Siyi, et al.
Pubblicazione: (2024)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)
di: Li, Chenda, et al.
Pubblicazione: (2024)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture
di: Richter, Julius, et al.
Pubblicazione: (2025)
di: Richter, Julius, et al.
Pubblicazione: (2025)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
di: Cui, Zhongjian, et al.
Pubblicazione: (2025)
di: Cui, Zhongjian, et al.
Pubblicazione: (2025)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
Toward Universal Speech Enhancement for Diverse Input Conditions
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
di: Khanagha, Sina, et al.
Pubblicazione: (2026)
di: Khanagha, Sina, et al.
Pubblicazione: (2026)
Adaptive Convolution for CNN-based Speech Enhancement Models
di: Wang, Dahan, et al.
Pubblicazione: (2025)
di: Wang, Dahan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders
di: Shi, Hao, et al.
Pubblicazione: (2023) -
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
di: Gao, Yuan, et al.
Pubblicazione: (2025) -
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024) -
Exploration of Adapter for Noise Robust Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024) -
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)