A Dual-Branch Parallel Network for Speech Enhancement and Restoration
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Da-Hee, Kim, Dail, Chang, Joon-Hyuk, Choi, Jeonghwan, Moon, Han-gil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
di: Yang, Da-Hee, et al.
Pubblicazione: (2026)
di: Yang, Da-Hee, et al.
Pubblicazione: (2026)
FLOWER: Flow-Based Estimated Gaussian Guidance for General Speech Restoration
di: Yang, Da-Hee, et al.
Pubblicazione: (2025)
di: Yang, Da-Hee, et al.
Pubblicazione: (2025)
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
di: Lim, DongHoon, et al.
Pubblicazione: (2025)
di: Lim, DongHoon, et al.
Pubblicazione: (2025)
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement
di: Zheng, Tao, et al.
Pubblicazione: (2024)
di: Zheng, Tao, et al.
Pubblicazione: (2024)
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
WaveLLDM: Design and Development of a Lightweight Latent Diffusion Model for Speech Enhancement and Restoration
di: Santoso, Kevin Putra, et al.
Pubblicazione: (2025)
di: Santoso, Kevin Putra, et al.
Pubblicazione: (2025)
An Investigation of Incorporating Mamba for Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2024)
di: Chao, Rong, et al.
Pubblicazione: (2024)
Active Speech Enhancement: Active Speech Denoising Decliping and Deveraberation
di: Yaish, Ofir, et al.
Pubblicazione: (2025)
di: Yaish, Ofir, et al.
Pubblicazione: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network
di: Rong, Xiaobin, et al.
Pubblicazione: (2025)
di: Rong, Xiaobin, et al.
Pubblicazione: (2025)
Whisfusion: Parallel ASR Decoding via a Diffusion Transformer
di: Kwon, Taeyoun, et al.
Pubblicazione: (2025)
di: Kwon, Taeyoun, et al.
Pubblicazione: (2025)
Magnitude-Phase Dual-Path Speech Enhancement Network based on Self-Supervised Embedding and Perceptual Contrast Stretch Boosting
di: Mattursun, Alimjan, et al.
Pubblicazione: (2025)
di: Mattursun, Alimjan, et al.
Pubblicazione: (2025)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
Visual-Informed Speech Enhancement Using Attention-Based Beamforming
di: Liu, Chihyun, et al.
Pubblicazione: (2026)
di: Liu, Chihyun, et al.
Pubblicazione: (2026)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2024)
BSS-CFFMA: Cross-Domain Feature Fusion and Multi-Attention Speech Enhancement Network based on Self-Supervised Embedding
di: Mattursun, Alimjan, et al.
Pubblicazione: (2024)
di: Mattursun, Alimjan, et al.
Pubblicazione: (2024)
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
di: Wen, Bin, et al.
Pubblicazione: (2025)
di: Wen, Bin, et al.
Pubblicazione: (2025)
SEED: Speaker Embedding Enhancement Diffusion Model
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Text-To-Speech Synthesis In The Wild
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
Real-Time Speech Enhancement via a Hybrid ViT: A Dual-Input Acoustic-Image Feature Fusion
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
di: Bahmei, Behnaz, et al.
Pubblicazione: (2025)
Team HYU ASML ROBOVOX SP Cup 2024 System Description
di: Choi, Jeong-Hwan, et al.
Pubblicazione: (2024)
di: Choi, Jeong-Hwan, et al.
Pubblicazione: (2024)
Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition
di: Tzeng, Jing-Tong, et al.
Pubblicazione: (2025)
di: Tzeng, Jing-Tong, et al.
Pubblicazione: (2025)
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
di: Guo, Chengling, et al.
Pubblicazione: (2026)
di: Guo, Chengling, et al.
Pubblicazione: (2026)
ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis
di: Choi, Youngwon, et al.
Pubblicazione: (2026)
di: Choi, Youngwon, et al.
Pubblicazione: (2026)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2024)
di: Wang, Junyu, et al.
Pubblicazione: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
di: Klement, Dominik, et al.
Pubblicazione: (2025)
di: Klement, Dominik, et al.
Pubblicazione: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
di: Han, Wooseok, et al.
Pubblicazione: (2024)
di: Han, Wooseok, et al.
Pubblicazione: (2024)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Shao, Nian, et al.
Pubblicazione: (2025)
di: Shao, Nian, et al.
Pubblicazione: (2025)
Layer-aware TDNN: Speaker Recognition Using Multi-Layer Features from Pre-Trained Models
di: Kim, Jin Sob, et al.
Pubblicazione: (2024)
di: Kim, Jin Sob, et al.
Pubblicazione: (2024)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
di: Li, Bohan, et al.
Pubblicazione: (2026)
di: Li, Bohan, et al.
Pubblicazione: (2026)
Bilingual Dual-Head Deep Model for Parkinson's Disease Detection from Speech
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
CaSNet: Compress-and-Send Network Based Multi-Device Speech Enhancement Model for Distributed Microphone Arrays
di: Jiang, Chengqian, et al.
Pubblicazione: (2026)
di: Jiang, Chengqian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
di: Yang, Da-Hee, et al.
Pubblicazione: (2026) -
FLOWER: Flow-Based Estimated Gaussian Guidance for General Speech Restoration
di: Yang, Da-Hee, et al.
Pubblicazione: (2025) -
Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion
di: Lim, DongHoon, et al.
Pubblicazione: (2025) -
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
di: Park, Hyun Joon, et al.
Pubblicazione: (2024) -
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement
di: Zheng, Tao, et al.
Pubblicazione: (2024)