Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Li, Seki, Shogo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026)
Audio Spotforming Using Nonnegative Tensor Factorization with Attractor-Based Regularization
di: Ayano, Shoma, et al.
Pubblicazione: (2024)
di: Ayano, Shoma, et al.
Pubblicazione: (2024)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
di: Li, Jizhen, et al.
Pubblicazione: (2025)
di: Li, Jizhen, et al.
Pubblicazione: (2025)
Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio
di: Ma, Yi, et al.
Pubblicazione: (2024)
di: Ma, Yi, et al.
Pubblicazione: (2024)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
di: Wen, Wen, et al.
Pubblicazione: (2024)
di: Wen, Wen, et al.
Pubblicazione: (2024)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
BERP: A Blind Estimator of Room Parameters for Single-Channel Noisy Speech Signals
di: Wang, Lijun, et al.
Pubblicazione: (2024)
di: Wang, Lijun, et al.
Pubblicazione: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
di: Hirano, Masato, et al.
Pubblicazione: (2023)
di: Hirano, Masato, et al.
Pubblicazione: (2023)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
di: Wang, Siyi, et al.
Pubblicazione: (2024)
di: Wang, Siyi, et al.
Pubblicazione: (2024)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
di: Wang, Wei, et al.
Pubblicazione: (2025)
di: Wang, Wei, et al.
Pubblicazione: (2025)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
di: Tran, Minh, et al.
Pubblicazione: (2025)
di: Tran, Minh, et al.
Pubblicazione: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Less is More: Data Curation Matters in Scaling Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2025)
di: Li, Chenda, et al.
Pubblicazione: (2025)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
di: Ochiai, Tsubasa, et al.
Pubblicazione: (2024)
di: Ochiai, Tsubasa, et al.
Pubblicazione: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
Decoupled Spatial and Temporal Processing for Resource Efficient Multichannel Speech Enhancement
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement
di: Zhang, Yuewei, et al.
Pubblicazione: (2024)
di: Zhang, Yuewei, et al.
Pubblicazione: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
di: Seki, Kentaro, et al.
Pubblicazione: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
di: Li, Yi, et al.
Pubblicazione: (2024)
di: Li, Yi, et al.
Pubblicazione: (2024)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
Synthetic Speech Classification: IEEE Signal Processing Cup 2022 challenge
di: Rahmun, Mahieyin, et al.
Pubblicazione: (2024)
di: Rahmun, Mahieyin, et al.
Pubblicazione: (2024)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
di: Yuan, Xihao, et al.
Pubblicazione: (2025)
di: Yuan, Xihao, et al.
Pubblicazione: (2025)
ICASSP 2026 URGENT Speech Enhancement Challenge
di: Li, Chenda, et al.
Pubblicazione: (2026)
di: Li, Chenda, et al.
Pubblicazione: (2026)
Suppressing Noise Disparity in Training Data for Automatic Pathological Speech Detection
di: Amiri, Mahdi, et al.
Pubblicazione: (2024)
di: Amiri, Mahdi, et al.
Pubblicazione: (2024)
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
di: Luo, Longjie, et al.
Pubblicazione: (2025)
di: Luo, Longjie, et al.
Pubblicazione: (2025)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
di: Lin, Zizhen, et al.
Pubblicazione: (2024)
di: Lin, Zizhen, et al.
Pubblicazione: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
di: Chen, Yanan, et al.
Pubblicazione: (2024)
di: Chen, Yanan, et al.
Pubblicazione: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
di: Zhang, Leying, et al.
Pubblicazione: (2024)
di: Zhang, Leying, et al.
Pubblicazione: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)
di: Li, Chenda, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2026) -
Audio Spotforming Using Nonnegative Tensor Factorization with Attractor-Based Regularization
di: Ayano, Shoma, et al.
Pubblicazione: (2024) -
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
di: Li, Jizhen, et al.
Pubblicazione: (2025) -
Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio
di: Ma, Yi, et al.
Pubblicazione: (2024) -
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)