Magnitude-Phase Dual-Path Speech Enhancement Network based on Self-Supervised Embedding and Perceptual Contrast Stretch Boosting
Fuente:
arXiv
Guardado en:
| Autores principales: | Mattursun, Alimjan, Wang, Liejun, Yu, Yinfeng, Ma, Chunyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BSS-CFFMA: Cross-Domain Feature Fusion and Multi-Attention Speech Enhancement Network based on Self-Supervised Embedding
por: Mattursun, Alimjan, et al.
Publicado: (2024)
por: Mattursun, Alimjan, et al.
Publicado: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
por: Zhao, Ya, et al.
Publicado: (2026)
por: Zhao, Ya, et al.
Publicado: (2026)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
por: Khan, Muhammad Salman, et al.
Publicado: (2024)
por: Khan, Muhammad Salman, et al.
Publicado: (2024)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
por: Wang, Xincheng, et al.
Publicado: (2024)
por: Wang, Xincheng, et al.
Publicado: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)
por: Cao, Yubing, et al.
Publicado: (2025)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
por: Jiao, Xinxin, et al.
Publicado: (2024)
por: Jiao, Xinxin, et al.
Publicado: (2024)
Hallucination in Perceptual Metric-Driven Speech Enhancement Networks
por: Close, George, et al.
Publicado: (2024)
por: Close, George, et al.
Publicado: (2024)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
por: Lu, Ye-Xin, et al.
Publicado: (2023)
por: Lu, Ye-Xin, et al.
Publicado: (2023)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
por: Wang, Kexue, et al.
Publicado: (2026)
por: Wang, Kexue, et al.
Publicado: (2026)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
por: Ragano, Alessandro, et al.
Publicado: (2023)
por: Ragano, Alessandro, et al.
Publicado: (2023)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
por: Wang, Haoxu, et al.
Publicado: (2025)
por: Wang, Haoxu, et al.
Publicado: (2025)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
por: Zhu, Tao, et al.
Publicado: (2025)
por: Zhu, Tao, et al.
Publicado: (2025)
Leveraging Label Potential for Enhanced Multimodal Emotion Recognition
por: Shao, Xuechun, et al.
Publicado: (2025)
por: Shao, Xuechun, et al.
Publicado: (2025)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
por: Serre, Thomas, et al.
Publicado: (2026)
por: Serre, Thomas, et al.
Publicado: (2026)
Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
por: Wang, Jiahe, et al.
Publicado: (2025)
por: Wang, Jiahe, et al.
Publicado: (2025)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
por: Zhao, Shengkui, et al.
Publicado: (2022)
por: Zhao, Shengkui, et al.
Publicado: (2022)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
por: Sato, Hiroshi, et al.
Publicado: (2025)
por: Sato, Hiroshi, et al.
Publicado: (2025)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
por: Chung, Raymond
Publicado: (2026)
por: Chung, Raymond
Publicado: (2026)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
por: Akaishi, Natsuki, et al.
Publicado: (2026)
por: Akaishi, Natsuki, et al.
Publicado: (2026)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement
por: Zheng, Tao, et al.
Publicado: (2024)
por: Zheng, Tao, et al.
Publicado: (2024)
AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup
por: Carvalho, Carlos, et al.
Publicado: (2024)
por: Carvalho, Carlos, et al.
Publicado: (2024)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023)
por: Zhu, Xinfa, et al.
Publicado: (2023)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
por: Tsunoo, Emiru, et al.
Publicado: (2024)
por: Tsunoo, Emiru, et al.
Publicado: (2024)
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
por: Zhu, Tianheng, et al.
Publicado: (2025)
por: Zhu, Tianheng, et al.
Publicado: (2025)
Phase-Retrieval-Based Physics-Informed Neural Networks For Acoustic Magnitude Field Reconstruction
por: Schrader, Karl, et al.
Publicado: (2026)
por: Schrader, Karl, et al.
Publicado: (2026)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
por: Wang, Wei, et al.
Publicado: (2025)
por: Wang, Wei, et al.
Publicado: (2025)
Speech Synthesis along Perceptual Voice Quality Dimensions
por: Rautenberg, Frederik, et al.
Publicado: (2025)
por: Rautenberg, Frederik, et al.
Publicado: (2025)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
por: Sun, Xingwei, et al.
Publicado: (2025)
por: Sun, Xingwei, et al.
Publicado: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2024)
por: Yan, Haoyin, et al.
Publicado: (2024)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
por: Zhang, Shiqi, et al.
Publicado: (2024)
por: Zhang, Shiqi, et al.
Publicado: (2024)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
Ejemplares similares
-
BSS-CFFMA: Cross-Domain Feature Fusion and Multi-Attention Speech Enhancement Network based on Self-Supervised Embedding
por: Mattursun, Alimjan, et al.
Publicado: (2024) -
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
por: Zhao, Ya, et al.
Publicado: (2026) -
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
por: Khan, Muhammad Salman, et al.
Publicado: (2024) -
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
por: Wang, Xincheng, et al.
Publicado: (2024) -
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
por: Cao, Yubing, et al.
Publicado: (2025)