An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ho, Chun-Wei, Ku, Pin-Jui, Yen, Hao, Siniscalchi, Sabato Marco, Tsao, Yu, Lee, Chin-Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
par: Yen, Hao, et autres
Publié: (2025)
par: Yen, Hao, et autres
Publié: (2025)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
par: Yen, Hao, et autres
Publié: (2026)
par: Yen, Hao, et autres
Publié: (2026)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
par: Ho, Chun-wei, et autres
Publié: (2026)
par: Ho, Chun-wei, et autres
Publié: (2026)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
par: Khan, Muhammad Salman, et autres
Publié: (2024)
par: Khan, Muhammad Salman, et autres
Publié: (2024)
Bayesian adaptive learning to latent variables via Variational Bayes and Maximum a Posteriori
par: Hu, Hu, et autres
Publié: (2024)
par: Hu, Hu, et autres
Publié: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
par: Chao, Rong, et autres
Publié: (2024)
par: Chao, Rong, et autres
Publié: (2024)
A Knowledge-Driven Approach to Music Segmentation, Music Source Separation and Cinematic Audio Source Separation
par: Ho, Chun-wei, et autres
Publié: (2026)
par: Ho, Chun-wei, et autres
Publié: (2026)
A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models
par: Zezario, Ryandhimas E., et autres
Publié: (2024)
par: Zezario, Ryandhimas E., et autres
Publié: (2024)
Variational Bayesian Adaptive Learning of Deep Latent Variables for Acoustic Knowledge Transfer
par: Hu, Hu, et autres
Publié: (2025)
par: Hu, Hu, et autres
Publié: (2025)
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative Conditions
par: La Quatra, Moreno, et autres
Publié: (2024)
par: La Quatra, Moreno, et autres
Publié: (2024)
Feature Importance across Domains for Improving Non-Intrusive Speech Intelligibility Prediction in Hearing Aids
par: Zezario, Ryandhimas E., et autres
Publié: (2025)
par: Zezario, Ryandhimas E., et autres
Publié: (2025)
Towards Robust Assessment of Pathological Voices via Combined Low-Level Descriptors and Foundation Model Representations
par: Ariyanti, Whenty, et autres
Publié: (2025)
par: Ariyanti, Whenty, et autres
Publié: (2025)
Bilingual Dual-Head Deep Model for Parkinson's Disease Detection from Speech
par: La Quatra, Moreno, et autres
Publié: (2025)
par: La Quatra, Moreno, et autres
Publié: (2025)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
par: Zezario, Ryandhimas E., et autres
Publié: (2026)
par: Zezario, Ryandhimas E., et autres
Publié: (2026)
Exploring Generative Error Correction for Dysarthric Speech Recognition
par: La Quatra, Moreno, et autres
Publié: (2025)
par: La Quatra, Moreno, et autres
Publié: (2025)
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
FlanEC: Exploring Flan-T5 for Post-ASR Error Correction
par: La Quatra, Moreno, et autres
Publié: (2025)
par: La Quatra, Moreno, et autres
Publié: (2025)
Hallucination Benchmark for Speech Foundation Models
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)
par: Gao, Ming, et autres
Publié: (2025)
Aligning Generative Speech Enhancement with Perceptual Feedback
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
voc2vec: A Foundation Model for Non-Verbal Vocalization
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
par: Ku, Pin-Jui, et autres
Publié: (2025)
par: Ku, Pin-Jui, et autres
Publié: (2025)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
Benchmarking Representations for Speech, Music, and Acoustic Events
par: La Quatra, Moreno, et autres
Publié: (2024)
par: La Quatra, Moreno, et autres
Publié: (2024)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
par: Wu, Ya-Tse, et autres
Publié: (2026)
par: Wu, Ya-Tse, et autres
Publié: (2026)
From Evaluation to Optimization: Neural Speech Assessment for Downstream Applications
par: Tsao, Yu
Publié: (2025)
par: Tsao, Yu
Publié: (2025)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework
par: Yang, Hsiang-Cheng, et autres
Publié: (2026)
par: Yang, Hsiang-Cheng, et autres
Publié: (2026)
A Variance-Preserving Interpolation Approach for Diffusion Models with Applications to Single Channel Speech Enhancement and Recognition
par: Guo, Zilu, et autres
Publié: (2024)
par: Guo, Zilu, et autres
Publié: (2024)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023)
par: Lu, Ye-Xin, et autres
Publié: (2023)
ZSDEVC: Zero-Shot Diffusion-based Emotional Voice Conversion with Disentangled Mechanism
par: Chou, Hsing-Hang, et autres
Publié: (2024)
par: Chou, Hsing-Hang, et autres
Publié: (2024)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
par: Nishigori, Shuichiro, et autres
Publié: (2025)
par: Nishigori, Shuichiro, et autres
Publié: (2025)
Investigation of Speech and Noise Latent Representations in Single-channel VAE-based Speech Enhancement
par: Li, Jiatong, et autres
Publié: (2025)
par: Li, Jiatong, et autres
Publié: (2025)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
par: Fu, Szu-Wei, et autres
Publié: (2024)
par: Fu, Szu-Wei, et autres
Publié: (2024)
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Investigating Training Objectives for Generative Speech Enhancement
par: Richter, Julius, et autres
Publié: (2024)
par: Richter, Julius, et autres
Publié: (2024)
Documents similaires
-
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
par: Ku, Pin-Jui, et autres
Publié: (2024) -
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
par: Yen, Hao, et autres
Publié: (2025) -
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
par: Yen, Hao, et autres
Publié: (2024) -
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
par: Yen, Hao, et autres
Publié: (2026) -
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
par: Ho, Chun-wei, et autres
Publié: (2026)