Investigation of Speech and Noise Latent Representations in Single-channel VAE-based Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiatong, Doclo, Simon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement
par: Li, Jiatong, et autres
Publié: (2025)
par: Li, Jiatong, et autres
Publié: (2025)
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
par: Niu, Zhikang, et autres
Publié: (2025)
par: Niu, Zhikang, et autres
Publié: (2025)
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
par: Li, Jiatong, et autres
Publié: (2026)
par: Li, Jiatong, et autres
Publié: (2026)
Comparison of Knowledge Distillation Methods for Low-complexity Multi-microphone Speech Enhancement using the FT-JNF Architecture
par: Metzger, Robert, et autres
Publié: (2025)
par: Metzger, Robert, et autres
Publié: (2025)
Binaural Localization Model for Speech in Noise
par: Tokala, Vikas, et autres
Publié: (2025)
par: Tokala, Vikas, et autres
Publié: (2025)
Binaural Speech Enhancement Using Deep Complex Convolutional Transformer Networks
par: Tokala, Vikas, et autres
Publié: (2024)
par: Tokala, Vikas, et autres
Publié: (2024)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
par: Tokala, Vikas, et autres
Publié: (2025)
par: Tokala, Vikas, et autres
Publié: (2025)
Speech-dependent Data Augmentation for Own Voice Reconstruction with Hearable Microphones in Noisy Environments
par: Ohlenbusch, Mattes, et autres
Publié: (2024)
par: Ohlenbusch, Mattes, et autres
Publié: (2024)
Closed-Form Successive Relative Transfer Function Vector Estimation based on Blind Oblique Projection Incorporating Noise Whitening
par: Gode, Henri, et autres
Publié: (2025)
par: Gode, Henri, et autres
Publié: (2025)
Modeling of Speech-dependent Own Voice Transfer Characteristics for Hearables with In-ear Microphones
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
Speech-dependent Modeling of Own Voice Transfer Characteristics for In-ear Microphones in Hearables
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs
par: Behringer, Lyonel, et autres
Publié: (2026)
par: Behringer, Lyonel, et autres
Publié: (2026)
Leveraging Discriminative Latent Representations for Conditioning GAN-Based Speech Enhancement
par: Shetu, Shrishti Saha, et autres
Publié: (2025)
par: Shetu, Shrishti Saha, et autres
Publié: (2025)
Multi-Microphone Noise Data Augmentation for DNN-based Own Voice Reconstruction for Hearables in Noisy Environments
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
par: Ohlenbusch, Mattes, et autres
Publié: (2023)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
par: Jukić, Ante, et autres
Publié: (2024)
par: Jukić, Ante, et autres
Publié: (2024)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
par: Zhang, Shiqi, et autres
Publié: (2024)
par: Zhang, Shiqi, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
par: Wang, Siyi, et autres
Publié: (2024)
par: Wang, Siyi, et autres
Publié: (2024)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study
par: Brueggeman, Avamarie, et autres
Publié: (2023)
par: Brueggeman, Avamarie, et autres
Publié: (2023)
Head Orientation Estimation with Distributed Microphones Using Speech Radiation Patterns
par: Müller, Kaspar, et autres
Publié: (2023)
par: Müller, Kaspar, et autres
Publié: (2023)
Investigating Training Objectives for Generative Speech Enhancement
par: Richter, Julius, et autres
Publié: (2024)
par: Richter, Julius, et autres
Publié: (2024)
Exploring Length Generalization For Transformer-based Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2025)
par: Zhang, Qiquan, et autres
Publié: (2025)
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
par: Wang, Tingting, et autres
Publié: (2025)
par: Wang, Tingting, et autres
Publié: (2025)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
par: Geng, Haopeng, et autres
Publié: (2024)
par: Geng, Haopeng, et autres
Publié: (2024)
Influence of Clean Speech Characteristics on Speech Enhancement Performance
par: Hou, Mingchi, et autres
Publié: (2025)
par: Hou, Mingchi, et autres
Publié: (2025)
Coherence-Based Frequency Subset Selection For Binaural RTF-Vector-Based Direction of Arrival Estimation for Multiple Speakers
par: Fejgin, Daniel, et autres
Publié: (2022)
par: Fejgin, Daniel, et autres
Publié: (2022)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
par: de Groot, Dimme, et autres
Publié: (2026)
par: de Groot, Dimme, et autres
Publié: (2026)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024)
par: Wang, Shih-heng, et autres
Publié: (2024)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
par: Ho, Chun-Wei, et autres
Publié: (2025)
par: Ho, Chun-Wei, et autres
Publié: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
par: Halimeh, Mhd Modar, et autres
Publié: (2025)
par: Halimeh, Mhd Modar, et autres
Publié: (2025)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
par: Bokaei, Mohammad, et autres
Publié: (2024)
par: Bokaei, Mohammad, et autres
Publié: (2024)
SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space
par: Rodriguez, Armani, et autres
Publié: (2024)
par: Rodriguez, Armani, et autres
Publié: (2024)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
par: Wen, Wen, et autres
Publié: (2024)
par: Wen, Wen, et autres
Publié: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
par: Li, Hanzhao, et autres
Publié: (2024)
par: Li, Hanzhao, et autres
Publié: (2024)
Spatially Selective Active Noise Control for Open-fitting Hearables with Acausal Optimization
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
Documents similaires
-
I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement
par: Li, Jiatong, et autres
Publié: (2025) -
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
par: Niu, Zhikang, et autres
Publié: (2025) -
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
par: Li, Jiatong, et autres
Publié: (2026) -
Comparison of Knowledge Distillation Methods for Low-complexity Multi-microphone Speech Enhancement using the FT-JNF Architecture
par: Metzger, Robert, et autres
Publié: (2025) -
Binaural Localization Model for Speech in Noise
par: Tokala, Vikas, et autres
Publié: (2025)