Investigation of Speech and Noise Latent Representations in Single-channel VAE-based Speech Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jiatong, Doclo, Simon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement
por: Li, Jiatong, et al.
Publicado: (2025)
por: Li, Jiatong, et al.
Publicado: (2025)
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
por: Niu, Zhikang, et al.
Publicado: (2025)
por: Niu, Zhikang, et al.
Publicado: (2025)
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
por: Li, Jiatong, et al.
Publicado: (2026)
por: Li, Jiatong, et al.
Publicado: (2026)
Comparison of Knowledge Distillation Methods for Low-complexity Multi-microphone Speech Enhancement using the FT-JNF Architecture
por: Metzger, Robert, et al.
Publicado: (2025)
por: Metzger, Robert, et al.
Publicado: (2025)
Binaural Localization Model for Speech in Noise
por: Tokala, Vikas, et al.
Publicado: (2025)
por: Tokala, Vikas, et al.
Publicado: (2025)
Binaural Speech Enhancement Using Deep Complex Convolutional Transformer Networks
por: Tokala, Vikas, et al.
Publicado: (2024)
por: Tokala, Vikas, et al.
Publicado: (2024)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
por: Tokala, Vikas, et al.
Publicado: (2025)
por: Tokala, Vikas, et al.
Publicado: (2025)
Speech-dependent Data Augmentation for Own Voice Reconstruction with Hearable Microphones in Noisy Environments
por: Ohlenbusch, Mattes, et al.
Publicado: (2024)
por: Ohlenbusch, Mattes, et al.
Publicado: (2024)
Closed-Form Successive Relative Transfer Function Vector Estimation based on Blind Oblique Projection Incorporating Noise Whitening
por: Gode, Henri, et al.
Publicado: (2025)
por: Gode, Henri, et al.
Publicado: (2025)
Modeling of Speech-dependent Own Voice Transfer Characteristics for Hearables with In-ear Microphones
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
Speech-dependent Modeling of Own Voice Transfer Characteristics for In-ear Microphones in Hearables
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs
por: Behringer, Lyonel, et al.
Publicado: (2026)
por: Behringer, Lyonel, et al.
Publicado: (2026)
Leveraging Discriminative Latent Representations for Conditioning GAN-Based Speech Enhancement
por: Shetu, Shrishti Saha, et al.
Publicado: (2025)
por: Shetu, Shrishti Saha, et al.
Publicado: (2025)
Multi-Microphone Noise Data Augmentation for DNN-based Own Voice Reconstruction for Hearables in Noisy Environments
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
por: Ohlenbusch, Mattes, et al.
Publicado: (2023)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
por: Zhang, Shiqi, et al.
Publicado: (2024)
por: Zhang, Shiqi, et al.
Publicado: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
por: Wang, Wei, et al.
Publicado: (2025)
por: Wang, Wei, et al.
Publicado: (2025)
Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study
por: Brueggeman, Avamarie, et al.
Publicado: (2023)
por: Brueggeman, Avamarie, et al.
Publicado: (2023)
Head Orientation Estimation with Distributed Microphones Using Speech Radiation Patterns
por: Müller, Kaspar, et al.
Publicado: (2023)
por: Müller, Kaspar, et al.
Publicado: (2023)
Investigating Training Objectives for Generative Speech Enhancement
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
Exploring Length Generalization For Transformer-based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
por: Wang, Tingting, et al.
Publicado: (2025)
por: Wang, Tingting, et al.
Publicado: (2025)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
por: Geng, Haopeng, et al.
Publicado: (2024)
por: Geng, Haopeng, et al.
Publicado: (2024)
Influence of Clean Speech Characteristics on Speech Enhancement Performance
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Coherence-Based Frequency Subset Selection For Binaural RTF-Vector-Based Direction of Arrival Estimation for Multiple Speakers
por: Fejgin, Daniel, et al.
Publicado: (2022)
por: Fejgin, Daniel, et al.
Publicado: (2022)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
por: de Groot, Dimme, et al.
Publicado: (2026)
por: de Groot, Dimme, et al.
Publicado: (2026)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
por: Ho, Chun-Wei, et al.
Publicado: (2025)
por: Ho, Chun-Wei, et al.
Publicado: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
por: Han, Seungu, et al.
Publicado: (2026)
por: Han, Seungu, et al.
Publicado: (2026)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
por: Bokaei, Mohammad, et al.
Publicado: (2024)
por: Bokaei, Mohammad, et al.
Publicado: (2024)
SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
por: Tang, Yuxun, et al.
Publicado: (2024)
por: Tang, Yuxun, et al.
Publicado: (2024)
VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space
por: Rodriguez, Armani, et al.
Publicado: (2024)
por: Rodriguez, Armani, et al.
Publicado: (2024)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
por: Wen, Wen, et al.
Publicado: (2024)
por: Wen, Wen, et al.
Publicado: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
por: Li, Hanzhao, et al.
Publicado: (2024)
por: Li, Hanzhao, et al.
Publicado: (2024)
Spatially Selective Active Noise Control for Open-fitting Hearables with Acausal Optimization
por: Xiao, Tong, et al.
Publicado: (2025)
por: Xiao, Tong, et al.
Publicado: (2025)
Ejemplares similares
-
I-DCCRN-VAE: An Improved Deep Representation Learning Framework for Complex VAE-based Single-channel Speech Enhancement
por: Li, Jiatong, et al.
Publicado: (2025) -
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
por: Niu, Zhikang, et al.
Publicado: (2025) -
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
por: Li, Jiatong, et al.
Publicado: (2026) -
Comparison of Knowledge Distillation Methods for Low-complexity Multi-microphone Speech Enhancement using the FT-JNF Architecture
por: Metzger, Robert, et al.
Publicado: (2025) -
Binaural Localization Model for Speech in Noise
por: Tokala, Vikas, et al.
Publicado: (2025)