Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Seungu, Lee, Sungho, Lee, Kyogu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
por: Han, Seungu, et al.
Publicado: (2025)
por: Han, Seungu, et al.
Publicado: (2025)
Differentiable Acoustic Radiance Transfer
por: Lee, Sungho, et al.
Publicado: (2025)
por: Lee, Sungho, et al.
Publicado: (2025)
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
por: Hwang, Injune, et al.
Publicado: (2024)
por: Hwang, Injune, et al.
Publicado: (2024)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)
por: Chae, Yunkee, et al.
Publicado: (2025)
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Wavespace: A Highly Explorable Wavetable Generator
por: Lee, Hazounne, et al.
Publicado: (2024)
por: Lee, Hazounne, et al.
Publicado: (2024)
Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation
por: Lee, Jaejun, et al.
Publicado: (2025)
por: Lee, Jaejun, et al.
Publicado: (2025)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
por: Ochiai, Tsubasa, et al.
Publicado: (2024)
por: Ochiai, Tsubasa, et al.
Publicado: (2024)
SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces
por: Vallés-Pérez, Ivan, et al.
Publicado: (2023)
por: Vallés-Pérez, Ivan, et al.
Publicado: (2023)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
por: Ok, Seaone, et al.
Publicado: (2026)
por: Ok, Seaone, et al.
Publicado: (2026)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective
por: Liu, Alexander H., et al.
Publicado: (2024)
por: Liu, Alexander H., et al.
Publicado: (2024)
Music De-limiter Networks via Sample-wise Gain Inversion
por: Jeon, Chang-Bin, et al.
Publicado: (2023)
por: Jeon, Chang-Bin, et al.
Publicado: (2023)
GRAFX: An Open-Source Library for Audio Processing Graphs in PyTorch
por: Lee, Sungho, et al.
Publicado: (2024)
por: Lee, Sungho, et al.
Publicado: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
por: Kondo, Yuto, et al.
Publicado: (2025)
por: Kondo, Yuto, et al.
Publicado: (2025)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Do Captioning Metrics Reflect Music Semantic Alignment?
por: Lee, Jinwoo, et al.
Publicado: (2024)
por: Lee, Jinwoo, et al.
Publicado: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
por: Ku, Pin-Jui, et al.
Publicado: (2024)
por: Ku, Pin-Jui, et al.
Publicado: (2024)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
por: Zhao, Shengkui, et al.
Publicado: (2022)
por: Zhao, Shengkui, et al.
Publicado: (2022)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
por: de Groot, Dimme, et al.
Publicado: (2025)
por: de Groot, Dimme, et al.
Publicado: (2025)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
por: Lee, Jeongmin, et al.
Publicado: (2025)
por: Lee, Jeongmin, et al.
Publicado: (2025)
Absorbing Discrete Diffusion for Speech Enhancement
por: Gonzalez, Philippe
Publicado: (2026)
por: Gonzalez, Philippe
Publicado: (2026)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
por: Sutherland, Robert, et al.
Publicado: (2024)
por: Sutherland, Robert, et al.
Publicado: (2024)
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
por: Zhang, Yuewei, et al.
Publicado: (2025)
por: Zhang, Yuewei, et al.
Publicado: (2025)
Instance-Specific Test-Time Training for Speech Editing in the Wild
por: Kim, Taewoo, et al.
Publicado: (2025)
por: Kim, Taewoo, et al.
Publicado: (2025)
Reverse Engineering of Music Mixing Graphs with Differentiable Processors and Iterative Pruning
por: Lee, Sungho, et al.
Publicado: (2025)
por: Lee, Sungho, et al.
Publicado: (2025)
DDD: A Perceptually Superior Low-Response-Time DNN-based Declipper
por: Yi, Jayeon, et al.
Publicado: (2024)
por: Yi, Jayeon, et al.
Publicado: (2024)
Inverse Nonlinearity Compensation of Hyperelastic Deformation in Dielectric Elastomer for Acoustic Actuation
por: Lee, Jin Woo, et al.
Publicado: (2024)
por: Lee, Jin Woo, et al.
Publicado: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation
por: Han, Lu, et al.
Publicado: (2025)
por: Han, Lu, et al.
Publicado: (2025)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
por: Sato, Hiroshi, et al.
Publicado: (2025)
por: Sato, Hiroshi, et al.
Publicado: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
ICASSP 2026 URGENT Speech Enhancement Challenge
por: Li, Chenda, et al.
Publicado: (2026)
por: Li, Chenda, et al.
Publicado: (2026)
Geneses: Unified Generative Speech Enhancement and Separation
por: Asai, Kohei, et al.
Publicado: (2026)
por: Asai, Kohei, et al.
Publicado: (2026)
Ejemplares similares
-
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
por: Han, Seungu, et al.
Publicado: (2025) -
Differentiable Acoustic Radiance Transfer
por: Lee, Sungho, et al.
Publicado: (2025) -
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
por: Hwang, Injune, et al.
Publicado: (2024) -
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025) -
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
por: Kim, Jaeyeon, et al.
Publicado: (2024)