Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
Fuente:
arXiv
Guardado en:
| Autores principales: | Ren, Wenze, Hung, Kuo-Hsuan, Chao, Rong, Li, YouJin, Wang, Hsin-Min, Tsao, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
por: Hussain, Tassadaq, et al.
Publicado: (2024)
por: Hussain, Tassadaq, et al.
Publicado: (2024)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
por: Chen, Chih-Ning, et al.
Publicado: (2026)
por: Chen, Chih-Ning, et al.
Publicado: (2026)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
por: Khan, Muhammad Salman, et al.
Publicado: (2024)
por: Khan, Muhammad Salman, et al.
Publicado: (2024)
MC-SEMamba: A Simple Multi-channel Extension of SEMamba
por: Ting, Wen-Yuan, et al.
Publicado: (2024)
por: Ting, Wen-Yuan, et al.
Publicado: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
por: Fu, Szu-Wei, et al.
Publicado: (2024)
por: Fu, Szu-Wei, et al.
Publicado: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
por: Du, Jiawei, et al.
Publicado: (2024)
por: Du, Jiawei, et al.
Publicado: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2024)
por: Chao, Rong, et al.
Publicado: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
por: Daeglau, Mareike, et al.
Publicado: (2025)
por: Daeglau, Mareike, et al.
Publicado: (2025)
A Study on Zero-shot Non-intrusive Speech Assessment using Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2024)
por: Zezario, Ryandhimas E., et al.
Publicado: (2024)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
por: Lin, Zhaofeng, et al.
Publicado: (2024)
por: Lin, Zhaofeng, et al.
Publicado: (2024)
A Study on Speech Assessment with Visual Cues
por: Ahmed, Shafique, et al.
Publicado: (2025)
por: Ahmed, Shafique, et al.
Publicado: (2025)
Speech Intelligibility Assessment with Uncertainty-Aware Whisper Embeddings and sLSTM
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
por: Li, Jizhen, et al.
Publicado: (2025)
por: Li, Jizhen, et al.
Publicado: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Feature Importance across Domains for Improving Non-Intrusive Speech Intelligibility Prediction in Hearing Aids
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
A Study on Zero-Shot Non-Intrusive Speech Intelligibility for Hearing Aids Using Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
A Study on Incorporating Whisper for Robust Speech Assessment
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
por: Chiang, Hsin-Tien, et al.
Publicado: (2024)
por: Chiang, Hsin-Tien, et al.
Publicado: (2024)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
por: O'Reilly, Patrick, et al.
Publicado: (2025)
por: O'Reilly, Patrick, et al.
Publicado: (2025)
Towards Environmental Preference Based Speech Enhancement For Individualised Multi-Modal Hearing Aids
por: Kirton-Wingate, Jasper, et al.
Publicado: (2024)
por: Kirton-Wingate, Jasper, et al.
Publicado: (2024)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
por: Li, Yi, et al.
Publicado: (2024)
por: Li, Yi, et al.
Publicado: (2024)
Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework
por: Yang, Hsiang-Cheng, et al.
Publicado: (2026)
por: Yang, Hsiang-Cheng, et al.
Publicado: (2026)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
por: Ochiai, Tsubasa, et al.
Publicado: (2024)
por: Ochiai, Tsubasa, et al.
Publicado: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
por: Huang, Wen-Chin, et al.
Publicado: (2024)
por: Huang, Wen-Chin, et al.
Publicado: (2024)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Decoupled Spatial and Temporal Processing for Resource Efficient Multichannel Speech Enhancement
por: Pandey, Ashutosh, et al.
Publicado: (2024)
por: Pandey, Ashutosh, et al.
Publicado: (2024)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
por: Ragano, Alessandro, et al.
Publicado: (2023)
por: Ragano, Alessandro, et al.
Publicado: (2023)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
Ejemplares similares
-
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025) -
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024) -
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
por: Hussain, Tassadaq, et al.
Publicado: (2024) -
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
por: Chen, Chih-Ning, et al.
Publicado: (2026) -
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
por: Khan, Muhammad Salman, et al.
Publicado: (2024)