Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hussain, Tassadaq, Dashtipour, Kia, Tsao, Yu, Hussain, Amir |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Environmental Preference Based Speech Enhancement For Individualised Multi-Modal Hearing Aids
par: Kirton-Wingate, Jasper, et autres
Publié: (2024)
par: Kirton-Wingate, Jasper, et autres
Publié: (2024)
A Study on Speech Assessment with Visual Cues
par: Ahmed, Shafique, et autres
Publié: (2025)
par: Ahmed, Shafique, et autres
Publié: (2025)
Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids
par: Saleem, Nasir, et autres
Publié: (2025)
par: Saleem, Nasir, et autres
Publié: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
par: Chen, Chih-Ning, et autres
Publié: (2026)
par: Chen, Chih-Ning, et autres
Publié: (2026)
LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement
par: Jain, Arnav, et autres
Publié: (2024)
par: Jain, Arnav, et autres
Publié: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
par: Daeglau, Mareike, et autres
Publié: (2025)
par: Daeglau, Mareike, et autres
Publié: (2025)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
par: Lu, Xikun, et autres
Publié: (2025)
par: Lu, Xikun, et autres
Publié: (2025)
WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation
par: Han, Lu, et autres
Publié: (2025)
par: Han, Lu, et autres
Publié: (2025)
Harmonic Detection from Noisy Speech with Auditory Frame Gain for Intelligibility Enhancement
par: Queiroz, A., et autres
Publié: (2024)
par: Queiroz, A., et autres
Publié: (2024)
Cinematic Audio Source Separation Using Visual Cues
par: Zhang, Kang, et autres
Publié: (2026)
par: Zhang, Kang, et autres
Publié: (2026)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
par: Li, Pengcheng, et autres
Publié: (2025)
par: Li, Pengcheng, et autres
Publié: (2025)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
par: Khan, Muhammad Salman, et autres
Publié: (2024)
par: Khan, Muhammad Salman, et autres
Publié: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
par: Wang, Xincheng, et autres
Publié: (2024)
par: Wang, Xincheng, et autres
Publié: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
BreathNet: Generalizable Audio Deepfake Detection via Breath-Cue-Guided Feature Refinement
par: Ye, Zhe, et autres
Publié: (2026)
par: Ye, Zhe, et autres
Publié: (2026)
A Comparative Evaluation of Deep Learning Models for Speech Enhancement in Real-World Noisy Environments
par: Khondkar, Md Jahangir Alam, et autres
Publié: (2025)
par: Khondkar, Md Jahangir Alam, et autres
Publié: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
par: Zhang, Sidong, et autres
Publié: (2025)
par: Zhang, Sidong, et autres
Publié: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Exploring Efficient Directional and Distance Cues for Regional Speech Separation
par: Jiang, Yiheng, et autres
Publié: (2025)
par: Jiang, Yiheng, et autres
Publié: (2025)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Harmonic Summation-Based Robust Pitch Estimation in Noisy and Reverberant Environments
par: Singh, Anup, et autres
Publié: (2025)
par: Singh, Anup, et autres
Publié: (2025)
NOMAD: Unsupervised Learning of Perceptual Embeddings for Speech Enhancement and Non-matching Reference Audio Quality Assessment
par: Ragano, Alessandro, et autres
Publié: (2023)
par: Ragano, Alessandro, et autres
Publié: (2023)
Documents similaires
-
Towards Environmental Preference Based Speech Enhancement For Individualised Multi-Modal Hearing Aids
par: Kirton-Wingate, Jasper, et autres
Publié: (2024) -
A Study on Speech Assessment with Visual Cues
par: Ahmed, Shafique, et autres
Publié: (2025) -
Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids
par: Saleem, Nasir, et autres
Publié: (2025) -
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024) -
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)