Enregistré dans:
| Auteurs principaux: | Yang, Hsiang-Cheng, Li, You-Jin, Chao, Rong, Tsao, Yu, Su, Borching, Chien, Shao-Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.08359 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
par: Chen, Chih-Ning, et autres
Publié: (2026)
par: Chen, Chih-Ning, et autres
Publié: (2026)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)
par: Hussain, Tassadaq, et autres
Publié: (2024)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
Visual-Informed Speech Enhancement Using Attention-Based Beamforming
par: Liu, Chihyun, et autres
Publié: (2026)
par: Liu, Chihyun, et autres
Publié: (2026)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
par: Chao, Rong, et autres
Publié: (2024)
par: Chao, Rong, et autres
Publié: (2024)
EffortNet: A Deep Learning Framework for Objective Assessment of Speech Enhancement Technologies Using EEG-Based Alpha Oscillations
par: Sung, Ching-Chih, et autres
Publié: (2025)
par: Sung, Ching-Chih, et autres
Publié: (2025)
Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database
par: Yaffe, Danielle, et autres
Publié: (2025)
par: Yaffe, Danielle, et autres
Publié: (2025)
Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear Implant Simulation
par: Lai, Richard Lee, et autres
Publié: (2023)
par: Lai, Richard Lee, et autres
Publié: (2023)
From Evaluation to Optimization: Neural Speech Assessment for Downstream Applications
par: Tsao, Yu
Publié: (2025)
par: Tsao, Yu
Publié: (2025)
Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding
par: Shao, Mingchen, et autres
Publié: (2026)
par: Shao, Mingchen, et autres
Publié: (2026)
Evaluating Speech Enhancement Systems Through Listening Effort
par: Gelderblom, Femke B., et autres
Publié: (2024)
par: Gelderblom, Femke B., et autres
Publié: (2024)
Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids
par: Saleem, Nasir, et autres
Publié: (2025)
par: Saleem, Nasir, et autres
Publié: (2025)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
An Investigation on Combining Geometry and Consistency Constraints into Phase Estimation for Speech Enhancement
par: Ho, Chun-Wei, et autres
Publié: (2025)
par: Ho, Chun-Wei, et autres
Publié: (2025)
Linguistic Knowledge Transfer Learning for Speech Enhancement
par: Hung, Kuo-Hsuan, et autres
Publié: (2025)
par: Hung, Kuo-Hsuan, et autres
Publié: (2025)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
par: Yang, Xiaoyu, et autres
Publié: (2025)
par: Yang, Xiaoyu, et autres
Publié: (2025)
French Listening Tests for the Assessment of Intelligibility, Quality, and Identity of Body-Conducted Speech Enhancement
par: Joubaud, Thomas, et autres
Publié: (2025)
par: Joubaud, Thomas, et autres
Publié: (2025)
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
par: Chou, Ju-Chieh, et autres
Publié: (2023)
par: Chou, Ju-Chieh, et autres
Publié: (2023)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
par: Chen, Yanan, et autres
Publié: (2024)
par: Chen, Yanan, et autres
Publié: (2024)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
Towards Environmental Preference Based Speech Enhancement For Individualised Multi-Modal Hearing Aids
par: Kirton-Wingate, Jasper, et autres
Publié: (2024)
par: Kirton-Wingate, Jasper, et autres
Publié: (2024)
Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
par: Daeglau, Mareike, et autres
Publié: (2025)
par: Daeglau, Mareike, et autres
Publié: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
Improving the Robustness and Clinical Applicability of Automatic Respiratory Sound Classification Using Deep Learning-Based Audio Enhancement: Algorithm Development and Validation
par: Tzeng, Jing-Tong, et autres
Publié: (2024)
par: Tzeng, Jing-Tong, et autres
Publié: (2024)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
par: Rong, Xiaobin, et autres
Publié: (2026)
par: Rong, Xiaobin, et autres
Publié: (2026)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
par: Fu, Szu-Wei, et autres
Publié: (2024)
par: Fu, Szu-Wei, et autres
Publié: (2024)
Real-Time System for Audio-Visual Target Speech Enhancement
par: Ma, T. Aleksandra, et autres
Publié: (2025)
par: Ma, T. Aleksandra, et autres
Publié: (2025)
Exploiting Consistency-Preserving Loss and Perceptual Contrast Stretching to Boost SSL-based Speech Enhancement
par: Khan, Muhammad Salman, et autres
Publié: (2024)
par: Khan, Muhammad Salman, et autres
Publié: (2024)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
par: Papadopoulos, Aristeidis, et autres
Publié: (2025)
par: Papadopoulos, Aristeidis, et autres
Publié: (2025)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
par: Lin, Zhaofeng, et autres
Publié: (2024)
par: Lin, Zhaofeng, et autres
Publié: (2024)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
Unsupervised Face-Masked Speech Enhancement Using Generative Adversarial Networks With Human-in-the-Loop Assessment Metrics
par: Wang, Syu-Siang, et autres
Publié: (2024)
par: Wang, Syu-Siang, et autres
Publié: (2024)
Documents similaires
-
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
par: Chen, Chih-Ning, et autres
Publié: (2026) -
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025) -
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024) -
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025) -
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
par: Hussain, Tassadaq, et autres
Publié: (2024)