Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Longjie, Lu, Shenghui, Li, Lin, Hong, Qingyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
por: Luo, Longjie, et al.
Publicado: (2025)
por: Luo, Longjie, et al.
Publicado: (2025)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
por: Lu, Shenghui, et al.
Publicado: (2025)
por: Lu, Shenghui, et al.
Publicado: (2025)
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
por: Han, Runduo, et al.
Publicado: (2024)
por: Han, Runduo, et al.
Publicado: (2024)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
por: Li, Zhaoyang, et al.
Publicado: (2025)
por: Li, Zhaoyang, et al.
Publicado: (2025)
ctPuLSE: Close-Talk, and Pseudo-Label Based Far-Field, Speech Enhancement
por: Wang, Zhong-Qiu
Publicado: (2024)
por: Wang, Zhong-Qiu
Publicado: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
por: Gao, Ming, et al.
Publicado: (2025)
por: Gao, Ming, et al.
Publicado: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
ICASSP 2026 URGENT Speech Enhancement Challenge
por: Li, Chenda, et al.
Publicado: (2026)
por: Li, Chenda, et al.
Publicado: (2026)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
por: Yang, Wenhao, et al.
Publicado: (2024)
por: Yang, Wenhao, et al.
Publicado: (2024)
URGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
XMUspeech Systems for the ASVspoof 5 Challenge
por: Li, Wangjie, et al.
Publicado: (2025)
por: Li, Wangjie, et al.
Publicado: (2025)
Improving Whispered Speech Recognition Performance using Pseudo-whispered based Data Augmentation
por: Lin, Zhaofeng, et al.
Publicado: (2023)
por: Lin, Zhaofeng, et al.
Publicado: (2023)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
por: Chen, Peijie, et al.
Publicado: (2025)
por: Chen, Peijie, et al.
Publicado: (2025)
Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
por: Zezario, Ryandhimas E., et al.
Publicado: (2023)
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
por: Tsutsumi, Ayuto, et al.
Publicado: (2026)
por: Tsutsumi, Ayuto, et al.
Publicado: (2026)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
por: Quan, Changsheng, et al.
Publicado: (2024)
por: Quan, Changsheng, et al.
Publicado: (2024)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
por: Wu, Weijie, et al.
Publicado: (2025)
por: Wu, Weijie, et al.
Publicado: (2025)
Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
por: Aldeneh, Zakaria, et al.
Publicado: (2024)
por: Aldeneh, Zakaria, et al.
Publicado: (2024)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
por: Wen, Wen, et al.
Publicado: (2024)
por: Wen, Wen, et al.
Publicado: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2024)
por: Lin, Zizhen, et al.
Publicado: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
por: Ai, Yang, et al.
Publicado: (2024)
por: Ai, Yang, et al.
Publicado: (2024)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2025)
por: Lin, Zizhen, et al.
Publicado: (2025)
Universal Score-based Speech Enhancement with High Content Preservation
por: Scheibler, Robin, et al.
Publicado: (2024)
por: Scheibler, Robin, et al.
Publicado: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
por: Zhang, Wangyou, et al.
Publicado: (2025)
por: Zhang, Wangyou, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Ejemplares similares
-
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
por: Luo, Longjie, et al.
Publicado: (2025) -
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
por: Lu, Shenghui, et al.
Publicado: (2025) -
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
por: Han, Runduo, et al.
Publicado: (2024) -
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
por: Li, Zhaoyang, et al.
Publicado: (2025) -
ctPuLSE: Close-Talk, and Pseudo-Label Based Far-Field, Speech Enhancement
por: Wang, Zhong-Qiu
Publicado: (2024)