Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yuewei, Zou, Huanbin, Zhu, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement
por: Zhang, Yuewei, et al.
Publicado: (2024)
por: Zhang, Yuewei, et al.
Publicado: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
por: Tsunoo, Emiru, et al.
Publicado: (2024)
por: Tsunoo, Emiru, et al.
Publicado: (2024)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
por: Bai, Jinglin, et al.
Publicado: (2024)
por: Bai, Jinglin, et al.
Publicado: (2024)
Harmonic Detection from Noisy Speech with Auditory Frame Gain for Intelligibility Enhancement
por: Queiroz, A., et al.
Publicado: (2024)
por: Queiroz, A., et al.
Publicado: (2024)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
por: Ojha, Shuubham, et al.
Publicado: (2025)
por: Ojha, Shuubham, et al.
Publicado: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement
por: Zuo, Keying, et al.
Publicado: (2024)
por: Zuo, Keying, et al.
Publicado: (2024)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
por: Han, Seungu, et al.
Publicado: (2026)
por: Han, Seungu, et al.
Publicado: (2026)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
por: Nakazawa, Kazushi
Publicado: (2026)
por: Nakazawa, Kazushi
Publicado: (2026)
Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech
por: Yang, Dong, et al.
Publicado: (2024)
por: Yang, Dong, et al.
Publicado: (2024)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2025)
por: Yan, Haoyin, et al.
Publicado: (2025)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
por: Pálka, Petr, et al.
Publicado: (2024)
por: Pálka, Petr, et al.
Publicado: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
SaD: A Scenario-Aware Discriminator for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
por: Mariotte, Théo, et al.
Publicado: (2024)
por: Mariotte, Théo, et al.
Publicado: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
por: Lee, Jeongmin, et al.
Publicado: (2025)
por: Lee, Jeongmin, et al.
Publicado: (2025)
ICASSP 2026 URGENT Speech Enhancement Challenge
por: Li, Chenda, et al.
Publicado: (2026)
por: Li, Chenda, et al.
Publicado: (2026)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
Absorbing Discrete Diffusion for Speech Enhancement
por: Gonzalez, Philippe
Publicado: (2026)
por: Gonzalez, Philippe
Publicado: (2026)
A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model
por: Xiang, Yang, et al.
Publicado: (2025)
por: Xiang, Yang, et al.
Publicado: (2025)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
por: de Groot, Dimme, et al.
Publicado: (2025)
por: de Groot, Dimme, et al.
Publicado: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge
por: Goswami, Nabarun, et al.
Publicado: (2025)
por: Goswami, Nabarun, et al.
Publicado: (2025)
URGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
por: Zhu, Yike, et al.
Publicado: (2025)
por: Zhu, Yike, et al.
Publicado: (2025)
AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers
por: Fu, Linya, et al.
Publicado: (2025)
por: Fu, Linya, et al.
Publicado: (2025)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
Variational Autoencoder for Personalized Pathological Speech Enhancement
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Investigating Training Objectives for Generative Speech Enhancement
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
Geneses: Unified Generative Speech Enhancement and Separation
por: Asai, Kohei, et al.
Publicado: (2026)
por: Asai, Kohei, et al.
Publicado: (2026)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
por: Sato, Hiroshi, et al.
Publicado: (2025)
por: Sato, Hiroshi, et al.
Publicado: (2025)
Ejemplares similares
-
A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement
por: Zhang, Yuewei, et al.
Publicado: (2024) -
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
por: Tsunoo, Emiru, et al.
Publicado: (2024) -
Attention-Based Beamformer For Multi-Channel Speech Enhancement
por: Bai, Jinglin, et al.
Publicado: (2024) -
Harmonic Detection from Noisy Speech with Auditory Frame Gain for Intelligibility Enhancement
por: Queiroz, A., et al.
Publicado: (2024) -
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
por: Ojha, Shuubham, et al.
Publicado: (2025)