A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuewei, Zou, Huanbin, Zhu, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
par: Zhang, Yuewei, et autres
Publié: (2025)
par: Zhang, Yuewei, et autres
Publié: (2025)
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
par: Lu, Shenghui, et autres
Publié: (2025)
par: Lu, Shenghui, et autres
Publié: (2025)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2025)
par: Yan, Haoyin, et autres
Publié: (2025)
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
par: Lin, Zizhen, et autres
Publié: (2024)
par: Lin, Zizhen, et autres
Publié: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
par: Niu, Rui, et autres
Publié: (2025)
par: Niu, Rui, et autres
Publié: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
par: Chen, Yanan, et autres
Publié: (2024)
par: Chen, Yanan, et autres
Publié: (2024)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2024)
par: Yan, Haoyin, et autres
Publié: (2024)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
A Lightweight and Real-Time Binaural Speech Enhancement Model with Spatial Cues Preservation
par: Wang, Jingyuan, et autres
Publié: (2024)
par: Wang, Jingyuan, et autres
Publié: (2024)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
par: Li, Jizhen, et autres
Publié: (2025)
par: Li, Jizhen, et autres
Publié: (2025)
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zuo, Keying, et autres
Publié: (2024)
par: Zuo, Keying, et autres
Publié: (2024)
RealMAN: A Real-Recorded and Annotated Microphone Array Dataset for Dynamic Speech Enhancement and Localization
par: Yang, Bing, et autres
Publié: (2024)
par: Yang, Bing, et autres
Publié: (2024)
SaD: A Scenario-Aware Discriminator for Speech Enhancement
par: Yuan, Xihao, et autres
Publié: (2025)
par: Yuan, Xihao, et autres
Publié: (2025)
A Domain Adaptation Framework for Speech Recognition Systems with Only Synthetic data
par: Tran, Minh, et autres
Publié: (2025)
par: Tran, Minh, et autres
Publié: (2025)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
par: Yuan, Xihao, et autres
Publié: (2025)
par: Yuan, Xihao, et autres
Publié: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
par: Rong, Xiaobin, et autres
Publié: (2026)
par: Rong, Xiaobin, et autres
Publié: (2026)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
par: Cui, Zhongjian, et autres
Publié: (2025)
par: Cui, Zhongjian, et autres
Publié: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
Multichannel AV-wav2vec2: A Framework for Learning Multichannel Multi-Modal Speech Representation
par: Zhu, Qiushi, et autres
Publié: (2024)
par: Zhu, Qiushi, et autres
Publié: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
par: Wang, Dahan, et autres
Publié: (2025)
par: Wang, Dahan, et autres
Publié: (2025)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
par: Wang, Wupeng, et autres
Publié: (2025)
par: Wang, Wupeng, et autres
Publié: (2025)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2024)
par: Zhang, Qiquan, et autres
Publié: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
par: Lee, Jeongmin, et autres
Publié: (2025)
par: Lee, Jeongmin, et autres
Publié: (2025)
FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge
par: Goswami, Nabarun, et autres
Publié: (2025)
par: Goswami, Nabarun, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
SpecTokenizer: A Lightweight Streaming Codec in the Compressed Spectrum Domain
par: Wan, Zixiang, et autres
Publié: (2025)
par: Wan, Zixiang, et autres
Publié: (2025)
ICASSP 2026 URGENT Speech Enhancement Challenge
par: Li, Chenda, et autres
Publié: (2026)
par: Li, Chenda, et autres
Publié: (2026)
Improving Design of Input Condition Invariant Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
par: Nasretdinov, Rauf, et autres
Publié: (2025)
par: Nasretdinov, Rauf, et autres
Publié: (2025)
Leveraging Local and Global Knowledge Integration with Time-Frequency Calibrated Distillation for Speech Enhancement
par: Cheng, Jiaming, et autres
Publié: (2025)
par: Cheng, Jiaming, et autres
Publié: (2025)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
par: Li, Li, et autres
Publié: (2024)
par: Li, Li, et autres
Publié: (2024)
Absorbing Discrete Diffusion for Speech Enhancement
par: Gonzalez, Philippe
Publié: (2026)
par: Gonzalez, Philippe
Publié: (2026)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
par: Kwak, Doyeop, et autres
Publié: (2025)
par: Kwak, Doyeop, et autres
Publié: (2025)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
par: Zhang, Wangyou, et autres
Publié: (2024)
par: Zhang, Wangyou, et autres
Publié: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
par: Zhang, Leying, et autres
Publié: (2024)
par: Zhang, Leying, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
Documents similaires
-
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
par: Zhang, Yuewei, et autres
Publié: (2025) -
A Two-Stage Hierarchical Deep Filtering Framework for Real-Time Speech Enhancement
par: Lu, Shenghui, et autres
Publié: (2025) -
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2025) -
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
par: Lin, Zizhen, et autres
Publié: (2024) -
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
par: Niu, Rui, et autres
Publié: (2025)