Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
Fuente:
arXiv
Guardado en:
| Autores principales: | Xue, Ke, Fan, Rongfei, Li, Kai, Yu, Shanping, Zhao, Puning, An, Jianping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
por: Xue, Ke, et al.
Publicado: (2025)
por: Xue, Ke, et al.
Publicado: (2025)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
por: Wang, Chengzhong, et al.
Publicado: (2024)
por: Wang, Chengzhong, et al.
Publicado: (2024)
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
por: Zhao, Haixin, et al.
Publicado: (2025)
por: Zhao, Haixin, et al.
Publicado: (2025)
Omni-directional attention mechanism based on Mamba for speech separation
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
por: Wen, Wen, et al.
Publicado: (2024)
por: Wen, Wen, et al.
Publicado: (2024)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
por: Ojha, Shuubham, et al.
Publicado: (2025)
por: Ojha, Shuubham, et al.
Publicado: (2025)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2024)
por: Yan, Haoyin, et al.
Publicado: (2024)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
Distilling Spectrograms into Tokens: Fast and Lightweight Bioacoustic Classification for BirdCLEF+ 2025
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
por: Shi, Hao, et al.
Publicado: (2025)
por: Shi, Hao, et al.
Publicado: (2025)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024)
por: Hu, Guoqiang, et al.
Publicado: (2024)
Absorbing Discrete Diffusion for Speech Enhancement
por: Gonzalez, Philippe
Publicado: (2026)
por: Gonzalez, Philippe
Publicado: (2026)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025)
por: Shao, Nian, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Speech Enhancement with Dual-path Multi-Channel Linear Prediction Filter and Multi-norm Beamforming
por: Qin, Chengyuan, et al.
Publicado: (2025)
por: Qin, Chengyuan, et al.
Publicado: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
por: de Groot, Dimme, et al.
Publicado: (2025)
por: de Groot, Dimme, et al.
Publicado: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025)
por: Yang, Runxuan, et al.
Publicado: (2025)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Dense-TSNet: Dense Connected Two-Stage Structure for Ultra-Lightweight Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2024)
por: Lin, Zizhen, et al.
Publicado: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
por: Guimarães, Heitor R., et al.
Publicado: (2025)
por: Guimarães, Heitor R., et al.
Publicado: (2025)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
por: Liu, Yinghao, et al.
Publicado: (2026)
por: Liu, Yinghao, et al.
Publicado: (2026)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
por: Li, Yi, et al.
Publicado: (2024)
por: Li, Yi, et al.
Publicado: (2024)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
por: Guimarães, Heitor R., et al.
Publicado: (2025)
por: Guimarães, Heitor R., et al.
Publicado: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
por: Wang, Yuanyuan, et al.
Publicado: (2025)
por: Wang, Yuanyuan, et al.
Publicado: (2025)
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
ASM: Audio Spectrogram Mixer
por: Ji, Qingfeng, et al.
Publicado: (2024)
por: Ji, Qingfeng, et al.
Publicado: (2024)
Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
por: Lee, Jeongmin, et al.
Publicado: (2025)
por: Lee, Jeongmin, et al.
Publicado: (2025)
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
por: Zhu, Yike, et al.
Publicado: (2025)
por: Zhu, Yike, et al.
Publicado: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
FAST: Fast Audio Spectrogram Transformer
por: Naman, Anugunj, et al.
Publicado: (2025)
por: Naman, Anugunj, et al.
Publicado: (2025)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2025)
por: Yan, Haoyin, et al.
Publicado: (2025)
Ejemplares similares
-
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
por: Xue, Ke, et al.
Publicado: (2025) -
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
por: Wang, Chengzhong, et al.
Publicado: (2024) -
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
por: Zhao, Haixin, et al.
Publicado: (2025) -
Omni-directional attention mechanism based on Mamba for speech separation
por: Xue, Ke, et al.
Publicado: (2026) -
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)