Spiking Structured State Space Model for Monaural Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Yu, Liu, Xu, Chua, Yansong |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
par: Qian, Xinyuan, et autres
Publié: (2024)
par: Qian, Xinyuan, et autres
Publié: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
par: Li, Yi, et autres
Publié: (2024)
par: Li, Yi, et autres
Publié: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
par: Liu, Zehua, et autres
Publié: (2025)
par: Liu, Zehua, et autres
Publié: (2025)
Input Conditioned Layer Dropping in Speech Foundation Models
par: Hannan, Abdul, et autres
Publié: (2025)
par: Hannan, Abdul, et autres
Publié: (2025)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
par: Hu, Rui, et autres
Publié: (2025)
par: Hu, Rui, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition
par: Liu, Lei, et autres
Publié: (2024)
par: Liu, Lei, et autres
Publié: (2024)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Emotional Face-to-Speech
par: Ye, Jiaxin, et autres
Publié: (2025)
par: Ye, Jiaxin, et autres
Publié: (2025)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024)
par: Chen, Honglie, et autres
Publié: (2024)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
par: Liu, Zehua, et autres
Publié: (2025)
par: Liu, Zehua, et autres
Publié: (2025)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
par: Pegg, Samuel, et autres
Publié: (2023)
par: Pegg, Samuel, et autres
Publié: (2023)
RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling
par: Pham, Long-Khanh, et autres
Publié: (2025)
par: Pham, Long-Khanh, et autres
Publié: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations
par: Zhang, Xulong, et autres
Publié: (2024)
par: Zhang, Xulong, et autres
Publié: (2024)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Enhancing CTC-Based Visual Speech Recognition
par: Laux, Hendrik, et autres
Publié: (2024)
par: Laux, Hendrik, et autres
Publié: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
par: Zhang, Qiquan, et autres
Publié: (2024)
par: Zhang, Qiquan, et autres
Publié: (2024)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
par: Zhao, Shengkui, et autres
Publié: (2022)
par: Zhao, Shengkui, et autres
Publié: (2022)
Sonicmesh: Enhancing 3D Human Mesh Reconstruction in Vision-Impaired Environments With Acoustic Signals
par: Liang, Xiaoxuan, et autres
Publié: (2024)
par: Liang, Xiaoxuan, et autres
Publié: (2024)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
par: Liang, Yifan, et autres
Publié: (2025)
par: Liang, Yifan, et autres
Publié: (2025)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
par: Fu, Chaoyou, et autres
Publié: (2025)
par: Fu, Chaoyou, et autres
Publié: (2025)
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
par: D., Quang-Anh N., et autres
Publié: (2024)
par: D., Quang-Anh N., et autres
Publié: (2024)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Digit Recognition using Multimodal Spiking Neural Networks
par: Bjorndahl, William, et autres
Publié: (2024)
par: Bjorndahl, William, et autres
Publié: (2024)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
par: Park, Young-Hu, et autres
Publié: (2025)
par: Park, Young-Hu, et autres
Publié: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
par: Rouditchenko, Andrew, et autres
Publié: (2024)
par: Rouditchenko, Andrew, et autres
Publié: (2024)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2026)
par: Cappellazzo, Umberto, et autres
Publié: (2026)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Documents similaires
-
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025) -
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
par: Qian, Xinyuan, et autres
Publié: (2024) -
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025) -
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
par: Li, Yi, et autres
Publié: (2024) -
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)