FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Haoxu, Jiang, Yiheng, Qiao, Gang, Shi, Pengteng, Tian, Biao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Efficient Directional and Distance Cues for Regional Speech Separation
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
di: Jiang, Yiheng, et al.
Pubblicazione: (2026)
A Small-footprint Acoustic Echo Cancellation Solution for Mobile Full-Duplex Speech Interactions
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Cross-Talk Speech Reduction, by Separation, for Separation
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
Unsupervised Single-Channel Speech Separation with a Diffusion Prior under Speaker-Embedding Guidance
di: Shi, Runwu, et al.
Pubblicazione: (2025)
di: Shi, Runwu, et al.
Pubblicazione: (2025)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
Hyperbolic Distance-Based Speech Separation
di: Petermann, Darius, et al.
Pubblicazione: (2024)
di: Petermann, Darius, et al.
Pubblicazione: (2024)
Advances in Speech Separation: Techniques, Challenges, and Future Trends
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
EDSep: An Effective Diffusion-Based Method for Speech Source Separation
di: Dong, Jinwei, et al.
Pubblicazione: (2025)
di: Dong, Jinwei, et al.
Pubblicazione: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
Multi-Utterance Speech Separation and Association Trained on Short Segments
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Geneses: Unified Generative Speech Enhancement and Separation
di: Asai, Kohei, et al.
Pubblicazione: (2026)
di: Asai, Kohei, et al.
Pubblicazione: (2026)
Noise-Aware Speech Separation with Contrastive Learning
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
di: Zhang, Zizheng, et al.
Pubblicazione: (2023)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
di: Wang, Yuzhu, et al.
Pubblicazione: (2025)
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
di: Hirano, Masato, et al.
Pubblicazione: (2023)
di: Hirano, Masato, et al.
Pubblicazione: (2023)
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
di: Wang, Hankun, et al.
Pubblicazione: (2024)
di: Wang, Hankun, et al.
Pubblicazione: (2024)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
SepPrune: Structured Pruning for Efficient Deep Speech Separation
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone Arrays
di: He, Shulin, et al.
Pubblicazione: (2025)
di: He, Shulin, et al.
Pubblicazione: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Exploring Efficient Directional and Distance Cues for Regional Speech Separation
di: Jiang, Yiheng, et al.
Pubblicazione: (2025) -
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
di: Wang, Haoxu, et al.
Pubblicazione: (2025) -
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
di: Jiang, Yiheng, et al.
Pubblicazione: (2026) -
A Small-footprint Acoustic Echo Cancellation Solution for Mobile Full-Duplex Speech Interactions
di: Jiang, Yiheng, et al.
Pubblicazione: (2025) -
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)