TC-BiMamba: Trans-Chunk bidirectionally within BiMamba for unified streaming and non-streaming ASR
Fuente:
arXiv
Guardado en:
| Autores principales: | She, Qingshun, Peng, Jing, Fang, Yangui, Xi, Yu, Yu, Kai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet
por: Gao, Wenmiao, et al.
Publicado: (2025)
por: Gao, Wenmiao, et al.
Publicado: (2025)
Stereo sound event localization and detection based on PSELDnet pretraining and BiMamba sequence modeling
por: Gao, Wenmiao, et al.
Publicado: (2025)
por: Gao, Wenmiao, et al.
Publicado: (2025)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR
por: Huybrechts, Goeric, et al.
Publicado: (2023)
por: Huybrechts, Goeric, et al.
Publicado: (2023)
BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention
por: Kheir, Yassine El, et al.
Publicado: (2025)
por: Kheir, Yassine El, et al.
Publicado: (2025)
TASU: Text-Only Alignment for Speech Understanding
por: Peng, Jing, et al.
Publicado: (2025)
por: Peng, Jing, et al.
Publicado: (2025)
Joint decoding method for controllable contextual speech recognition based on Speech LLM
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
Mamba for Streaming ASR Combined with Unimodal Aggregation
por: Fang, Ying, et al.
Publicado: (2024)
por: Fang, Ying, et al.
Publicado: (2024)
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
por: Zhao, Wenbo, et al.
Publicado: (2024)
por: Zhao, Wenbo, et al.
Publicado: (2024)
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
por: Xi, Yu, et al.
Publicado: (2024)
por: Xi, Yu, et al.
Publicado: (2024)
A Survey on Speech Large Language Models for Understanding
por: Peng, Jing, et al.
Publicado: (2024)
por: Peng, Jing, et al.
Publicado: (2024)
Unifying Streaming and Non-streaming Zipformer-based ASR
por: Sharma, Bidisha, et al.
Publicado: (2025)
por: Sharma, Bidisha, et al.
Publicado: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
EfficientASR: Speech Recognition Network Compression via Attention Redundancy and Chunk-Level FFN Optimization
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
Omni-directional attention mechanism based on Mamba for speech separation
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
Rethinking Mamba in Speech Processing by Self-Supervised Models
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Exploring the Capability of Mamba in Speech Applications
por: Miyazaki, Koichi, et al.
Publicado: (2024)
por: Miyazaki, Koichi, et al.
Publicado: (2024)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
por: Wang, Fangyuan, et al.
Publicado: (2022)
por: Wang, Fangyuan, et al.
Publicado: (2022)
A Two-Stage Band-Split Mamba-2 Network For Music Separation
por: Bai, Jinglin, et al.
Publicado: (2024)
por: Bai, Jinglin, et al.
Publicado: (2024)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
por: Wang, Junyu, et al.
Publicado: (2024)
por: Wang, Junyu, et al.
Publicado: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis
por: Nguyen, Tan Dat, et al.
Publicado: (2026)
por: Nguyen, Tan Dat, et al.
Publicado: (2026)
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Mamba-based Segmentation Model for Speaker Diarization
por: Plaquet, Alexis, et al.
Publicado: (2024)
por: Plaquet, Alexis, et al.
Publicado: (2024)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
por: C, Anandh, et al.
Publicado: (2025)
por: C, Anandh, et al.
Publicado: (2025)
Dialogue Understandability: Why are we streaming movies with subtitles?
por: Martinez, Helard Becerra, et al.
Publicado: (2024)
por: Martinez, Helard Becerra, et al.
Publicado: (2024)
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
por: Ye, Shuaishuai, et al.
Publicado: (2024)
por: Ye, Shuaishuai, et al.
Publicado: (2024)
MASV: Speaker Verification with Global and Local Context Mamba
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2024)
por: Chao, Rong, et al.
Publicado: (2024)
SepMamba: State-space models for speaker separation using Mamba
por: Avenstrup, Thor Højhus, et al.
Publicado: (2024)
por: Avenstrup, Thor Højhus, et al.
Publicado: (2024)
XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection
por: Ng, Kwok-Ho, et al.
Publicado: (2026)
por: Ng, Kwok-Ho, et al.
Publicado: (2026)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
por: Ding, Hanyu, et al.
Publicado: (2025)
por: Ding, Hanyu, et al.
Publicado: (2025)
SongTrans: An unified song transcription and alignment method for lyrics and notes
por: Wu, Siwei, et al.
Publicado: (2024)
por: Wu, Siwei, et al.
Publicado: (2024)
TokenSE: a Mamba-based discrete token speech enhancement framework for cochlear implants
por: Chiang, Hsin-Tien, et al.
Publicado: (2026)
por: Chiang, Hsin-Tien, et al.
Publicado: (2026)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
por: Chen, Jiatao, et al.
Publicado: (2024)
por: Chen, Jiatao, et al.
Publicado: (2024)
MambaRate: Speech Quality Assessment Across Different Sampling Rates
por: Kakoulidis, Panos, et al.
Publicado: (2025)
por: Kakoulidis, Panos, et al.
Publicado: (2025)
TF-Mamba: A Time-Frequency Network for Sound Source Localization
por: Xiao, Yang, et al.
Publicado: (2024)
por: Xiao, Yang, et al.
Publicado: (2024)
Ejemplares similares
-
Enhancing Stereo Sound Event Detection with BiMamba and Pretrained PSELDnet
por: Gao, Wenmiao, et al.
Publicado: (2025) -
Stereo sound event localization and detection based on PSELDnet pretraining and BiMamba sequence modeling
por: Gao, Wenmiao, et al.
Publicado: (2025) -
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
por: Li, Junjie, et al.
Publicado: (2025) -
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction
por: Fang, Yangui, et al.
Publicado: (2025) -
DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR
por: Huybrechts, Goeric, et al.
Publicado: (2023)