DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Huybrechts, Goeric, Ronanki, Srikanth, Li, Xilai, Nosrati, Hadis, Bodapati, Sravan, Kirchhoff, Katrin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
di: Das, Nilaksh, et al.
Pubblicazione: (2024)
di: Das, Nilaksh, et al.
Pubblicazione: (2024)
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
Unifying Streaming and Non-streaming Zipformer-based ASR
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
di: Ma, Jianbo, et al.
Pubblicazione: (2023)
Promptformer: Prompted Conformer Transducer for ASR
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
di: Bokaei, Mohammad, et al.
Pubblicazione: (2024)
di: Bokaei, Mohammad, et al.
Pubblicazione: (2024)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
Sequential Editing for Lifelong Training of Speech Recognition Models
di: Kulshreshtha, Devang, et al.
Pubblicazione: (2024)
di: Kulshreshtha, Devang, et al.
Pubblicazione: (2024)
TC-BiMamba: Trans-Chunk bidirectionally within BiMamba for unified streaming and non-streaming ASR
di: She, Qingshun, et al.
Pubblicazione: (2026)
di: She, Qingshun, et al.
Pubblicazione: (2026)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
di: C, Anandh, et al.
Pubblicazione: (2025)
di: C, Anandh, et al.
Pubblicazione: (2025)
Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context
di: Kang, Wei, et al.
Pubblicazione: (2023)
di: Kang, Wei, et al.
Pubblicazione: (2023)
Knowledge boosting during low-latency inference
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
di: Srinivas, Vidya, et al.
Pubblicazione: (2024)
Complexity boosted adaptive training for better low resource ASR performance
di: Lu, Hongxuan, et al.
Pubblicazione: (2024)
di: Lu, Hongxuan, et al.
Pubblicazione: (2024)
AudioRepInceptionNeXt: A lightweight single-stream architecture for efficient audio recognition
di: Lau, Kin Wai, et al.
Pubblicazione: (2024)
di: Lau, Kin Wai, et al.
Pubblicazione: (2024)
Conformal Prediction for Manifold-based Source Localization with Gaussian Processes
di: Rozenfeld, Vadim, et al.
Pubblicazione: (2024)
di: Rozenfeld, Vadim, et al.
Pubblicazione: (2024)
A light-weight and efficient punctuation and word casing prediction model for on-device streaming ASR
di: You, Jian, et al.
Pubblicazione: (2024)
di: You, Jian, et al.
Pubblicazione: (2024)
Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping
di: Zhang, Kevin, et al.
Pubblicazione: (2024)
di: Zhang, Kevin, et al.
Pubblicazione: (2024)
Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
di: Lee, Jaeyoung, et al.
Pubblicazione: (2026)
di: Lee, Jaeyoung, et al.
Pubblicazione: (2026)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
di: Wang, Fangyuan, et al.
Pubblicazione: (2022)
di: Wang, Fangyuan, et al.
Pubblicazione: (2022)
Conformer-based Ultrasound-to-Speech Conversion
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
di: Ibrahimov, Ibrahim, et al.
Pubblicazione: (2025)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
All Neural Low-latency Directional Speech Extraction
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
di: Pandey, Ashutosh, et al.
Pubblicazione: (2024)
Noise-Robust Contrastive Learning with an MFCC-Conformer For Coronary Artery Disease Detection
di: Marocchi, Milan, et al.
Pubblicazione: (2026)
di: Marocchi, Milan, et al.
Pubblicazione: (2026)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
di: Honda, Tomoki, et al.
Pubblicazione: (2024)
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications
di: Pulikodan, Sujith, et al.
Pubblicazione: (2025)
di: Pulikodan, Sujith, et al.
Pubblicazione: (2025)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
di: Huang, He, et al.
Pubblicazione: (2024)
di: Huang, He, et al.
Pubblicazione: (2024)
WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation
di: Han, Lu, et al.
Pubblicazione: (2025)
di: Han, Lu, et al.
Pubblicazione: (2025)
A Multi-stage Low-latency Enhancement System for Hearing Aids
di: Ouyang, Chengwei, et al.
Pubblicazione: (2025)
di: Ouyang, Chengwei, et al.
Pubblicazione: (2025)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
Self-Supervised Learning of Spatial Acoustic Representation with Cross-Channel Signal Reconstruction and Multi-Channel Conformer
di: Yang, Bing, et al.
Pubblicazione: (2023)
di: Yang, Bing, et al.
Pubblicazione: (2023)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Efficient Scaling for LLM-based ASR
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
di: Liu, Hanwen, et al.
Pubblicazione: (2026)
Multi-stream Convolutional Neural Network with Frequency Selection for Robust Speaker Verification
di: Yao, Wei, et al.
Pubblicazione: (2020)
di: Yao, Wei, et al.
Pubblicazione: (2020)
asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024) -
SpeechVerse: A Large-scale Generalizable Audio Language Model
di: Das, Nilaksh, et al.
Pubblicazione: (2024) -
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024) -
Unifying Streaming and Non-streaming Zipformer-based ASR
di: Sharma, Bidisha, et al.
Pubblicazione: (2025) -
A low latency attention module for streaming self-supervised speech representation learning
di: Ma, Jianbo, et al.
Pubblicazione: (2023)