XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kumar, Shashi, Madikeri, Srikanth, Zuluaga-Gomez, Juan, Villatoro-Tello, Esaú, Thorbecke, Iuliia, Motlicek, Petr, E, Manjunath K, Ganapathiraju, Aravind |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
Unifying Global and Near-Context Biasing in a Single Trie Pass
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Text-only adaptation in LLM-based ASR through text denoising
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection
di: Burdisso, Sergio, et al.
Pubblicazione: (2026)
di: Burdisso, Sergio, et al.
Pubblicazione: (2026)
Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
di: Kumar, Shashi, et al.
Pubblicazione: (2026)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
di: Kumar, Shashi, et al.
Pubblicazione: (2025)
Adaptive Multimodal Person Recognition: A Robust Framework for Handling Missing Modalities
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
A Differentiable Alignment Framework for Sequence-to-Sequence Modeling via Optimal Transport
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews
di: Watawana, Hasindri, et al.
Pubblicazione: (2026)
di: Watawana, Hasindri, et al.
Pubblicazione: (2026)
Node-weighted Graph Convolutional Network for Depression Detection in Transcribed Clinical Interviews
di: Burdisso, Sergio, et al.
Pubblicazione: (2023)
di: Burdisso, Sergio, et al.
Pubblicazione: (2023)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
Promptformer: Prompted Conformer Transducer for ASR
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
Unifying Streaming and Non-streaming Zipformer-based ASR
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection
di: Xiao, Yang, et al.
Pubblicazione: (2024)
di: Xiao, Yang, et al.
Pubblicazione: (2024)
XLSR-MamBo: Scaling the Hybrid Mamba-Attention Backbone for Audio Deepfake Detection
di: Ng, Kwok-Ho, et al.
Pubblicazione: (2026)
di: Ng, Kwok-Ho, et al.
Pubblicazione: (2026)
Spoofing-Aware Speaker Verification via Wavelet Prompt Tuning and Multi-Model Ensembles
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
di: C, Anandh, et al.
Pubblicazione: (2025)
di: C, Anandh, et al.
Pubblicazione: (2025)
Self-Supervised Learning for Multi-Channel Neural Transducer
di: Kojima, Atsushi
Pubblicazione: (2024)
di: Kojima, Atsushi
Pubblicazione: (2024)
Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization
di: Andrusenko, Andrei, et al.
Pubblicazione: (2026)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2026)
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
CL-UZH submission to the NIST SRE 2024 Speaker Recognition Evaluation
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR
di: Biswas, Swadhin, et al.
Pubblicazione: (2025)
di: Biswas, Swadhin, et al.
Pubblicazione: (2025)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
di: Dat, Phuong Tuan, et al.
Pubblicazione: (2025)
di: Dat, Phuong Tuan, et al.
Pubblicazione: (2025)
Leveraging ASR Pretrained Conformers for Speaker Verification through Transfer Learning and Knowledge Distillation
di: Cai, Danwei, et al.
Pubblicazione: (2023)
di: Cai, Danwei, et al.
Pubblicazione: (2023)
Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
di: Lee, Hyeonseung, et al.
Pubblicazione: (2024)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
di: He, Xiluo, et al.
Pubblicazione: (2025)
di: He, Xiluo, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear Implant Simulation
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
di: Pražák, Aleš, et al.
Pubblicazione: (2025)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
di: Srivastava, Tejes, et al.
Pubblicazione: (2023)
Documenti analoghi
-
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
di: Kumar, Shashi, et al.
Pubblicazione: (2024) -
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024) -
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
di: Kumar, Shashi, et al.
Pubblicazione: (2024) -
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022) -
Unifying Global and Near-Context Biasing in a Single Trie Pass
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)