Promptformer: Prompted Conformer Transducer for ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Duarte-Torres, Sergio, Sen, Arunasish, Rana, Aman, Drude, Lukas, Gomez-Alanis, Alejandro, Schwarz, Andreas, Rädel, Leif, Leutnant, Volker |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound
par: Grötschla, Florian, et autres
Publié: (2026)
par: Grötschla, Florian, et autres
Publié: (2026)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
par: Thorbecke, Iuliia, et autres
Publié: (2024)
par: Thorbecke, Iuliia, et autres
Publié: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
par: Gong, Xun, et autres
Publié: (2024)
par: Gong, Xun, et autres
Publié: (2024)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
TDT-KWS: Fast And Accurate Keyword Spotting Using Token-and-duration Transducer
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
ProGRes: Prompted Generative Rescoring on ASR n-Best
par: Tur, Ada Defne, et autres
Publié: (2024)
par: Tur, Ada Defne, et autres
Publié: (2024)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
par: Wu, Minghui, et autres
Publié: (2024)
par: Wu, Minghui, et autres
Publié: (2024)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
persoDA: Personalized Data Augmentation for Personalized ASR
par: Parada, Pablo Peso, et autres
Publié: (2025)
par: Parada, Pablo Peso, et autres
Publié: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
Consistency Based Unsupervised Self-training For ASR Personalisation
par: Zhang, Jisi, et autres
Publié: (2024)
par: Zhang, Jisi, et autres
Publié: (2024)
Evolutionary Prompt Design for LLM-Based Post-ASR Error Correction
par: Sachdev, Rithik, et autres
Publié: (2024)
par: Sachdev, Rithik, et autres
Publié: (2024)
Echotune: A Modular Extractor Leveraging the Variable-Length Nature of Speech in ASR Tasks
par: Chen, Sizhou, et autres
Publié: (2023)
par: Chen, Sizhou, et autres
Publié: (2023)
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
par: Hong, Mengze, et autres
Publié: (2025)
par: Hong, Mengze, et autres
Publié: (2025)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
par: Mujtaba, Dena, et autres
Publié: (2025)
par: Mujtaba, Dena, et autres
Publié: (2025)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
par: Pražák, Aleš, et autres
Publié: (2025)
par: Pražák, Aleš, et autres
Publié: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
Complexity boosted adaptive training for better low resource ASR performance
par: Lu, Hongxuan, et autres
Publié: (2024)
par: Lu, Hongxuan, et autres
Publié: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
Efficient Rehearsal for Continual Learning in ASR via Singular Value Tuning
par: Eeckt, Steven Vander, et autres
Publié: (2026)
par: Eeckt, Steven Vander, et autres
Publié: (2026)
Documents similaires
-
VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound
par: Grötschla, Florian, et autres
Publié: (2026) -
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024) -
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
par: Thorbecke, Iuliia, et autres
Publié: (2024) -
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024) -
TokenVerse: Towards Unifying Speech and NLP Tasks via Transducer-based ASR
par: Kumar, Shashi, et autres
Publié: (2024)