SALSA: Speedy ASR-LLM Synchronous Aggregation
Fuente:
arXiv
Salvato in:
| Autori principali: | Mittal, Ashish, Prabhu, Darshan, Sarawagi, Sunita, Jyothi, Preethi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
di: Prabhu, Darshan, et al.
Pubblicazione: (2024)
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
di: Shankar, Bhavani, et al.
Pubblicazione: (2024)
LASER: An LLM-based ASR Scoring and Evaluation Rubric
di: Parulekar, Amruta, et al.
Pubblicazione: (2025)
di: Parulekar, Amruta, et al.
Pubblicazione: (2025)
Contextualization of ASR with LLM using phonetic retrieval-based augmentation
di: Lei, Zhihong, et al.
Pubblicazione: (2024)
di: Lei, Zhihong, et al.
Pubblicazione: (2024)
Text-only adaptation in LLM-based ASR through text denoising
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
di: Carofilis, Andrés, et al.
Pubblicazione: (2026)
Anatomy of Industrial Scale Multilingual ASR
di: Ramirez, Francis McCann, et al.
Pubblicazione: (2024)
di: Ramirez, Francis McCann, et al.
Pubblicazione: (2024)
Beyond Transcription: Mechanistic Interpretability in ASR
di: Glazer, Neta, et al.
Pubblicazione: (2025)
di: Glazer, Neta, et al.
Pubblicazione: (2025)
Revisiting ASR Error Correction with Specialized Models
di: Gu, Zijin, et al.
Pubblicazione: (2024)
di: Gu, Zijin, et al.
Pubblicazione: (2024)
Federated Learning of Large ASR Models in the Real World
di: Xiao, Yonghui, et al.
Pubblicazione: (2024)
di: Xiao, Yonghui, et al.
Pubblicazione: (2024)
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2023)
di: Likhomanenko, Tatiana, et al.
Pubblicazione: (2023)
AMPS: ASR with Multimodal Paraphrase Supervision
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
di: Bai, Junwen, et al.
Pubblicazione: (2024)
di: Bai, Junwen, et al.
Pubblicazione: (2024)
Conversational Rubert for Detecting Competitive Interruptions in ASR-Transcribed Dialogues
di: Galimzianov, Dmitrii, et al.
Pubblicazione: (2024)
di: Galimzianov, Dmitrii, et al.
Pubblicazione: (2024)
Transformer-based Model for ASR N-Best Rescoring and Rewriting
di: Kang, Iwen E., et al.
Pubblicazione: (2024)
di: Kang, Iwen E., et al.
Pubblicazione: (2024)
Cross-utterance ASR Rescoring with Graph-based Label Propagation
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
Unified Learnable 2D Convolutional Feature Extraction for ASR
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
Mamba for Streaming ASR Combined with Unimodal Aggregation
di: Fang, Ying, et al.
Pubblicazione: (2024)
di: Fang, Ying, et al.
Pubblicazione: (2024)
Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping
di: Zhang, Kevin, et al.
Pubblicazione: (2024)
di: Zhang, Kevin, et al.
Pubblicazione: (2024)
Dysarthria Normalization via Local Lie Group Transformations for Robust ASR
di: Osipov, Mikhail
Pubblicazione: (2025)
di: Osipov, Mikhail
Pubblicazione: (2025)
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
di: Qian, Mengjie, et al.
Pubblicazione: (2024)
di: Qian, Mengjie, et al.
Pubblicazione: (2024)
Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
di: Dissen, Yehoshua, et al.
Pubblicazione: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Parameter-efficient Adaptation of Multilingual Multimodal Models for Low-resource ASR
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
di: Gupta, Abhishek, et al.
Pubblicazione: (2024)
A light-weight and efficient punctuation and word casing prediction model for on-device streaming ASR
di: You, Jian, et al.
Pubblicazione: (2024)
di: You, Jian, et al.
Pubblicazione: (2024)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
di: Fan, Xulin, et al.
Pubblicazione: (2026)
di: Fan, Xulin, et al.
Pubblicazione: (2026)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
di: Arisaputra, Panji, et al.
Pubblicazione: (2024)
di: Arisaputra, Panji, et al.
Pubblicazione: (2024)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance
di: Amooie, Reihaneh, et al.
Pubblicazione: (2025)
di: Amooie, Reihaneh, et al.
Pubblicazione: (2025)
Benchmarking Akan ASR Models Across Domain-Specific Datasets: A Comparative Evaluation of Performance, Scalability, and Adaptability
di: Mensah, Mark Atta, et al.
Pubblicazione: (2025)
di: Mensah, Mark Atta, et al.
Pubblicazione: (2025)
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system
di: Kopparapu, Sunil Kumar, et al.
Pubblicazione: (2024)
di: Kopparapu, Sunil Kumar, et al.
Pubblicazione: (2024)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
di: Veluri, Bandhav, et al.
Pubblicazione: (2024)
TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization
di: Quamer, Waris, et al.
Pubblicazione: (2026)
di: Quamer, Waris, et al.
Pubblicazione: (2026)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
di: Xie, Yuan, et al.
Pubblicazione: (2026)
di: Xie, Yuan, et al.
Pubblicazione: (2026)
An ASR-Based Tutor for Learning to Read: How to Optimize Feedback to First Graders
di: Bai, Yu, et al.
Pubblicazione: (2023)
di: Bai, Yu, et al.
Pubblicazione: (2023)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
di: Kothawade, Suraj, et al.
Pubblicazione: (2021)
Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
PromptASR for contextualized ASR with controllable style
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Multi-Convformer: Extending Conformer with Multiple Convolution Kernels
di: Prabhu, Darshan, et al.
Pubblicazione: (2024) -
Improving Self-supervised Pre-training using Accent-Specific Codebooks
di: Prabhu, Darshan, et al.
Pubblicazione: (2024) -
CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving
di: Shankar, Bhavani, et al.
Pubblicazione: (2024) -
LASER: An LLM-based ASR Scoring and Evaluation Rubric
di: Parulekar, Amruta, et al.
Pubblicazione: (2025) -
Contextualization of ASR with LLM using phonetic retrieval-based augmentation
di: Lei, Zhihong, et al.
Pubblicazione: (2024)