Enhancing Whisper's Accuracy and Speed for Indian Languages through Prompt-Tuning and Tokenization
Fuente:
arXiv
Guardado en:
| Autores principales: | Tripathi, Kumud, Gothi, Raj, Wasnik, Pankaj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
por: Tripathi, Kumud, et al.
Publicado: (2025)
por: Tripathi, Kumud, et al.
Publicado: (2025)
Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-resource Speech Recognition
por: Menon, Aditya Srinivas, et al.
Publicado: (2026)
por: Menon, Aditya Srinivas, et al.
Publicado: (2026)
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
por: Hu, Rui, et al.
Publicado: (2025)
por: Hu, Rui, et al.
Publicado: (2025)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
por: Yang, Chih-Kai, et al.
Publicado: (2024)
por: Yang, Chih-Kai, et al.
Publicado: (2024)
WhisperRT -- Turning Whisper into a Causal Streaming Model
por: Krichli, Tomer, et al.
Publicado: (2025)
por: Krichli, Tomer, et al.
Publicado: (2025)
Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding
por: Zhao, Jiahui, et al.
Publicado: (2024)
por: Zhao, Jiahui, et al.
Publicado: (2024)
Fine-tuning Whisper on Low-Resource Languages for Real-World Applications
por: Timmel, Vincenzo, et al.
Publicado: (2024)
por: Timmel, Vincenzo, et al.
Publicado: (2024)
One Whisper to Grade Them All
por: Phan, Nhan, et al.
Publicado: (2025)
por: Phan, Nhan, et al.
Publicado: (2025)
Whisper Has an Internal Word Aligner
por: Yeh, Sung-Lin, et al.
Publicado: (2025)
por: Yeh, Sung-Lin, et al.
Publicado: (2025)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
por: Waheed, Abdul, et al.
Publicado: (2024)
por: Waheed, Abdul, et al.
Publicado: (2024)
Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
por: Özyilmaz, Ömer Tarik, et al.
Publicado: (2025)
por: Özyilmaz, Ömer Tarik, et al.
Publicado: (2025)
PhoWhisper: Automatic Speech Recognition for Vietnamese
por: Le, Thanh-Thien, et al.
Publicado: (2024)
por: Le, Thanh-Thien, et al.
Publicado: (2024)
Adapting Whisper for Parameter-efficient Code-Switching Speech Recognition via Soft Prompt Tuning
por: Yang, Hongli, et al.
Publicado: (2025)
por: Yang, Hongli, et al.
Publicado: (2025)
POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
por: Li, Chin-Jou, et al.
Publicado: (2025)
por: Li, Chin-Jou, et al.
Publicado: (2025)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
por: Ma, Yingyi, et al.
Publicado: (2024)
por: Ma, Yingyi, et al.
Publicado: (2024)
Deepfake Word Detection by Next-token Prediction using Fine-tuned Whisper
por: Tran, Hoan My, et al.
Publicado: (2026)
por: Tran, Hoan My, et al.
Publicado: (2026)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
por: Cui, Ziyun, et al.
Publicado: (2024)
por: Cui, Ziyun, et al.
Publicado: (2024)
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text
por: Li, Jinpeng, et al.
Publicado: (2024)
por: Li, Jinpeng, et al.
Publicado: (2024)
Enhancing Aviation Communication Transcription: Fine-Tuning Distil-Whisper with LoRA
por: Mirzaei, Shokoufeh, et al.
Publicado: (2025)
por: Mirzaei, Shokoufeh, et al.
Publicado: (2025)
Scaling Spoken Language Models with Syllabic Speech Tokenization
por: Lee, Nicholas, et al.
Publicado: (2025)
por: Lee, Nicholas, et al.
Publicado: (2025)
Unified Pathological Speech Analysis with Prompt Tuning
por: Yang, Fei, et al.
Publicado: (2024)
por: Yang, Fei, et al.
Publicado: (2024)
Enhancing Speech Large Language Models through Reinforced Behavior Alignment
por: Liu, Yansong, et al.
Publicado: (2025)
por: Liu, Yansong, et al.
Publicado: (2025)
Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning
por: Mhaskar, Shivam Ratnakant, et al.
Publicado: (2024)
por: Mhaskar, Shivam Ratnakant, et al.
Publicado: (2024)
Transfer Learning from Whisper for Microscopic Intelligibility Prediction
por: Best, Paul, et al.
Publicado: (2024)
por: Best, Paul, et al.
Publicado: (2024)
Can Whisper perform speech-based in-context learning?
por: Wang, Siyin, et al.
Publicado: (2023)
por: Wang, Siyin, et al.
Publicado: (2023)
Extending Whisper with prompt tuning to target-speaker ASR
por: Ma, Hao, et al.
Publicado: (2023)
por: Ma, Hao, et al.
Publicado: (2023)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
por: Ferraz, Thomas Palmeira, et al.
Publicado: (2023)
por: Ferraz, Thomas Palmeira, et al.
Publicado: (2023)
OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
por: Anidjar, Or Haim, et al.
Publicado: (2024)
por: Anidjar, Or Haim, et al.
Publicado: (2024)
kNN For Whisper And Its Effect On Bias And Speaker Adaptation
por: Nachesa, Maya K., et al.
Publicado: (2024)
por: Nachesa, Maya K., et al.
Publicado: (2024)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling
por: Visser, Nicol, et al.
Publicado: (2026)
por: Visser, Nicol, et al.
Publicado: (2026)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
por: Thorbecke, Iuliia, et al.
Publicado: (2024)
por: Thorbecke, Iuliia, et al.
Publicado: (2024)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
por: Shao, Hang, et al.
Publicado: (2023)
por: Shao, Hang, et al.
Publicado: (2023)
Quantizing Whisper-small: How design choices affect ASR performance
por: Söhler, Arthur, et al.
Publicado: (2025)
por: Söhler, Arthur, et al.
Publicado: (2025)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
por: Orhon, Atila, et al.
Publicado: (2025)
por: Orhon, Atila, et al.
Publicado: (2025)
Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?
por: Dasare, Ashwini, et al.
Publicado: (2026)
por: Dasare, Ashwini, et al.
Publicado: (2026)
Prompting Large Language Models with Audio for General-Purpose Speech Summarization
por: Kang, Wonjune, et al.
Publicado: (2024)
por: Kang, Wonjune, et al.
Publicado: (2024)
Ejemplares similares
-
Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion
por: Tripathi, Kumud, et al.
Publicado: (2025) -
Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-resource Speech Recognition
por: Menon, Aditya Srinivas, et al.
Publicado: (2026) -
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
por: Hu, Rui, et al.
Publicado: (2025) -
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
por: Yang, Chih-Kai, et al.
Publicado: (2024) -
WhisperRT -- Turning Whisper into a Causal Streaming Model
por: Krichli, Tomer, et al.
Publicado: (2025)