Extending Whisper with prompt tuning to target-speaker ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Hao, Peng, Zhiyuan, Shao, Mingjie, Li, Jing, Liu, Ju |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Quantizing Whisper-small: How design choices affect ASR performance
di: Söhler, Arthur, et al.
Pubblicazione: (2025)
di: Söhler, Arthur, et al.
Pubblicazione: (2025)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
di: Orhon, Atila, et al.
Pubblicazione: (2025)
di: Orhon, Atila, et al.
Pubblicazione: (2025)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
di: Özyilmaz, Ömer Tarik, et al.
Pubblicazione: (2025)
di: Özyilmaz, Ömer Tarik, et al.
Pubblicazione: (2025)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
You don't understand me!: Comparing ASR results for L1 and L2 speakers of Swedish
di: Cumbal, Ronald, et al.
Pubblicazione: (2024)
di: Cumbal, Ronald, et al.
Pubblicazione: (2024)
Hierarchical speaker representation for target speaker extraction
di: He, Shulin, et al.
Pubblicazione: (2022)
di: He, Shulin, et al.
Pubblicazione: (2022)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
di: Anidjar, Or Haim, et al.
Pubblicazione: (2024)
di: Anidjar, Or Haim, et al.
Pubblicazione: (2024)
Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Language-Queried Target Sound Extraction Without Parallel Training Data
di: Ma, Hao, et al.
Pubblicazione: (2024)
di: Ma, Hao, et al.
Pubblicazione: (2024)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
di: Shao, Hang, et al.
Pubblicazione: (2023)
di: Shao, Hang, et al.
Pubblicazione: (2023)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
di: Grossman, Raymond, et al.
Pubblicazione: (2025)
di: Grossman, Raymond, et al.
Pubblicazione: (2025)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
di: Liang, Siyu, et al.
Pubblicazione: (2025)
di: Liang, Siyu, et al.
Pubblicazione: (2025)
Improving curriculum learning for target speaker extraction with synthetic speakers
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
di: Li, Jiahong, et al.
Pubblicazione: (2025)
di: Li, Jiahong, et al.
Pubblicazione: (2025)
A Benchmark for Multi-speaker Anonymization
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
Adapting Whisper for Code-Switching through Encoding Refining and Language-Aware Decoding
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
di: Zhao, Jiahui, et al.
Pubblicazione: (2024)
PromptASR for contextualized ASR with controllable style
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
Muting Whisper: A Universal Acoustic Adversarial Attack on Speech Foundation Models
di: Raina, Vyas, et al.
Pubblicazione: (2024)
di: Raina, Vyas, et al.
Pubblicazione: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
The THUEE System Description for the IARPA OpenASR21 Challenge
di: Zhao, Jing, et al.
Pubblicazione: (2022)
di: Zhao, Jing, et al.
Pubblicazione: (2022)
An approach to optimize inference of the DIART speaker diarization pipeline
di: Aperdannier, Roman, et al.
Pubblicazione: (2024)
di: Aperdannier, Roman, et al.
Pubblicazione: (2024)
Target word activity detector: An approach to obtain ASR word boundaries without lexicon
di: Sivasankaran, Sunit, et al.
Pubblicazione: (2024)
di: Sivasankaran, Sunit, et al.
Pubblicazione: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
di: Geng, Xuelong, et al.
Pubblicazione: (2024)
ASR Error Correction using Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2024)
di: Ma, Rao, et al.
Pubblicazione: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
di: Zhuo, Le, et al.
Pubblicazione: (2023)
di: Zhuo, Le, et al.
Pubblicazione: (2023)
Qwen3-ASR Technical Report
di: Shi, Xian, et al.
Pubblicazione: (2026)
di: Shi, Xian, et al.
Pubblicazione: (2026)
LA-RAG:Enhancing LLM-based ASR Accuracy with Retrieval-Augmented Generation
di: Li, Shaojun, et al.
Pubblicazione: (2024)
di: Li, Shaojun, et al.
Pubblicazione: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
di: Xie, Yuan, et al.
Pubblicazione: (2026)
di: Xie, Yuan, et al.
Pubblicazione: (2026)
Mamba for Streaming ASR Combined with Unimodal Aggregation
di: Fang, Ying, et al.
Pubblicazione: (2024)
di: Fang, Ying, et al.
Pubblicazione: (2024)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Can Whisper perform speech-based in-context learning?
di: Wang, Siyin, et al.
Pubblicazione: (2023)
di: Wang, Siyin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024) -
Quantizing Whisper-small: How design choices affect ASR performance
di: Söhler, Arthur, et al.
Pubblicazione: (2025) -
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
di: Orhon, Atila, et al.
Pubblicazione: (2025) -
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
di: Özyilmaz, Ömer Tarik, et al.
Pubblicazione: (2025) -
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
di: Xu, Tianyi, et al.
Pubblicazione: (2024)