Prompting Whisper for Joint Speech Transcription and Diarization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zamyrova, Mariia, Heuvel, Henk van den |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper
di: Syed, Jaza, et al.
Pubblicazione: (2025)
di: Syed, Jaza, et al.
Pubblicazione: (2025)
Speech Technology Services for Oral History Research
di: Draxler, Christoph, et al.
Pubblicazione: (2024)
di: Draxler, Christoph, et al.
Pubblicazione: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
Probing Whisper for Dysarthric Speech in Detection and Assessment
di: Yue, Zhengjun, et al.
Pubblicazione: (2025)
di: Yue, Zhengjun, et al.
Pubblicazione: (2025)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
mmWave-Whisper: Phone Call Eavesdropping and Transcription Using Millimeter-Wave Radar
di: Basak, Suryoday, et al.
Pubblicazione: (2024)
di: Basak, Suryoday, et al.
Pubblicazione: (2024)
A Study on Incorporating Whisper for Robust Speech Assessment
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2023)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
di: Li, Yangze, et al.
Pubblicazione: (2024)
di: Li, Yangze, et al.
Pubblicazione: (2024)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
di: Lee, PeiYing, et al.
Pubblicazione: (2024)
di: Lee, PeiYing, et al.
Pubblicazione: (2024)
Continuous Target Speech Extraction: Enhancing Personalized Diarization and Extraction on Complex Recordings
di: Zhao, He, et al.
Pubblicazione: (2024)
di: Zhao, He, et al.
Pubblicazione: (2024)
WhispEar: A Bi-directional Framework for Scaling Whispered Speech Conversion via Pseudo-Parallel Whisper Generation
di: Fang, Zihao, et al.
Pubblicazione: (2026)
di: Fang, Zihao, et al.
Pubblicazione: (2026)
Sparsely Shared LoRA on Whisper for Child Speech Recognition
di: Liu, Wei, et al.
Pubblicazione: (2023)
di: Liu, Wei, et al.
Pubblicazione: (2023)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
di: Tian, Jingguang, et al.
Pubblicazione: (2024)
Speech Diarization and ASR with GMM
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
di: Shao, Hang, et al.
Pubblicazione: (2023)
di: Shao, Hang, et al.
Pubblicazione: (2023)
Speech Intelligibility Assessment with Uncertainty-Aware Whisper Embeddings and sLSTM
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2025)
di: Zezario, Ryandhimas E., et al.
Pubblicazione: (2025)
Adapting Whisper for Streaming Speech Recognition via Two-Pass Decoding
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding
di: Boccato, Tommaso, et al.
Pubblicazione: (2026)
di: Boccato, Tommaso, et al.
Pubblicazione: (2026)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2026)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2026)
Improving Whispered Speech Recognition Performance using Pseudo-whispered based Data Augmentation
di: Lin, Zhaofeng, et al.
Pubblicazione: (2023)
di: Lin, Zhaofeng, et al.
Pubblicazione: (2023)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
di: Tang, Haobin, et al.
Pubblicazione: (2024)
di: Tang, Haobin, et al.
Pubblicazione: (2024)
DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
di: Niu, Shu-Tong, et al.
Pubblicazione: (2024)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
di: Zhang, Li, et al.
Pubblicazione: (2024)
di: Zhang, Li, et al.
Pubblicazione: (2024)
Application of Whisper in Clinical Practice: the Post-Stroke Speech Assessment during a Naming Task
di: Davudova, Milena, et al.
Pubblicazione: (2025)
di: Davudova, Milena, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023) -
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024) -
Transcript-Prompted Whisper with Dictionary-Enhanced Decoding for Japanese Speech Annotation
di: Hu, Rui, et al.
Pubblicazione: (2025) -
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024) -
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)