Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
Fuente:
arXiv
Guardado en:
| Autores principales: | Marie, Ambre, Bertin, Thomas, Dardenne, Guillaume, Quellec, Gwenolé |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Acoustic and Machine Learning Methods for Speech-Based Suicide Risk Assessment: A Systematic Review
por: Marie, Ambre, et al.
Publicado: (2025)
por: Marie, Ambre, et al.
Publicado: (2025)
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
por: Marie, Ambre, et al.
Publicado: (2025)
por: Marie, Ambre, et al.
Publicado: (2025)
From Modular to End-to-End Speaker Diarization
por: Landini, Federico
Publicado: (2024)
por: Landini, Federico
Publicado: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
por: Mariotte, Theo, et al.
Publicado: (2024)
por: Mariotte, Theo, et al.
Publicado: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
por: Pacheco, Eduardo, et al.
Publicado: (2025)
por: Pacheco, Eduardo, et al.
Publicado: (2025)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
por: Singh, Prachi, et al.
Publicado: (2024)
por: Singh, Prachi, et al.
Publicado: (2024)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
por: Saengthong, Phurich, et al.
Publicado: (2025)
por: Saengthong, Phurich, et al.
Publicado: (2025)
Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment
por: Hasan, Sanjid, et al.
Publicado: (2026)
por: Hasan, Sanjid, et al.
Publicado: (2026)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
por: Palzer, David, et al.
Publicado: (2025)
por: Palzer, David, et al.
Publicado: (2025)
Toward Automated Clinical Transcriptions
por: Klusty, Mitchell A., et al.
Publicado: (2024)
por: Klusty, Mitchell A., et al.
Publicado: (2024)
When Consistency Becomes Bias: Interviewer Effects in Semi-Structured Clinical Interviews
por: Watawana, Hasindri, et al.
Publicado: (2026)
por: Watawana, Hasindri, et al.
Publicado: (2026)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
por: Li, Zhaoyang, et al.
Publicado: (2025)
por: Li, Zhaoyang, et al.
Publicado: (2025)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
por: Thebaud, Thomas, et al.
Publicado: (2025)
por: Thebaud, Thomas, et al.
Publicado: (2025)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
por: Bhuiyan, Mohammed Aman, et al.
Publicado: (2026)
por: Bhuiyan, Mohammed Aman, et al.
Publicado: (2026)
Language Modelling for Speaker Diarization in Telephonic Interviews
por: India, Miquel, et al.
Publicado: (2025)
por: India, Miquel, et al.
Publicado: (2025)
A Review of Common Online Speaker Diarization Methods
por: Aperdannier, Roman, et al.
Publicado: (2024)
por: Aperdannier, Roman, et al.
Publicado: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
por: Shakeel, Muhammad, et al.
Publicado: (2025)
por: Shakeel, Muhammad, et al.
Publicado: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023)
por: Yang, Mu, et al.
Publicado: (2023)
System Description for the Displace Speaker Diarization Challenge 2023
por: Aliyev, Ali
Publicado: (2024)
por: Aliyev, Ali
Publicado: (2024)
Mamba-based Segmentation Model for Speaker Diarization
por: Plaquet, Alexis, et al.
Publicado: (2024)
por: Plaquet, Alexis, et al.
Publicado: (2024)
Systematic Evaluation of Online Speaker Diarization Systems Regarding their Latency
por: Aperdannier, Roman, et al.
Publicado: (2024)
por: Aperdannier, Roman, et al.
Publicado: (2024)
MOSS Transcribe Diarize Technical Report
por: AI, MOSI., et al.
Publicado: (2026)
por: AI, MOSI., et al.
Publicado: (2026)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
por: Cheng, Luyao, et al.
Publicado: (2023)
por: Cheng, Luyao, et al.
Publicado: (2023)
USED: Universal Speaker Extraction and Diarization
por: Ao, Junyi, et al.
Publicado: (2023)
por: Ao, Junyi, et al.
Publicado: (2023)
Using LLM for Real-Time Transcription and Summarization of Doctor-Patient Interactions into ePuskesmas in Indonesia: A Proof-of-Concept Study
por: Khatim, Nur Ahmad, et al.
Publicado: (2024)
por: Khatim, Nur Ahmad, et al.
Publicado: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
Prompting Whisper for Joint Speech Transcription and Diarization
por: Zamyrova, Mariia, et al.
Publicado: (2026)
por: Zamyrova, Mariia, et al.
Publicado: (2026)
Leveraging Self-Supervised Learning for Speaker Diarization
por: Han, Jiangyu, et al.
Publicado: (2024)
por: Han, Jiangyu, et al.
Publicado: (2024)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
por: Wang, Wenbin, et al.
Publicado: (2024)
por: Wang, Wenbin, et al.
Publicado: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
por: Kang, Jiawen, et al.
Publicado: (2024)
por: Kang, Jiawen, et al.
Publicado: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
por: Hirano, Yuta, et al.
Publicado: (2025)
por: Hirano, Yuta, et al.
Publicado: (2025)
Smooth Operators: LLMs Translating Imperfect Hints into Disfluency-Rich Transcripts
por: Altinok, Duygu
Publicado: (2025)
por: Altinok, Duygu
Publicado: (2025)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
por: Toyin, Hawau Olamide, et al.
Publicado: (2025)
por: Toyin, Hawau Olamide, et al.
Publicado: (2025)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
por: Li, Shuhe, et al.
Publicado: (2025)
por: Li, Shuhe, et al.
Publicado: (2025)
NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription
por: Vinnikov, Alon, et al.
Publicado: (2024)
por: Vinnikov, Alon, et al.
Publicado: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
por: Chen, Hongjie, et al.
Publicado: (2025)
por: Chen, Hongjie, et al.
Publicado: (2025)
Ejemplares similares
-
Acoustic and Machine Learning Methods for Speech-Based Suicide Risk Assessment: A Systematic Review
por: Marie, Ambre, et al.
Publicado: (2025) -
Suicide Risk Assessment Using Multimodal Speech Features: A Study on the SW1 Challenge Dataset
por: Marie, Ambre, et al.
Publicado: (2025) -
From Modular to End-to-End Speaker Diarization
por: Landini, Federico
Publicado: (2024) -
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
por: Mariotte, Theo, et al.
Publicado: (2024) -
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)