SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
Fuente:
arXiv
Salvato in:
| Autori principali: | Pacheco, Eduardo, Orhon, Atila, Durmus, Berkin, Munyampirwa, Blaise, Leonov, Andrey |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
di: Orhon, Atila, et al.
Pubblicazione: (2025)
di: Orhon, Atila, et al.
Pubblicazione: (2025)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
di: Mariotte, Theo, et al.
Pubblicazione: (2024)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
di: Palzer, David, et al.
Pubblicazione: (2025)
di: Palzer, David, et al.
Pubblicazione: (2025)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
di: Bhuiyan, Mohammed Aman, et al.
Pubblicazione: (2026)
MOSS Transcribe Diarize Technical Report
di: AI, MOSI., et al.
Pubblicazione: (2026)
di: AI, MOSI., et al.
Pubblicazione: (2026)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
di: Marie, Ambre, et al.
Pubblicazione: (2026)
di: Marie, Ambre, et al.
Pubblicazione: (2026)
USED: Universal Speaker Extraction and Diarization
di: Ao, Junyi, et al.
Pubblicazione: (2023)
di: Ao, Junyi, et al.
Pubblicazione: (2023)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2026)
di: Tabib, H. M. Shadman, et al.
Pubblicazione: (2026)
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Mamba-based Segmentation Model for Speaker Diarization
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
di: Liu, Bei, et al.
Pubblicazione: (2024)
di: Liu, Bei, et al.
Pubblicazione: (2024)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
di: Gao, Ming, et al.
Pubblicazione: (2025)
di: Gao, Ming, et al.
Pubblicazione: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
Explainable Attribute-Based Speaker Verification
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
Certification of Speaker Recognition Models to Additive Perturbations
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
di: Wang, Rui, et al.
Pubblicazione: (2024)
di: Wang, Rui, et al.
Pubblicazione: (2024)
Evaluating Speaker Identity Coding in Self-supervised Models and Humans
di: Elbanna, Gasser
Pubblicazione: (2024)
di: Elbanna, Gasser
Pubblicazione: (2024)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
di: Wang, Quan, et al.
Pubblicazione: (2024)
di: Wang, Quan, et al.
Pubblicazione: (2024)
DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline
di: Raghav, Nikhil
Pubblicazione: (2026)
di: Raghav, Nikhil
Pubblicazione: (2026)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
di: Ma, Yi, et al.
Pubblicazione: (2025)
di: Ma, Yi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
di: Orhon, Atila, et al.
Pubblicazione: (2025) -
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024) -
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024) -
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024) -
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
di: Mariotte, Theo, et al.
Pubblicazione: (2024)