Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
Fuente:
arXiv
Salvato in:
| Autori principali: | Pálka, Petr, Landini, Federico, Klement, Dominik, Diez, Mireia, Silnova, Anna, Delcroix, Marc, Burget, Lukáš |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023)
di: Landini, Federico, et al.
Pubblicazione: (2023)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
VBx for End-to-End Neural and Clustering-based Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2025)
di: Pálka, Petr, et al.
Pubblicazione: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Mamba-based Segmentation Model for Speaker Diarization
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
di: Klement, Dominik, et al.
Pubblicazione: (2025)
di: Klement, Dominik, et al.
Pubblicazione: (2025)
Analysis of ABC Frontend Audio Systems for the NIST-SRE24
di: Barahona, Sara, et al.
Pubblicazione: (2025)
di: Barahona, Sara, et al.
Pubblicazione: (2025)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
di: Hirano, Yuta, et al.
Pubblicazione: (2025)
di: Hirano, Yuta, et al.
Pubblicazione: (2025)
Prompting Whisper for Joint Speech Transcription and Diarization
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
di: Zamyrova, Mariia, et al.
Pubblicazione: (2026)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
di: Huang, Shangkun, et al.
Pubblicazione: (2025)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
di: Plaquet, Alexis, et al.
Pubblicazione: (2025)
di: Plaquet, Alexis, et al.
Pubblicazione: (2025)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
USED: Universal Speaker Extraction and Diarization
di: Ao, Junyi, et al.
Pubblicazione: (2023)
di: Ao, Junyi, et al.
Pubblicazione: (2023)
Investigation of Speaker Representation for Target-Speaker Speech Processing
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
di: Ashihara, Takanori, et al.
Pubblicazione: (2024)
Modeling Overlapped Speech with Shuffles
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
di: Wiesner, Matthew, et al.
Pubblicazione: (2026)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
BUT Systems and Analyses for the ASVspoof 5 Challenge
di: Rohdin, Johan, et al.
Pubblicazione: (2024)
di: Rohdin, Johan, et al.
Pubblicazione: (2024)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers
di: Tammen, Marvin, et al.
Pubblicazione: (2024)
di: Tammen, Marvin, et al.
Pubblicazione: (2024)
CA-MHFA: A Context-Aware Multi-Head Factorized Attentive Pooling for SSL-Based Speaker Verification
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024) -
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024) -
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023) -
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024) -
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025)