Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Jiangyu, Landini, Federico, Rohdin, Johan, Silnova, Anna, Diez, Mireia, Cernocky, Jan, Burget, Lukas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
di: Landini, Federico, et al.
Pubblicazione: (2023)
di: Landini, Federico, et al.
Pubblicazione: (2023)
Hybrid Pruning: In-Situ Compression of Self-Supervised Speech Models for Speaker Verification and Anti-Spoofing
di: Peng, Junyi, et al.
Pubblicazione: (2025)
di: Peng, Junyi, et al.
Pubblicazione: (2025)
Challenging margin-based speaker embedding extractors by using the variational information bottleneck
di: Stafylakis, Themos, et al.
Pubblicazione: (2024)
di: Stafylakis, Themos, et al.
Pubblicazione: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
di: Polok, Alexander, et al.
Pubblicazione: (2026)
di: Polok, Alexander, et al.
Pubblicazione: (2026)
On the Role of Spatial Features in Foundation-Model-Based Speaker Diarization
di: Deegen, Marc, et al.
Pubblicazione: (2026)
di: Deegen, Marc, et al.
Pubblicazione: (2026)
VBx for End-to-End Neural and Clustering-based Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2025)
di: Pálka, Petr, et al.
Pubblicazione: (2025)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2026)
di: Polok, Alexander, et al.
Pubblicazione: (2026)
BUT System for the MLC-SLM Challenge
di: Polok, Alexander, et al.
Pubblicazione: (2025)
di: Polok, Alexander, et al.
Pubblicazione: (2025)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Analysis of ABC Frontend Audio Systems for the NIST-SRE24
di: Barahona, Sara, et al.
Pubblicazione: (2025)
di: Barahona, Sara, et al.
Pubblicazione: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
BUT Systems and Analyses for the ASVspoof 5 Challenge
di: Rohdin, Johan, et al.
Pubblicazione: (2024)
di: Rohdin, Johan, et al.
Pubblicazione: (2024)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
On the Use of Self-Supervised Representation Learning for Speaker Diarization and Separation
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
CA-MHFA: A Context-Aware Multi-Head Factorized Attentive Pooling for SSL-Based Speaker Verification
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
Improving Automatic Speech Recognition with Decoder-Centric Regularisation in Encoder-Decoder Models
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
DeCRED: Decoder-Centric Regularization for Encoder-Decoder Based Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2025)
di: Polok, Alexander, et al.
Pubblicazione: (2025)
Bayesian Learning for Domain-Invariant Speaker Verification and Anti-Spoofing
di: Li, Jin, et al.
Pubblicazione: (2025)
di: Li, Jin, et al.
Pubblicazione: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data
di: Barahona, Sara, et al.
Pubblicazione: (2024)
di: Barahona, Sara, et al.
Pubblicazione: (2024)
Beyond the Labels: Unveiling Text-Dependency in Paralinguistic Speech Recognition Datasets
di: Pešán, Jan, et al.
Pubblicazione: (2024)
di: Pešán, Jan, et al.
Pubblicazione: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
di: Klement, Dominik, et al.
Pubblicazione: (2025)
di: Klement, Dominik, et al.
Pubblicazione: (2025)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
USED: Universal Speaker Extraction and Diarization
di: Ao, Junyi, et al.
Pubblicazione: (2023)
di: Ao, Junyi, et al.
Pubblicazione: (2023)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
WeDefense: A Toolkit to Defend Against Fake Audio
di: Zhang, Lin, et al.
Pubblicazione: (2026)
di: Zhang, Lin, et al.
Pubblicazione: (2026)
Mamba-based Segmentation Model for Speaker Diarization
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation
di: Cheng, Ming, et al.
Pubblicazione: (2024)
di: Cheng, Ming, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024) -
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025) -
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024) -
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024) -
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2025)