Pretraining Multi-Speaker Identification for Neural Speaker Diarization
Fuente:
arXiv
Guardado en:
| Autores principales: | Horiguchi, Shota, Ando, Atsushi, Delcroix, Marc, Tawara, Naohiro |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
Mamba-based Segmentation Model for Speaker Diarization
por: Plaquet, Alexis, et al.
Publicado: (2024)
por: Plaquet, Alexis, et al.
Publicado: (2024)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
por: Horiguchi, Shota, et al.
Publicado: (2025)
por: Horiguchi, Shota, et al.
Publicado: (2025)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
por: Horiguchi, Shota, et al.
Publicado: (2024)
por: Horiguchi, Shota, et al.
Publicado: (2024)
Guided Speaker Embedding
por: Horiguchi, Shota, et al.
Publicado: (2024)
por: Horiguchi, Shota, et al.
Publicado: (2024)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
por: Plaquet, Alexis, et al.
Publicado: (2025)
por: Plaquet, Alexis, et al.
Publicado: (2025)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
por: Sato, Hiroshi, et al.
Publicado: (2024)
por: Sato, Hiroshi, et al.
Publicado: (2024)
Investigation of Speaker Representation for Target-Speaker Speech Processing
por: Ashihara, Takanori, et al.
Publicado: (2024)
por: Ashihara, Takanori, et al.
Publicado: (2024)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
por: Pálka, Petr, et al.
Publicado: (2024)
por: Pálka, Petr, et al.
Publicado: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
por: McKnight, Simon W., et al.
Publicado: (2023)
por: McKnight, Simon W., et al.
Publicado: (2023)
USED: Universal Speaker Extraction and Diarization
por: Ao, Junyi, et al.
Publicado: (2023)
por: Ao, Junyi, et al.
Publicado: (2023)
Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers
por: Tammen, Marvin, et al.
Publicado: (2024)
por: Tammen, Marvin, et al.
Publicado: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
por: Thienpondt, Jenthe, et al.
Publicado: (2024)
VBx for End-to-End Neural and Clustering-based Diarization
por: Pálka, Petr, et al.
Publicado: (2025)
por: Pálka, Petr, et al.
Publicado: (2025)
Leveraging Self-Supervised Learning for Speaker Diarization
por: Han, Jiangyu, et al.
Publicado: (2024)
por: Han, Jiangyu, et al.
Publicado: (2024)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
por: Medennikov, Ivan, et al.
Publicado: (2025)
por: Medennikov, Ivan, et al.
Publicado: (2025)
Interaural time difference loss for binaural target sound extraction
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
por: Alvarez-Trejos, Juan Ignacio, et al.
Publicado: (2024)
Multi-Stage Speaker Diarization for Noisy Classrooms
por: Khan, Ali Sartaz, et al.
Publicado: (2025)
por: Khan, Ali Sartaz, et al.
Publicado: (2025)
Incorporating Spatial Cues in Modular Speaker Diarization for Multi-channel Multi-party Meetings
por: Wang, Ruoyu, et al.
Publicado: (2024)
por: Wang, Ruoyu, et al.
Publicado: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
por: Zhang, Lin, et al.
Publicado: (2024)
por: Zhang, Lin, et al.
Publicado: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
por: Shakeel, Muhammad, et al.
Publicado: (2025)
por: Shakeel, Muhammad, et al.
Publicado: (2025)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
por: Hernandez-Olivan, Carlos, et al.
Publicado: (2024)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
por: Boeddeker, Christoph, et al.
Publicado: (2023)
por: Boeddeker, Christoph, et al.
Publicado: (2023)
Factor-Conditioned Speaking-Style Captioning
por: Ando, Atsushi, et al.
Publicado: (2024)
por: Ando, Atsushi, et al.
Publicado: (2024)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
por: Xu, Anfeng, et al.
Publicado: (2026)
por: Xu, Anfeng, et al.
Publicado: (2026)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
por: Tabib, H. M. Shadman, et al.
Publicado: (2026)
por: Tabib, H. M. Shadman, et al.
Publicado: (2026)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
por: Fujita, Kenichi, et al.
Publicado: (2024)
por: Fujita, Kenichi, et al.
Publicado: (2024)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
por: Wang, Quan, et al.
Publicado: (2024)
por: Wang, Quan, et al.
Publicado: (2024)
Language Modelling for Speaker Diarization in Telephonic Interviews
por: India, Miquel, et al.
Publicado: (2025)
por: India, Miquel, et al.
Publicado: (2025)
Investigating Confidence Estimation Measures for Speaker Diarization
por: Chowdhury, Anurag, et al.
Publicado: (2024)
por: Chowdhury, Anurag, et al.
Publicado: (2024)
From Modular to End-to-End Speaker Diarization
por: Landini, Federico
Publicado: (2024)
por: Landini, Federico
Publicado: (2024)
NTT Multi-Speaker ASR System for the DASR Task of CHiME-8 Challenge
por: Kamo, Naoyuki, et al.
Publicado: (2024)
por: Kamo, Naoyuki, et al.
Publicado: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
Multi-Label Training for Text-Independent Speaker Identification
por: Xue, Yuqi
Publicado: (2022)
por: Xue, Yuqi
Publicado: (2022)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
Frontend Token Enhancement for Token-Based Speech Recognition
por: Ashihara, Takanori, et al.
Publicado: (2026)
por: Ashihara, Takanori, et al.
Publicado: (2026)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2025)
por: Dai, Yuhang, et al.
Publicado: (2025)
Ejemplares similares
-
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
por: Horiguchi, Shota, et al.
Publicado: (2025) -
Mamba-based Segmentation Model for Speaker Diarization
por: Plaquet, Alexis, et al.
Publicado: (2024) -
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
por: Horiguchi, Shota, et al.
Publicado: (2025) -
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
por: Horiguchi, Shota, et al.
Publicado: (2024) -
Guided Speaker Embedding
por: Horiguchi, Shota, et al.
Publicado: (2024)