Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Ming, Lin, Yuke, Li, Ming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
di: Lin, Yuke, et al.
Pubblicazione: (2025)
di: Lin, Yuke, et al.
Pubblicazione: (2025)
Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings
di: Li, Li, et al.
Pubblicazione: (2025)
di: Li, Li, et al.
Pubblicazione: (2025)
Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge
di: Cheng, Ming, et al.
Pubblicazione: (2025)
di: Cheng, Ming, et al.
Pubblicazione: (2025)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
di: Cheng, Ming, et al.
Pubblicazione: (2024)
di: Cheng, Ming, et al.
Pubblicazione: (2024)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
di: Lin, Yuke, et al.
Pubblicazione: (2025)
di: Lin, Yuke, et al.
Pubblicazione: (2025)
VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
di: Lin, Yuke, et al.
Pubblicazione: (2024)
di: Lin, Yuke, et al.
Pubblicazione: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
On the Use of Self-Supervised Representation Learning for Speaker Diarization and Separation
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
di: Baroudi, Séverin, et al.
Pubblicazione: (2025)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
di: Zhou, Huali, et al.
Pubblicazione: (2024)
di: Zhou, Huali, et al.
Pubblicazione: (2024)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
USED: Universal Speaker Extraction and Diarization
di: Ao, Junyi, et al.
Pubblicazione: (2023)
di: Ao, Junyi, et al.
Pubblicazione: (2023)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
The Database and Benchmark for the Source Speaker Tracing Challenge 2024
di: Li, Ze, et al.
Pubblicazione: (2024)
di: Li, Ze, et al.
Pubblicazione: (2024)
3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Data Efficient Child-Adult Speaker Diarization with Simulated Conversations
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
di: Xu, Anfeng, et al.
Pubblicazione: (2024)
On the Role of Spatial Features in Foundation-Model-Based Speaker Diarization
di: Deegen, Marc, et al.
Pubblicazione: (2026)
di: Deegen, Marc, et al.
Pubblicazione: (2026)
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Mamba-based Segmentation Model for Speaker Diarization
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
di: Morrone, Giovanni, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
di: Li, Ze, et al.
Pubblicazione: (2025)
di: Li, Ze, et al.
Pubblicazione: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
TalTech-IRIT-LIS Speaker and Language Diarization Systems for DISPLACE 2024
di: Kalda, Joonas, et al.
Pubblicazione: (2024)
di: Kalda, Joonas, et al.
Pubblicazione: (2024)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
di: Han, Jiangyu, et al.
Pubblicazione: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
di: Polok, Alexander, et al.
Pubblicazione: (2026)
di: Polok, Alexander, et al.
Pubblicazione: (2026)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
di: Wang, Quan, et al.
Pubblicazione: (2024)
di: Wang, Quan, et al.
Pubblicazione: (2024)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
di: Boeddeker, Christoph, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
di: Lin, Yuke, et al.
Pubblicazione: (2025) -
Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings
di: Li, Li, et al.
Pubblicazione: (2025) -
Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge
di: Cheng, Ming, et al.
Pubblicazione: (2025) -
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
di: Cheng, Ming, et al.
Pubblicazione: (2024) -
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
di: Lin, Yuke, et al.
Pubblicazione: (2025)