Salvato in:
| Autori principali: | Yin, Han, Chen, Yafeng, Deng, Chong, Cheng, Luyao, Wang, Hui, Tan, Chao-Hong, Chen, Qian, Wang, Wen, Li, Xiangang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2508.06372 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2026)
di: Dai, Yuhang, et al.
Pubblicazione: (2026)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
di: Cheng, Luyao, et al.
Pubblicazione: (2024)
di: Cheng, Luyao, et al.
Pubblicazione: (2024)
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
di: Cheng, Luyao, et al.
Pubblicazione: (2023)
di: Cheng, Luyao, et al.
Pubblicazione: (2023)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)
di: Landini, Federico
Pubblicazione: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
di: He, Mao-Kui, et al.
Pubblicazione: (2024)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
di: Wang, Quan, et al.
Pubblicazione: (2024)
di: Wang, Quan, et al.
Pubblicazione: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
di: Singh, Prachi, et al.
Pubblicazione: (2024)
di: Singh, Prachi, et al.
Pubblicazione: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
di: Hirano, Yuta, et al.
Pubblicazione: (2025)
di: Hirano, Yuta, et al.
Pubblicazione: (2025)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
di: Gruttadauria, Elio, et al.
Pubblicazione: (2025)
di: Gruttadauria, Elio, et al.
Pubblicazione: (2025)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
di: Lin, Wan, et al.
Pubblicazione: (2024)
di: Lin, Wan, et al.
Pubblicazione: (2024)
Exploring Speaker Diarization with Mixture of Experts
di: Yang, Gaobin, et al.
Pubblicazione: (2025)
di: Yang, Gaobin, et al.
Pubblicazione: (2025)
USED: Universal Speaker Extraction and Diarization
di: Ao, Junyi, et al.
Pubblicazione: (2023)
di: Ao, Junyi, et al.
Pubblicazione: (2023)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
di: Peng, Jing, et al.
Pubblicazione: (2026)
di: Peng, Jing, et al.
Pubblicazione: (2026)
Speaker Adaptation for Quantised End-to-End ASR Models
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
di: Li, Shaojun, et al.
Pubblicazione: (2024)
di: Li, Shaojun, et al.
Pubblicazione: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization
di: Chen, Yafeng, et al.
Pubblicazione: (2025)
di: Chen, Yafeng, et al.
Pubblicazione: (2025)
Pushing the Limits of End-to-End Diarization
di: Broughton, Samuel J., et al.
Pubblicazione: (2025)
di: Broughton, Samuel J., et al.
Pubblicazione: (2025)
SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
di: Zhao, Qiuming, et al.
Pubblicazione: (2024)
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling
di: Jalal, Md Asif, et al.
Pubblicazione: (2025)
di: Jalal, Md Asif, et al.
Pubblicazione: (2025)
Dual-Strategy-Enhanced ConBiMamba for Neural Speaker Diarization
di: Liao, Zhen, et al.
Pubblicazione: (2026)
di: Liao, Zhen, et al.
Pubblicazione: (2026)
Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Mamba-based Segmentation Model for Speaker Diarization
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
di: Plaquet, Alexis, et al.
Pubblicazione: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
di: Dai, Yuhang, et al.
Pubblicazione: (2025)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition
di: Dai, Yuhang, et al.
Pubblicazione: (2026) -
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
di: Cheng, Luyao, et al.
Pubblicazione: (2024) -
Improving Speaker Diarization using Semantic Information: Joint Pairwise Constraints Propagation
di: Cheng, Luyao, et al.
Pubblicazione: (2023) -
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2023) -
From Modular to End-to-End Speaker Diarization
di: Landini, Federico
Pubblicazione: (2024)