DiaPer: End-to-End Neural Diarization with Perceiver-Based Attractors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Landini, Federico, Diez, Mireia, Stafylakis, Themos, Burget, Lukáš |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
par: Zhang, Lin, et autres
Publié: (2024)
par: Zhang, Lin, et autres
Publié: (2024)
Leveraging Self-Supervised Learning for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2024)
par: Han, Jiangyu, et autres
Publié: (2024)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024)
par: Pálka, Petr, et autres
Publié: (2024)
From Modular to End-to-End Speaker Diarization
par: Landini, Federico
Publié: (2024)
par: Landini, Federico
Publié: (2024)
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
CA-MHFA: A Context-Aware Multi-Head Factorized Attentive Pooling for SSL-Based Speaker Verification
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
LS-EEND: Long-Form Streaming End-to-End Neural Diarization with Online Attractor Extraction
par: Liang, Di, et autres
Publié: (2024)
par: Liang, Di, et autres
Publié: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
par: Zhang, Lin, et autres
Publié: (2024)
par: Zhang, Lin, et autres
Publié: (2024)
VBx for End-to-End Neural and Clustering-based Diarization
par: Pálka, Petr, et autres
Publié: (2025)
par: Pálka, Petr, et autres
Publié: (2025)
Dissecting the Segmentation Model of End-to-End Diarization with Vector Clustering
par: Plaquet, Alexis, et autres
Publié: (2025)
par: Plaquet, Alexis, et autres
Publié: (2025)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
BUT Systems and Analyses for the ASVspoof 5 Challenge
par: Rohdin, Johan, et autres
Publié: (2024)
par: Rohdin, Johan, et autres
Publié: (2024)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
Fine-tune Before Structured Pruning: Towards Compact and Accurate Self-Supervised Models for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
Analysis of ABC Frontend Audio Systems for the NIST-SRE24
par: Barahona, Sara, et autres
Publié: (2025)
par: Barahona, Sara, et autres
Publié: (2025)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
par: Lee, PeiYing, et autres
Publié: (2024)
par: Lee, PeiYing, et autres
Publié: (2024)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
par: Munakata, Hokuto, et autres
Publié: (2024)
par: Munakata, Hokuto, et autres
Publié: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
par: Singh, Prachi, et autres
Publié: (2024)
par: Singh, Prachi, et autres
Publié: (2024)
Challenging margin-based speaker embedding extractors by using the variational information bottleneck
par: Stafylakis, Themos, et autres
Publié: (2024)
par: Stafylakis, Themos, et autres
Publié: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
par: Zhou, Junzuo, et autres
Publié: (2024)
par: Zhou, Junzuo, et autres
Publié: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
par: Lin, Wan, et autres
Publié: (2024)
par: Lin, Wan, et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
par: You, Zhenghai, et autres
Publié: (2025)
par: You, Zhenghai, et autres
Publié: (2025)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Efficient and Generalizable Speaker Diarization via Structured Pruning of Self-Supervised Models
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data
par: Barahona, Sara, et autres
Publié: (2024)
par: Barahona, Sara, et autres
Publié: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
par: Kang, Wonjune, et autres
Publié: (2022)
par: Kang, Wonjune, et autres
Publié: (2022)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
End-to-End Amp Modeling: From Data to Controllable Guitar Amplifier Models
par: Juvela, Lauri, et autres
Publié: (2024)
par: Juvela, Lauri, et autres
Publié: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis
par: Yu, Chin-Yun, et autres
Publié: (2024)
par: Yu, Chin-Yun, et autres
Publié: (2024)
Right Label Context in End-to-End Training of Time-Synchronous ASR Models
par: Raissi, Tina, et autres
Publié: (2025)
par: Raissi, Tina, et autres
Publié: (2025)
Documents similaires
-
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
par: Zhang, Lin, et autres
Publié: (2024) -
Leveraging Self-Supervised Learning for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2024) -
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024) -
From Modular to End-to-End Speaker Diarization
par: Landini, Federico
Publié: (2024) -
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)