Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhaoyang, Zhou, Haodong, Luo, Longjie, Li, Xiaoxiao, Chen, Yongxin, Li, Lin, Hong, Qingyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
par: Luo, Longjie, et autres
Publié: (2025)
par: Luo, Longjie, et autres
Publié: (2025)
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
par: Li, Zhaoyang, et autres
Publié: (2025)
par: Li, Zhaoyang, et autres
Publié: (2025)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
par: Huang, Shangkun, et autres
Publié: (2025)
par: Huang, Shangkun, et autres
Publié: (2025)
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
par: Luo, Longjie, et autres
Publié: (2025)
par: Luo, Longjie, et autres
Publié: (2025)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)
par: Gao, Ming, et autres
Publié: (2025)
Continual Audio Deepfake Detection via Universal Adversarial Perturbation
par: Li, Wangjie, et autres
Publié: (2025)
par: Li, Wangjie, et autres
Publié: (2025)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
par: Mingote, Victoria, et autres
Publié: (2024)
par: Mingote, Victoria, et autres
Publié: (2024)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
par: Yin, Han, et autres
Publié: (2025)
par: Yin, Han, et autres
Publié: (2025)
Leveraging Self-Supervised Learning for Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2024)
par: Han, Jiangyu, et autres
Publié: (2024)
USED: Universal Speaker Extraction and Diarization
par: Ao, Junyi, et autres
Publié: (2023)
par: Ao, Junyi, et autres
Publié: (2023)
Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization
par: Cheng, Luyao, et autres
Publié: (2024)
par: Cheng, Luyao, et autres
Publié: (2024)
Exploring Speaker Diarization with Mixture of Experts
par: Yang, Gaobin, et autres
Publié: (2025)
par: Yang, Gaobin, et autres
Publié: (2025)
Joint Learning Global-Local Speaker Classification to Enhance End-to-End Speaker Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
par: He, Mao-Kui, et autres
Publié: (2024)
par: He, Mao-Kui, et autres
Publié: (2024)
System Description for the Displace Speaker Diarization Challenge 2023
par: Aliyev, Ali
Publié: (2024)
par: Aliyev, Ali
Publié: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
par: Mariotte, Theo, et autres
Publié: (2024)
par: Mariotte, Theo, et autres
Publié: (2024)
Incorporating Spatial Cues in Modular Speaker Diarization for Multi-channel Multi-party Meetings
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Dual-Strategy-Enhanced ConBiMamba for Neural Speaker Diarization
par: Liao, Zhen, et autres
Publié: (2026)
par: Liao, Zhen, et autres
Publié: (2026)
Self-Tuning Spectral Clustering for Speaker Diarization
par: Raghav, Nikhil, et autres
Publié: (2024)
par: Raghav, Nikhil, et autres
Publié: (2024)
DiariST: Streaming Speech Translation with Speaker Diarization
par: Yang, Mu, et autres
Publié: (2023)
par: Yang, Mu, et autres
Publié: (2023)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025)
par: Ren, Pengyu, et autres
Publié: (2025)
Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling
par: Jalal, Md Asif, et autres
Publié: (2025)
par: Jalal, Md Asif, et autres
Publié: (2025)
Mamba-based Segmentation Model for Speaker Diarization
par: Plaquet, Alexis, et autres
Publié: (2024)
par: Plaquet, Alexis, et autres
Publié: (2024)
AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow
par: Li, Duojia, et autres
Publié: (2026)
par: Li, Duojia, et autres
Publié: (2026)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Probabilistic Fusion and Calibration of Neural Speaker Diarization Models
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2025)
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2025)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
par: Wang, Quan, et autres
Publié: (2024)
par: Wang, Quan, et autres
Publié: (2024)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025)
par: Shakeel, Muhammad, et autres
Publié: (2025)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
823-OLT @ BUET DL Sprint 4.0: Context-Aware Windowing for ASR and Fine-Tuned Speaker Diarization in Bengali Long Form Audio
par: Dhar, Ratnajit, et autres
Publié: (2026)
par: Dhar, Ratnajit, et autres
Publié: (2026)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
par: Medennikov, Ivan, et autres
Publié: (2025)
par: Medennikov, Ivan, et autres
Publié: (2025)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Multi-Stage Speaker Diarization for Noisy Classrooms
par: Khan, Ali Sartaz, et autres
Publié: (2025)
par: Khan, Ali Sartaz, et autres
Publié: (2025)
Language Modelling for Speaker Diarization in Telephonic Interviews
par: India, Miquel, et autres
Publié: (2025)
par: India, Miquel, et autres
Publié: (2025)
Investigating Confidence Estimation Measures for Speaker Diarization
par: Chowdhury, Anurag, et autres
Publié: (2024)
par: Chowdhury, Anurag, et autres
Publié: (2024)
From Modular to End-to-End Speaker Diarization
par: Landini, Federico
Publié: (2024)
par: Landini, Federico
Publié: (2024)
Documents similaires
-
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
par: Luo, Longjie, et autres
Publié: (2025) -
Speaker Diarization with Overlapping Community Detection Using Graph Attention Networks and Label Propagation Algorithm
par: Li, Zhaoyang, et autres
Publié: (2025) -
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
par: Huang, Shangkun, et autres
Publié: (2025) -
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
par: Luo, Longjie, et autres
Publié: (2025) -
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)