Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tao, Ruijie, Shi, Zhan, Jiang, Yidi, Truong, Duc-Tuan, Chng, Eng-Siong, Alioto, Massimo, Li, Haizhou |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
par: Truong, Duc-Tuan, et autres
Publié: (2023)
par: Truong, Duc-Tuan, et autres
Publié: (2023)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
Prompt-driven Target Speech Diarization
par: Jiang, Yidi, et autres
Publié: (2023)
par: Jiang, Yidi, et autres
Publié: (2023)
Room Impulse Responses help attackers to evade Deep Fake Detection
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
USED: Universal Speaker Extraction and Diarization
par: Ao, Junyi, et autres
Publié: (2023)
par: Ao, Junyi, et autres
Publié: (2023)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
par: Liu, Hexin, et autres
Publié: (2025)
par: Liu, Hexin, et autres
Publié: (2025)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Multi-Stage Speaker Diarization for Noisy Classrooms
par: Khan, Ali Sartaz, et autres
Publié: (2025)
par: Khan, Ali Sartaz, et autres
Publié: (2025)
Interpolating Speaker Identities in Embedding Space for Data Expansion
par: Liu, Tianchi, et autres
Publié: (2025)
par: Liu, Tianchi, et autres
Publié: (2025)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
par: Cheng, Ming, et autres
Publié: (2024)
par: Cheng, Ming, et autres
Publié: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
NTU-NPU System for Voice Privacy 2024 Challenge
par: Kuzmin, Nikita, et autres
Publié: (2024)
par: Kuzmin, Nikita, et autres
Publié: (2024)
NPU-NTU System for Voice Privacy 2024 Challenge
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
Speech Separation using Neural Audio Codecs with Embedding Loss
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
par: Li, Haoyu, et autres
Publié: (2026)
par: Li, Haoyu, et autres
Publié: (2026)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Vclip: Face-based Speaker Generation by Face-voice Association Learning
par: Shi, Yao, et autres
Publié: (2026)
par: Shi, Yao, et autres
Publié: (2026)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
par: Ng, Dianwen, et autres
Publié: (2025)
par: Ng, Dianwen, et autres
Publié: (2025)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
par: Clarke, Jason, et autres
Publié: (2025)
par: Clarke, Jason, et autres
Publié: (2025)
Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization
par: Han, Jiangyu, et autres
Publié: (2025)
par: Han, Jiangyu, et autres
Publié: (2025)
GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
Documents similaires
-
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
par: Truong, Duc-Tuan, et autres
Publié: (2023) -
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
par: Tao, Ruijie, et autres
Publié: (2024) -
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024) -
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024) -
Prompt-driven Target Speech Diarization
par: Jiang, Yidi, et autres
Publié: (2023)