Vclip: Face-based Speaker Generation by Face-voice Association Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Yao, Xu, Yunfei, Suo, Hongbin, Wan, Yulong, Liu, Haifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
di: Li, Ze, et al.
Pubblicazione: (2024)
di: Li, Ze, et al.
Pubblicazione: (2024)
The Database and Benchmark for the Source Speaker Tracing Challenge 2024
di: Li, Ze, et al.
Pubblicazione: (2024)
di: Li, Ze, et al.
Pubblicazione: (2024)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025)
di: Clarke, Jason, et al.
Pubblicazione: (2025)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
Hear Your Face: Face-based voice conversion with F0 estimation
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
di: Lee, Jaejun, et al.
Pubblicazione: (2024)
Task-Agnostic Structured Pruning of Speech Representation Models
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
Contrastive Learning-based Chaining-Cluster for Multilingual Voice-Face Association
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
di: Chen, Wuyang, et al.
Pubblicazione: (2024)
Face-voice Association in Multilingual Environments (FAME) Challenge 2024 Evaluation Plan
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
di: Saeed, Muhammad Saad, et al.
Pubblicazione: (2024)
MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers
di: Park, Kyeongman, et al.
Pubblicazione: (2025)
di: Park, Kyeongman, et al.
Pubblicazione: (2025)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
Learning Emotion-Invariant Speaker Representations for Speaker Verification
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
IDMap: A Pseudo-Speaker Generator Framework Based on Speaker Identity Index to Vector Mapping
di: Liu, Zeyan, et al.
Pubblicazione: (2025)
di: Liu, Zeyan, et al.
Pubblicazione: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
MASV: Speaker Verification with Global and Local Context Mamba
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
Synthesizing speech with selected perceptual voice qualities - A case study with creaky voice
di: Rautenberg, Frederik, et al.
Pubblicazione: (2025)
di: Rautenberg, Frederik, et al.
Pubblicazione: (2025)
Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification
di: Weng, Shilong, et al.
Pubblicazione: (2025)
di: Weng, Shilong, et al.
Pubblicazione: (2025)
Target Speaker Extraction with Curriculum Learning
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
di: Murata, Masato, et al.
Pubblicazione: (2025)
di: Murata, Masato, et al.
Pubblicazione: (2025)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
di: Farhadipour, Aref, et al.
Pubblicazione: (2025)
Unsupervised Face-Masked Speech Enhancement Using Generative Adversarial Networks With Human-in-the-Loop Assessment Metrics
di: Wang, Syu-Siang, et al.
Pubblicazione: (2024)
di: Wang, Syu-Siang, et al.
Pubblicazione: (2024)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Study on Inter and Intra Speaker Variability in Speaker Recognition
di: Okhotnikov, Anton, et al.
Pubblicazione: (2024)
di: Okhotnikov, Anton, et al.
Pubblicazione: (2024)
Magnitude and Phase-based Feature Fusion Using Co-attention Mechanism for Speaker recognition
di: Su, Rongfeng, et al.
Pubblicazione: (2025)
di: Su, Rongfeng, et al.
Pubblicazione: (2025)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
A Dual-Path Framework with Frequency-and-Time Excited Network for Anomalous Sound Detection
di: Zhang, Yucong, et al.
Pubblicazione: (2024)
di: Zhang, Yucong, et al.
Pubblicazione: (2024)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
PadAug: Robust Speaker Verification with Simple Waveform-Level Silence Padding
di: Huang, Zijun, et al.
Pubblicazione: (2025)
di: Huang, Zijun, et al.
Pubblicazione: (2025)
SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion
di: Chen, Zhiyong, et al.
Pubblicazione: (2026)
di: Chen, Zhiyong, et al.
Pubblicazione: (2026)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
di: Tao, Ruijie, et al.
Pubblicazione: (2024) -
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
di: Li, Ze, et al.
Pubblicazione: (2024) -
The Database and Benchmark for the Source Speaker Tracing Challenge 2024
di: Li, Ze, et al.
Pubblicazione: (2024) -
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
di: Clarke, Jason, et al.
Pubblicazione: (2025) -
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
di: Wang, Haoyu, et al.
Pubblicazione: (2022)