VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Qianyue, Wu, Junyan, Lu, Wei, Luo, Xiangyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026)
por: Jin, Ruinan, et al.
Publicado: (2026)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
por: Shen, Lipeng, et al.
Publicado: (2024)
por: Shen, Lipeng, et al.
Publicado: (2024)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
por: Biyani, Ishan D., et al.
Publicado: (2025)
por: Biyani, Ishan D., et al.
Publicado: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
por: Lin, Yueqian, et al.
Publicado: (2025)
por: Lin, Yueqian, et al.
Publicado: (2025)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)
por: Gu, Ke, et al.
Publicado: (2025)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
por: Clarke, Jason, et al.
Publicado: (2025)
por: Clarke, Jason, et al.
Publicado: (2025)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
por: Lin, Jinwei
Publicado: (2024)
por: Lin, Jinwei
Publicado: (2024)
VocalCrypt: Novel Active Defense Against Deepfake Voice Based on Masking Effect
por: Fei, Qingyuan, et al.
Publicado: (2025)
por: Fei, Qingyuan, et al.
Publicado: (2025)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
por: Deng, Jiajun, et al.
Publicado: (2025)
por: Deng, Jiajun, et al.
Publicado: (2025)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
por: Li, Fengjin, et al.
Publicado: (2025)
por: Li, Fengjin, et al.
Publicado: (2025)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
por: Wu, Junyan, et al.
Publicado: (2025)
por: Wu, Junyan, et al.
Publicado: (2025)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
por: Ning, Jinzhong, et al.
Publicado: (2025)
por: Ning, Jinzhong, et al.
Publicado: (2025)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
por: Qian, Zhiwen, et al.
Publicado: (2025)
por: Qian, Zhiwen, et al.
Publicado: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
por: Lv, Yishan, et al.
Publicado: (2026)
por: Lv, Yishan, et al.
Publicado: (2026)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
por: Gu, Bin, et al.
Publicado: (2025)
por: Gu, Bin, et al.
Publicado: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
por: Liu, Shansong, et al.
Publicado: (2023)
por: Liu, Shansong, et al.
Publicado: (2023)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
por: Li, Yupei, et al.
Publicado: (2024)
por: Li, Yupei, et al.
Publicado: (2024)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024)
por: Liu, Shansong, et al.
Publicado: (2024)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025)
por: Kang, Fang, et al.
Publicado: (2025)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
por: Lu, Wenhuan, et al.
Publicado: (2025)
por: Lu, Wenhuan, et al.
Publicado: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
por: Su, Fei, et al.
Publicado: (2026)
por: Su, Fei, et al.
Publicado: (2026)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
por: Lei, Ke, et al.
Publicado: (2026)
por: Lei, Ke, et al.
Publicado: (2026)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
por: You, Fuming, et al.
Publicado: (2024)
por: You, Fuming, et al.
Publicado: (2024)
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
por: Hung, Tzu-Yun, et al.
Publicado: (2024)
A Unified Framework for Modality-Agnostic Deepfakes Detection
por: Yu, Cai, et al.
Publicado: (2023)
por: Yu, Cai, et al.
Publicado: (2023)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
Conformer-based Ultrasound-to-Speech Conversion
por: Ibrahimov, Ibrahim, et al.
Publicado: (2025)
por: Ibrahimov, Ibrahim, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Dance-to-Music Generation with Encoder-based Textual Inversion
por: Li, Sifei, et al.
Publicado: (2024)
por: Li, Sifei, et al.
Publicado: (2024)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
por: Stewart, Shanti, et al.
Publicado: (2024)
por: Stewart, Shanti, et al.
Publicado: (2024)
Ejemplares similares
-
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026) -
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
por: Shen, Lipeng, et al.
Publicado: (2024) -
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
por: Biyani, Ishan D., et al.
Publicado: (2025) -
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
por: Lin, Yueqian, et al.
Publicado: (2025) -
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)