Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Jun, Zhang, Tong, Yi, Zhuolin, Huang, Yihuan, Chai, Yi, Zhang, Yiyang, Ren, Yanzhen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Well Do Current Speech Deepfake Detection Methods Generalize to the Real World?
par: Li, Daixian, et autres
Publié: (2026)
par: Li, Daixian, et autres
Publié: (2026)
RTCFake: Speech Deepfake Detection in Real-Time Communication
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
par: Zhang, Tong, et autres
Publié: (2025)
par: Zhang, Tong, et autres
Publié: (2025)
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2025)
par: Salvi, Davide, et autres
Publié: (2025)
Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes
par: Zhang, Kuiyuan, et autres
Publié: (2024)
par: Zhang, Kuiyuan, et autres
Publié: (2024)
PhonemeDF: A Synthetic Speech Dataset for Audio Deepfake Detection and Naturalness Evaluation
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
Utilizing Speaker Profiles for Impersonation Audio Detection
par: Gu, Hao, et autres
Publié: (2024)
par: Gu, Hao, et autres
Publié: (2024)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
par: Wang, Dongmei, et autres
Publié: (2023)
par: Wang, Dongmei, et autres
Publié: (2023)
PASE: Phoneme-Aware Speech Encoder to Improve Lip Sync Accuracy for Talking Head Synthesis
par: Huang, Yihuan, et autres
Publié: (2025)
par: Huang, Yihuan, et autres
Publié: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
par: Xu, Le, et autres
Publié: (2023)
par: Xu, Le, et autres
Publié: (2023)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
par: Zhang, Chu Yuan, et autres
Publié: (2023)
par: Zhang, Chu Yuan, et autres
Publié: (2023)
Investigation of Zero-shot Text-to-Speech Models for Enhancing Short-Utterance Speaker Verification
par: Zhao, Yiyang, et autres
Publié: (2025)
par: Zhao, Yiyang, et autres
Publié: (2025)
SingFake: Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2023)
par: Zang, Yongyi, et autres
Publié: (2023)
A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech
par: Huang, Jia-Hong, et autres
Publié: (2026)
par: Huang, Jia-Hong, et autres
Publié: (2026)
TwinShift: Benchmarking Audio Deepfake Detection across Synthesizer and Speaker Shifts
par: Hong, Jiyoung, et autres
Publié: (2025)
par: Hong, Jiyoung, et autres
Publié: (2025)
Alethia: A Foundational Encoder for Voice Deepfakes
par: Zhu, Yi, et autres
Publié: (2026)
par: Zhu, Yi, et autres
Publié: (2026)
Empowering Global Voices: A Data-Efficient, Phoneme-Tone Adaptive Approach to High-Fidelity Speech Synthesis
par: Geng, Yizhong, et autres
Publié: (2025)
par: Geng, Yizhong, et autres
Publié: (2025)
ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan
par: Zhang, Xueping, et autres
Publié: (2026)
par: Zhang, Xueping, et autres
Publié: (2026)
Phoneme Discretized Saliency Maps for Explainable Detection of AI-Generated Voice
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Phoneme-Level Deepfake Detection Across Emotional Conditions Using Self-Supervised Embeddings
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
par: Nallaguntla, Vamshi, et autres
Publié: (2026)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
par: Weise, Tobias, et autres
Publié: (2024)
par: Weise, Tobias, et autres
Publié: (2024)
A Data-Centric Approach to Generalizable Speech Deepfake Detection
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
A Survey on Speech Deepfake Detection
par: Li, Menglu, et autres
Publié: (2024)
par: Li, Menglu, et autres
Publié: (2024)
HQ-MPSD: A Multilingual Artifact-Controlled Benchmark for Partial Deepfake Speech Detection
par: Li, Menglu, et autres
Publié: (2025)
par: Li, Menglu, et autres
Publié: (2025)
VoiceWukong: Benchmarking Deepfake Voice Detection
par: Yan, Ziwei, et autres
Publié: (2024)
par: Yan, Ziwei, et autres
Publié: (2024)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
par: Guo, Xiaoxuan, et autres
Publié: (2026)
par: Guo, Xiaoxuan, et autres
Publié: (2026)
Region-Based Optimization in Continual Learning for Audio Deepfake Detection
par: Chen, Yujie, et autres
Publié: (2024)
par: Chen, Yujie, et autres
Publié: (2024)
A Comparative Study on Proactive and Passive Detection of Deepfake Speech
par: Wu, Chia-Hua, et autres
Publié: (2025)
par: Wu, Chia-Hua, et autres
Publié: (2025)
Attention-based Mixture of Experts for Robust Speech Deepfake Detection
par: Negroni, Viola, et autres
Publié: (2025)
par: Negroni, Viola, et autres
Publié: (2025)
From Sharpness to Better Generalization for Speech Deepfake Detection
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Towards Robust Audio Deepfake Detection: A Evolving Benchmark for Continual Learning
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
par: Wang, Wenyu, et autres
Publié: (2025)
par: Wang, Wenyu, et autres
Publié: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
ADD 2023: Towards Audio Deepfake Detection and Analysis in the Wild
par: Yi, Jiangyan, et autres
Publié: (2024)
par: Yi, Jiangyan, et autres
Publié: (2024)
The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints
par: Li, Yupei, et autres
Publié: (2025)
par: Li, Yupei, et autres
Publié: (2025)
Documents similaires
-
How Well Do Current Speech Deepfake Detection Methods Generalize to the Real World?
par: Li, Daixian, et autres
Publié: (2026) -
RTCFake: Speech Deepfake Detection in Real-Time Communication
par: Xue, Jun, et autres
Publié: (2026) -
EchoFake: A Replay-Aware Dataset for Practical Speech Deepfake Detection
par: Zhang, Tong, et autres
Publié: (2025) -
Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs
par: Xue, Jun, et autres
Publié: (2026) -
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2025)