Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xiaopeng, Fu, Ruibo, Wen, Zhengqi, Wang, Zhiyong, Xie, Yuankun, Liu, Yukun, Tao, Jianhua, Liu, Xuefei, Li, Yongwei, Qi, Xin, Lu, Yi, Shi, Shuchen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalized Fake Audio Detection via Deep Stable Learning
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
A Noval Feature via Color Quantisation for Fake Audio Detection
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
di: Lu, Yi, et al.
Pubblicazione: (2024)
di: Lu, Yi, et al.
Pubblicazione: (2024)
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
di: Shi, Shuchen, et al.
Pubblicazione: (2024)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
di: Qi, Xin, et al.
Pubblicazione: (2024)
di: Qi, Xin, et al.
Pubblicazione: (2024)
Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection
di: Fu, Ruibo, et al.
Pubblicazione: (2025)
di: Fu, Ruibo, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
di: Qi, Xin, et al.
Pubblicazione: (2024)
di: Qi, Xin, et al.
Pubblicazione: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
di: Guo, Hongming, et al.
Pubblicazione: (2024)
di: Guo, Hongming, et al.
Pubblicazione: (2024)
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
di: Zhao, Yan, et al.
Pubblicazione: (2022)
di: Zhao, Yan, et al.
Pubblicazione: (2022)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards
di: Ren, Yong, et al.
Pubblicazione: (2026)
di: Ren, Yong, et al.
Pubblicazione: (2026)
The FruitShell French synthesis system at the Blizzard 2023 Challenge
di: Qi, Xin, et al.
Pubblicazione: (2023)
di: Qi, Xin, et al.
Pubblicazione: (2023)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
di: Luo, Jing, et al.
Pubblicazione: (2025)
di: Luo, Jing, et al.
Pubblicazione: (2025)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
WeDefense: A Toolkit to Defend Against Fake Audio
di: Zhang, Lin, et al.
Pubblicazione: (2026)
di: Zhang, Lin, et al.
Pubblicazione: (2026)
The ICME 2025 Audio Encoder Capability Challenge
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
ADD 2022: the First Audio Deep Synthesis Detection Challenge
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
di: Yi, Jiangyan, et al.
Pubblicazione: (2022)
Towards Robust Audio Deepfake Detection: A Evolving Benchmark for Continual Learning
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
di: Fan, Cunhang, et al.
Pubblicazione: (2023)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
di: Ding, Chi, et al.
Pubblicazione: (2025)
di: Ding, Chi, et al.
Pubblicazione: (2025)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Generalized Fake Audio Detection via Deep Stable Learning
di: Wang, Zhiyong, et al.
Pubblicazione: (2024) -
A Noval Feature via Color Quantisation for Fake Audio Detection
di: Wang, Zhiyong, et al.
Pubblicazione: (2024) -
Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
di: Wang, Zhiyong, et al.
Pubblicazione: (2024) -
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
di: Lu, Yi, et al.
Pubblicazione: (2024) -
PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
di: Shi, Shuchen, et al.
Pubblicazione: (2024)