A robust audio deepfake detection system via multi-view feature
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Yujie, Qin, Haochen, Zhou, Hang, Wang, Chengcheng, Guo, Tianyu, Han, Kai, Wang, Yunhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Forensic deepfake audio detection using segmental speech features
di: Yang, Tianle, et al.
Pubblicazione: (2025)
di: Yang, Tianle, et al.
Pubblicazione: (2025)
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
di: Han, Runduo, et al.
Pubblicazione: (2024)
di: Han, Runduo, et al.
Pubblicazione: (2024)
Visual-based spatial audio generation system for multi-speaker environments
di: Liu, Xiaojing, et al.
Pubblicazione: (2025)
di: Liu, Xiaojing, et al.
Pubblicazione: (2025)
Are audio DeepFake detection models polyglots?
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
Generalizable speech deepfake detection via meta-learned LoRA
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
MBCodec:Thorough disentangle for high-fidelity audio compression
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
An automatic mixing speech enhancement system for multi-track audio
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis
di: Liu, Yunyi, et al.
Pubblicazione: (2024)
di: Liu, Yunyi, et al.
Pubblicazione: (2024)
Easy, Interpretable, Effective: openSMILE for voice deepfake detection
di: Pascu, Octavian, et al.
Pubblicazione: (2024)
di: Pascu, Octavian, et al.
Pubblicazione: (2024)
Echoes: A semantically-aligned music deepfake detection dataset
di: Pascu, Octavian, et al.
Pubblicazione: (2026)
di: Pascu, Octavian, et al.
Pubblicazione: (2026)
Towards audio language modeling -- an overview
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning
di: Smeu, Stefan, et al.
Pubblicazione: (2024)
di: Smeu, Stefan, et al.
Pubblicazione: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
di: Tan, Liwen, et al.
Pubblicazione: (2024)
di: Tan, Liwen, et al.
Pubblicazione: (2024)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
WavLM model ensemble for audio deepfake detection
di: Combei, David, et al.
Pubblicazione: (2024)
di: Combei, David, et al.
Pubblicazione: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
di: Coldenhoff, Jozef, et al.
Pubblicazione: (2024)
A tunable binaural audio telepresence system capable of balancing immersive and enhanced modes
di: Hsu, Yicheng, et al.
Pubblicazione: (2024)
di: Hsu, Yicheng, et al.
Pubblicazione: (2024)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
di: Zhao, Jinghua, et al.
Pubblicazione: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Detecting music deepfakes is easy but actually hard
di: Afchar, Darius, et al.
Pubblicazione: (2024)
di: Afchar, Darius, et al.
Pubblicazione: (2024)
Towards generalizing deep-audio fake detection networks
di: Gasenzer, Konstantin, et al.
Pubblicazione: (2023)
di: Gasenzer, Konstantin, et al.
Pubblicazione: (2023)
Tweaking autoregressive methods for inpainting of gaps in audio signals
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
Real-time implementation of vibrato transfer as an audio effect
di: Hyrkas, Jeremy
Pubblicazione: (2025)
di: Hyrkas, Jeremy
Pubblicazione: (2025)
Speaker anonymization using neural audio codec language models
di: Panariello, Michele, et al.
Pubblicazione: (2023)
di: Panariello, Michele, et al.
Pubblicazione: (2023)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
Regularized autoregressive modeling and its application to audio signal reconstruction
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
di: Wang, Anna, et al.
Pubblicazione: (2024)
di: Wang, Anna, et al.
Pubblicazione: (2024)
Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
An RFP dataset for Real, Fake, and Partially fake audio detection
di: AlAli, Abdulazeez, et al.
Pubblicazione: (2024)
di: AlAli, Abdulazeez, et al.
Pubblicazione: (2024)
Unsupervised outlier detection to improve bird audio dataset labels
di: Collins, Bruce
Pubblicazione: (2025)
di: Collins, Bruce
Pubblicazione: (2025)
AxLSTMs: learning self-supervised audio representations with xLSTMs
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Deep learning based spatial aliasing reduction in beamforming for audio capture
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
di: Das, Sneha, et al.
Pubblicazione: (2020)
di: Das, Sneha, et al.
Pubblicazione: (2020)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
di: Takano, Taisei, et al.
Pubblicazione: (2025)
di: Takano, Taisei, et al.
Pubblicazione: (2025)
Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training
di: Feng, Jianyuan, et al.
Pubblicazione: (2025)
di: Feng, Jianyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Forensic deepfake audio detection using segmental speech features
di: Yang, Tianle, et al.
Pubblicazione: (2025) -
Where are we in audio deepfake detection? A systematic analysis over generative and detection models
di: Li, Xiang, et al.
Pubblicazione: (2024) -
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
di: Han, Runduo, et al.
Pubblicazione: (2024) -
Visual-based spatial audio generation system for multi-speaker environments
di: Liu, Xiaojing, et al.
Pubblicazione: (2025) -
Are audio DeepFake detection models polyglots?
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)