A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Kyungbok, Zhang, You, Duan, Zhiyao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
par: Wen, Penghui, et autres
Publié: (2023)
par: Wen, Penghui, et autres
Publié: (2023)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
par: Rho, Kyeongha, et autres
Publié: (2025)
par: Rho, Kyeongha, et autres
Publié: (2025)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
par: Chen, Liangyu, et autres
Publié: (2024)
par: Chen, Liangyu, et autres
Publié: (2024)
SafeEar: Content Privacy-Preserving Audio Deepfake Detection
par: Li, Xinfeng, et autres
Publié: (2024)
par: Li, Xinfeng, et autres
Publié: (2024)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
par: Bang, Hayeon, et autres
Publié: (2024)
par: Bang, Hayeon, et autres
Publié: (2024)
SingFake: Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2023)
par: Zang, Yongyi, et autres
Publié: (2023)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
par: Yang, Zhe, et autres
Publié: (2024)
par: Yang, Zhe, et autres
Publié: (2024)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
par: Klemt, Marcel, et autres
Publié: (2025)
par: Klemt, Marcel, et autres
Publié: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
par: Zhang, Kang, et autres
Publié: (2025)
par: Zhang, Kang, et autres
Publié: (2025)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
par: Alonso-Jiménez, Pablo, et autres
Publié: (2024)
par: Alonso-Jiménez, Pablo, et autres
Publié: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
par: Fujita, Yoto, et autres
Publié: (2024)
par: Fujita, Yoto, et autres
Publié: (2024)
Retrieval-Augmented Text-to-Audio Generation
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
Neural Style Transfer for Audio Spectograms
par: Verma, Prateek, et autres
Publié: (2018)
par: Verma, Prateek, et autres
Publié: (2018)
Embedding Alignment in Code Generation for Audio
par: Kouteili, Sam, et autres
Publié: (2025)
par: Kouteili, Sam, et autres
Publié: (2025)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
par: Burchett-Vass, Rhys, et autres
Publié: (2024)
par: Burchett-Vass, Rhys, et autres
Publié: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
par: Mei, Xinhao, et autres
Publié: (2022)
par: Mei, Xinhao, et autres
Publié: (2022)
Cinematic Audio Source Separation Using Visual Cues
par: Zhang, Kang, et autres
Publié: (2026)
par: Zhang, Kang, et autres
Publié: (2026)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
par: Liu, Haohe, et autres
Publié: (2023)
par: Liu, Haohe, et autres
Publié: (2023)
Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset
par: Kaur, Sukhandeep, et autres
Publié: (2024)
par: Kaur, Sukhandeep, et autres
Publié: (2024)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
par: Jung, Jongmin, et autres
Publié: (2025)
par: Jung, Jongmin, et autres
Publié: (2025)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
par: Batlle-Roca, Roser, et autres
Publié: (2024)
par: Batlle-Roca, Roser, et autres
Publié: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
par: Ge, Mengying, et autres
Publié: (2024)
par: Ge, Mengying, et autres
Publié: (2024)
Learning Temporal Resolution in Spectrogram for Audio Classification
par: Liu, Haohe, et autres
Publié: (2022)
par: Liu, Haohe, et autres
Publié: (2022)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
Documents similaires
-
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
par: Zhang, You, et autres
Publié: (2024) -
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024) -
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
par: Wen, Penghui, et autres
Publié: (2023) -
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024) -
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
par: Rho, Kyeongha, et autres
Publié: (2025)