Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zou, Heqing, Shen, Meng, Hu, Yuchen, Chen, Chen, Chng, Eng Siong, Rajan, Deepu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
par: Wei, Zihe, et autres
Publié: (2026)
par: Wei, Zihe, et autres
Publié: (2026)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
par: Klemt, Marcel, et autres
Publié: (2025)
par: Klemt, Marcel, et autres
Publié: (2025)
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
par: Shen, Meng, et autres
Publié: (2024)
par: Shen, Meng, et autres
Publié: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
par: Zou, Jialing, et autres
Publié: (2023)
par: Zou, Jialing, et autres
Publié: (2023)
Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos
par: Tian, Chong, et autres
Publié: (2026)
par: Tian, Chong, et autres
Publié: (2026)
DIP: Diffusion Learning of Inconsistency Pattern for General DeepFake Detection
par: Nie, Fan, et autres
Publié: (2024)
par: Nie, Fan, et autres
Publié: (2024)
Large Language Models Meet Contrastive Learning: Zero-Shot Emotion Recognition Across Languages
par: Zou, Heqing, et autres
Publié: (2025)
par: Zou, Heqing, et autres
Publié: (2025)
FakeParts: a New Family of AI-Generated DeepFakes
par: Liu, Ziyi, et autres
Publié: (2025)
par: Liu, Ziyi, et autres
Publié: (2025)
Exploring Modality Disruption in Multimodal Fake News Detection
par: Liu, Moyang, et autres
Publié: (2025)
par: Liu, Moyang, et autres
Publié: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
par: Li, Xiaolou, et autres
Publié: (2024)
par: Li, Xiaolou, et autres
Publié: (2024)
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
par: Wang, Jiadong, et autres
Publié: (2026)
par: Wang, Jiadong, et autres
Publié: (2026)
Audio-Visual Cross-Modal Compression for Generative Face Video Coding
par: Xu, Youmin, et autres
Publié: (2025)
par: Xu, Youmin, et autres
Publié: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
par: Yin, Yongkang, et autres
Publié: (2023)
par: Yin, Yongkang, et autres
Publié: (2023)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
par: Amoroso, Roberto, et autres
Publié: (2023)
par: Amoroso, Roberto, et autres
Publié: (2023)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
par: Lin, Meng-Ping, et autres
Publié: (2025)
par: Lin, Meng-Ping, et autres
Publié: (2025)
FedMAC: Tackling Partial-Modality Missing in Federated Learning with Cross-Modal Aggregation and Contrastive Regularization
par: Nguyen, Manh Duong, et autres
Publié: (2024)
par: Nguyen, Manh Duong, et autres
Publié: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
Modality-Aware Contrastive and Uncertainty-Regularized Emotion Recognition
par: Zhuang, Yan, et autres
Publié: (2026)
par: Zhuang, Yan, et autres
Publié: (2026)
MViR: Multi-View Visual-Semantic Representation for Fake News Detection
par: Liang, Haochen, et autres
Publié: (2026)
par: Liang, Haochen, et autres
Publié: (2026)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
par: Huang, Lian, et autres
Publié: (2024)
par: Huang, Lian, et autres
Publié: (2024)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization
par: Anshul, Ashutosh, et autres
Publié: (2025)
par: Anshul, Ashutosh, et autres
Publié: (2025)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
par: Hong, Yuyang, et autres
Publié: (2025)
par: Hong, Yuyang, et autres
Publié: (2025)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
par: Saleh, Mohamed, et autres
Publié: (2026)
par: Saleh, Mohamed, et autres
Publié: (2026)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025)
par: Li, Shuyu, et autres
Publié: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
par: Araujo, Edson, et autres
Publié: (2026)
par: Araujo, Edson, et autres
Publié: (2026)
Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection
par: Xie, Zhiyu, et autres
Publié: (2026)
par: Xie, Zhiyu, et autres
Publié: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
par: Zhang, Yinghui, et autres
Publié: (2025)
par: Zhang, Yinghui, et autres
Publié: (2025)
Documents similaires
-
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
par: Wei, Zihe, et autres
Publié: (2026) -
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
par: Klemt, Marcel, et autres
Publié: (2025) -
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
par: Shen, Meng, et autres
Publié: (2024) -
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025) -
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
par: Zou, Jialing, et autres
Publié: (2023)