Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Qingcao, He, Miao, Yi, Liang, Wen, Qing, Zhang, Yitao, Jin, Hongshuo, Cheng, Peng, Ba, Zhongjie, Lu, Li, Ren, Kui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
por: Li, Qingcao, et al.
Publicado: (2026)
por: Li, Qingcao, et al.
Publicado: (2026)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
por: Wei, Fangda, et al.
Publicado: (2026)
por: Wei, Fangda, et al.
Publicado: (2026)
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
ISMAF: Intrinsic-Social Modality Alignment and Fusion for Multimodal Rumor Detection
por: Yu, Zihao, et al.
Publicado: (2025)
por: Yu, Zihao, et al.
Publicado: (2025)
Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection
por: Tang, Hao, et al.
Publicado: (2024)
por: Tang, Hao, et al.
Publicado: (2024)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis
por: Feng, Xinyu, et al.
Publicado: (2024)
por: Feng, Xinyu, et al.
Publicado: (2024)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
por: Yu, Cai, et al.
Publicado: (2023)
por: Yu, Cai, et al.
Publicado: (2023)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
Cross-Platform Neural Video Coding: A Case Study
por: Conceição, Ruhan, et al.
Publicado: (2024)
por: Conceição, Ruhan, et al.
Publicado: (2024)
Multimodal LLM-based Query Paraphrasing for Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
Audio-Visual Cross-Modal Compression for Generative Face Video Coding
por: Xu, Youmin, et al.
Publicado: (2025)
por: Xu, Youmin, et al.
Publicado: (2025)
TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities
por: Zhuang, Yan, et al.
Publicado: (2025)
por: Zhuang, Yan, et al.
Publicado: (2025)
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
por: Hu, Huanran, et al.
Publicado: (2026)
por: Hu, Huanran, et al.
Publicado: (2026)
ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing
por: Wang, Yisu, et al.
Publicado: (2025)
por: Wang, Yisu, et al.
Publicado: (2025)
StreamOptix: A Cross-layer Adaptive Video Delivery Scheme
por: Liu, Mufan, et al.
Publicado: (2024)
por: Liu, Mufan, et al.
Publicado: (2024)
Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning
por: Hu, Jiayun, et al.
Publicado: (2025)
por: Hu, Jiayun, et al.
Publicado: (2025)
Beyond Forced Modality Balance: Intrinsic Information Budgets for Multimodal Learning
por: Xiong, Zechang, et al.
Publicado: (2026)
por: Xiong, Zechang, et al.
Publicado: (2026)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion
por: Gong, Ziyu, et al.
Publicado: (2024)
por: Gong, Ziyu, et al.
Publicado: (2024)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
por: Wang, Xiaohan, et al.
Publicado: (2026)
por: Wang, Xiaohan, et al.
Publicado: (2026)
Multimodal Representation Learning and Fusion
por: Jin, Qihang, et al.
Publicado: (2025)
por: Jin, Qihang, et al.
Publicado: (2025)
Exploring Modality Disruption in Multimodal Fake News Detection
por: Liu, Moyang, et al.
Publicado: (2025)
por: Liu, Moyang, et al.
Publicado: (2025)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
por: Lin, Zixing, et al.
Publicado: (2026)
por: Lin, Zixing, et al.
Publicado: (2026)
Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection
por: Xie, Zhiyu, et al.
Publicado: (2026)
por: Xie, Zhiyu, et al.
Publicado: (2026)
Spectrum-based Modality Representation Fusion Graph Convolutional Network for Multimodal Recommendation
por: Ong, Rongqing Kenneth, et al.
Publicado: (2024)
por: Ong, Rongqing Kenneth, et al.
Publicado: (2024)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in Conversation
por: Yi, Zijian, et al.
Publicado: (2024)
por: Yi, Zijian, et al.
Publicado: (2024)
MInD: Improving Multimodal Sentiment Analysis via Multimodal Information Disentanglement
por: Dai, Weichen, et al.
Publicado: (2024)
por: Dai, Weichen, et al.
Publicado: (2024)
Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval
por: Wen, Haokun, et al.
Publicado: (2024)
por: Wen, Haokun, et al.
Publicado: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection
por: Wen, Qing, et al.
Publicado: (2026)
por: Wen, Qing, et al.
Publicado: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025)
por: Zhang, Yinghui, et al.
Publicado: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
por: Li, Sifei, et al.
Publicado: (2025)
por: Li, Sifei, et al.
Publicado: (2025)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
por: Zhang, Meishan, et al.
Publicado: (2024)
por: Zhang, Meishan, et al.
Publicado: (2024)
CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation
por: Zhan, Hao, et al.
Publicado: (2026)
por: Zhan, Hao, et al.
Publicado: (2026)
FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries
por: You, Qijie, et al.
Publicado: (2026)
por: You, Qijie, et al.
Publicado: (2026)
Ejemplares similares
-
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
por: Li, Qingcao, et al.
Publicado: (2026) -
MSCT: Differential Cross-Modal Attention for Deepfake Detection
por: Wei, Fangda, et al.
Publicado: (2026) -
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025) -
ISMAF: Intrinsic-Social Modality Alignment and Fusion for Multimodal Rumor Detection
por: Yu, Zihao, et al.
Publicado: (2025) -
Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection
por: Tang, Hao, et al.
Publicado: (2024)