Seeing, Hearing, and Knowing Together: Multimodal Strategies in Deepfake Videos Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Chen, Goh, Dion Hoe-Lian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SVFAP: Self-supervised Video Facial Affect Perceiver
par: Sun, Licai, et autres
Publié: (2023)
par: Sun, Licai, et autres
Publié: (2023)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
par: Zhou, Tian-Yi, et autres
Publié: (2026)
par: Zhou, Tian-Yi, et autres
Publié: (2026)
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
par: He, Xu, et autres
Publié: (2024)
par: He, Xu, et autres
Publié: (2024)
VideoMap: Supporting Video Editing Exploration, Brainstorming, and Prototyping in the Latent Space
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
Editing Physiological Signals in Videos Using Latent Representations
par: Zhou, Tianwen, et autres
Publié: (2025)
par: Zhou, Tianwen, et autres
Publié: (2025)
BATON: A Multimodal Benchmark for Bidirectional Automation Transition Observation in Naturalistic Driving
par: Wang, Yuhang, et autres
Publié: (2026)
par: Wang, Yuhang, et autres
Publié: (2026)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
Panonut360: A Head and Eye Tracking Dataset for Panoramic Video
par: Xu, Yutong, et autres
Publié: (2024)
par: Xu, Yutong, et autres
Publié: (2024)
Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation
par: Yang, Sicheng, et autres
Publié: (2025)
par: Yang, Sicheng, et autres
Publié: (2025)
AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe
par: Cole, Adam, et autres
Publié: (2026)
par: Cole, Adam, et autres
Publié: (2026)
MindCross: Fast New Subject Adaptation with Limited Data for Cross-subject Video Reconstruction from Brain Signals
par: Liu, Xuan-Hao, et autres
Publié: (2025)
par: Liu, Xuan-Hao, et autres
Publié: (2025)
G3R: Generating Rich and Fine-grained mmWave Radar Data from 2D Videos for Generalized Gesture Recognition
par: Deng, Kaikai, et autres
Publié: (2024)
par: Deng, Kaikai, et autres
Publié: (2024)
DiffMesh: A Motion-aware Diffusion Framework for Human Mesh Recovery from Videos
par: Zheng, Ce, et autres
Publié: (2023)
par: Zheng, Ce, et autres
Publié: (2023)
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts
par: Kawamura, Kazuki, et autres
Publié: (2024)
par: Kawamura, Kazuki, et autres
Publié: (2024)
SentiAvatar: Towards Expressive and Interactive Digital Humans
par: Jin, Chuhao, et autres
Publié: (2026)
par: Jin, Chuhao, et autres
Publié: (2026)
Shu Dao: A Calligraphy Score Framework Linking Calligraphy, Music, and Performance
par: Huang, Lican
Publié: (2026)
par: Huang, Lican
Publié: (2026)
ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
par: Cheng, Luo, et autres
Publié: (2025)
par: Cheng, Luo, et autres
Publié: (2025)
ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2023)
par: Luo, Cheng, et autres
Publié: (2023)
Across-Game Engagement Modelling via Few-Shot Learning
par: Pinitas, Kosmas, et autres
Publié: (2024)
par: Pinitas, Kosmas, et autres
Publié: (2024)
Emotion Based Prediction in the Context of Optimized Trajectory Planning for Immersive Learning
par: Sungheetha, Akey, et autres
Publié: (2023)
par: Sungheetha, Akey, et autres
Publié: (2023)
MS2Mesh-XR: Multi-modal Sketch-to-Mesh Generation in XR Environments
par: Tong, Yuqi, et autres
Publié: (2024)
par: Tong, Yuqi, et autres
Publié: (2024)
Generative Timelines for Instructed Visual Assembly
par: Pardo, Alejandro, et autres
Publié: (2024)
par: Pardo, Alejandro, et autres
Publié: (2024)
Code2Video: A Code-centric Paradigm for Educational Video Generation
par: Chen, Yanzhe, et autres
Publié: (2025)
par: Chen, Yanzhe, et autres
Publié: (2025)
How Good is ChatGPT at Audiovisual Deepfake Detection: A Comparative Study of ChatGPT, AI Models and Human Perception
par: Shahzad, Sahibzada Adil, et autres
Publié: (2024)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2024)
Secure & Personalized Music-to-Video Generation via CHARCHA
par: Agarwal, Mehul, et autres
Publié: (2025)
par: Agarwal, Mehul, et autres
Publié: (2025)
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
On Semiotic-Grounded Interpretive Evaluation of Generative Art
par: Jiang, Ruixiang, et autres
Publié: (2026)
par: Jiang, Ruixiang, et autres
Publié: (2026)
Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing
par: Cai, Weitong, et autres
Publié: (2026)
par: Cai, Weitong, et autres
Publié: (2026)
EyeNavGS: A 6-DoF Navigation Dataset and Record-n-Replay Software for Real-World 3DGS Scenes in VR
par: Ding, Zihao, et autres
Publié: (2025)
par: Ding, Zihao, et autres
Publié: (2025)
WebXR, A-Frame and Networked-Aframe as a Basis for an Open Metaverse: A Conceptual Architecture
par: Macario, Giuseppe
Publié: (2024)
par: Macario, Giuseppe
Publié: (2024)
SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation
par: Yin, Wanqi, et autres
Publié: (2025)
par: Yin, Wanqi, et autres
Publié: (2025)
Inkspire: Supporting Design Exploration with Generative AI through Analogical Sketching
par: Lin, David Chuan-En, et autres
Publié: (2025)
par: Lin, David Chuan-En, et autres
Publié: (2025)
adder-viz: Real-Time Visualization Software for Transcoding Event Video
par: Freeman, Andrew C., et autres
Publié: (2025)
par: Freeman, Andrew C., et autres
Publié: (2025)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
par: Sun, Licai, et autres
Publié: (2024)
par: Sun, Licai, et autres
Publié: (2024)
E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model
par: Lin, Ronghao, et autres
Publié: (2025)
par: Lin, Ronghao, et autres
Publié: (2025)
Soundify: Matching Sound Effects to Video
par: Lin, David Chuan-En, et autres
Publié: (2021)
par: Lin, David Chuan-En, et autres
Publié: (2021)
Text2VR: Automated instruction Generation in Virtual Reality using Large language Models for Assembly Task
par: Peter, Subin Raj
Publié: (2025)
par: Peter, Subin Raj
Publié: (2025)
Learning High-Quality Navigation and Zooming on Omnidirectional Images in Virtual Reality
par: Cao, Zidong, et autres
Publié: (2024)
par: Cao, Zidong, et autres
Publié: (2024)
An Open, Cross-Platform, Web-Based Metaverse Using WebXR and A-Frame
par: Macario, Giuseppe
Publié: (2024)
par: Macario, Giuseppe
Publié: (2024)
Documents similaires
-
SVFAP: Self-supervised Video Facial Affect Perceiver
par: Sun, Licai, et autres
Publié: (2023) -
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
par: Zhou, Tian-Yi, et autres
Publié: (2026) -
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
par: He, Xu, et autres
Publié: (2024) -
VideoMap: Supporting Video Editing Exploration, Brainstorming, and Prototyping in the Latent Space
par: Lin, David Chuan-En, et autres
Publié: (2022) -
"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments
par: Zhang, Ziyi, et autres
Publié: (2025)