Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization
Fuente:
arXiv
Guardado en:
| Autores principales: | Anshul, Ashutosh, Gopal, Shreyas, Rajan, Deepu, Chng, Eng Siong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Text-based Talking Video Editing with Cascaded Conditional Diffusion
por: Han, Bo, et al.
Publicado: (2024)
por: Han, Bo, et al.
Publicado: (2024)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
Linguistic Profiling of Deepfakes: An Open Database for Next-Generation Deepfake Detection
por: Wang, Yabin, et al.
Publicado: (2024)
por: Wang, Yabin, et al.
Publicado: (2024)
DF40: Toward Next-Generation Deepfake Detection
por: Yan, Zhiyuan, et al.
Publicado: (2024)
por: Yan, Zhiyuan, et al.
Publicado: (2024)
Situational Scene Graph for Structured Human-centric Situation Understanding
por: Sugandhika, Chinthani, et al.
Publicado: (2024)
por: Sugandhika, Chinthani, et al.
Publicado: (2024)
Deepfake Detection with Spatio-Temporal Consistency and Attention
por: Chen, Yunzhuo, et al.
Publicado: (2025)
por: Chen, Yunzhuo, et al.
Publicado: (2025)
Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
por: Gopal, Shreyas, et al.
Publicado: (2025)
por: Gopal, Shreyas, et al.
Publicado: (2025)
Autoregressive Video Generation beyond Next Frames Prediction
por: Ren, Sucheng, et al.
Publicado: (2025)
por: Ren, Sucheng, et al.
Publicado: (2025)
MambaTAD: When State-Space Models Meet Long-Range Temporal Action Detection
por: Lu, Hui, et al.
Publicado: (2025)
por: Lu, Hui, et al.
Publicado: (2025)
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
por: Xiong, Jiayu, et al.
Publicado: (2026)
por: Xiong, Jiayu, et al.
Publicado: (2026)
Mining Forgery Traces from Reconstruction Error: A Weakly Supervised Framework for Multimodal Deepfake Temporal Localization
por: Guo, Midou, et al.
Publicado: (2026)
por: Guo, Midou, et al.
Publicado: (2026)
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
por: Zhang, Lvmin, et al.
Publicado: (2025)
por: Zhang, Lvmin, et al.
Publicado: (2025)
Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching
por: Coletta, Emma, et al.
Publicado: (2025)
por: Coletta, Emma, et al.
Publicado: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
por: Gu, Yuchao, et al.
Publicado: (2025)
por: Gu, Yuchao, et al.
Publicado: (2025)
Selective Domain-Invariant Feature for Generalizable Deepfake Detection
por: Lai, Yingxin, et al.
Publicado: (2024)
por: Lai, Yingxin, et al.
Publicado: (2024)
From Prediction to Explanation: Multimodal, Explainable, and Interactive Deepfake Detection Framework for Non-Expert Users
por: Tariq, Shahroz, et al.
Publicado: (2025)
por: Tariq, Shahroz, et al.
Publicado: (2025)
Vulnerability-Aware Spatio-Temporal Learning for Generalizable Deepfake Video Detection
por: Nguyen, Dat, et al.
Publicado: (2025)
por: Nguyen, Dat, et al.
Publicado: (2025)
PIA: Deepfake Detection Using Phoneme-Temporal and Identity-Dynamic Analysis
por: Datta, Soumyya Kanti, et al.
Publicado: (2025)
por: Datta, Soumyya Kanti, et al.
Publicado: (2025)
A Novel Local Focusing Mechanism for Deepfake Detection Generalization
por: Li, Mingliang, et al.
Publicado: (2025)
por: Li, Mingliang, et al.
Publicado: (2025)
LOGER: Local--Global Ensemble for Robust Deepfake Detection in the Wild
por: Wu, Fei, et al.
Publicado: (2026)
por: Wu, Fei, et al.
Publicado: (2026)
SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model
por: Huang, Zhenglin, et al.
Publicado: (2024)
por: Huang, Zhenglin, et al.
Publicado: (2024)
AuViRe: Audio-visual Speech Representation Reconstruction for Deepfake Temporal Localization
por: Koutlis, Christos, et al.
Publicado: (2025)
por: Koutlis, Christos, et al.
Publicado: (2025)
DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models
por: Wang, Jiarui, et al.
Publicado: (2025)
por: Wang, Jiarui, et al.
Publicado: (2025)
WWW: Where, Which and Whatever Enhancing Interpretability in Multimodal Deepfake Detection
por: Jung, Juho, et al.
Publicado: (2024)
por: Jung, Juho, et al.
Publicado: (2024)
Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection
por: Li, Tianxiao, et al.
Publicado: (2026)
por: Li, Tianxiao, et al.
Publicado: (2026)
Fact or Fake? Assessing the Role of Deepfake Detectors in Multimodal Misinformation Detection
por: Sagar, A S M Sharifuzzaman, et al.
Publicado: (2026)
por: Sagar, A S M Sharifuzzaman, et al.
Publicado: (2026)
Unsupervised Multimodal Deepfake Detection Using Intra- and Cross-Modal Inconsistencies
por: Tian, Mulin, et al.
Publicado: (2023)
por: Tian, Mulin, et al.
Publicado: (2023)
A Novel Framework for Multi-Person Temporal Gaze Following and Social Gaze Prediction
por: Gupta, Anshul, et al.
Publicado: (2024)
por: Gupta, Anshul, et al.
Publicado: (2024)
Detecting Lip-Syncing Deepfakes: Vision Temporal Transformer for Analyzing Mouth Inconsistencies
por: Datta, Soumyya Kanti, et al.
Publicado: (2025)
por: Datta, Soumyya Kanti, et al.
Publicado: (2025)
Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
por: Li, Jinghan, et al.
Publicado: (2025)
por: Li, Jinghan, et al.
Publicado: (2025)
TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction
por: Ma, Yukuo, et al.
Publicado: (2025)
por: Ma, Yukuo, et al.
Publicado: (2025)
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
por: Shen, Meng, et al.
Publicado: (2026)
por: Shen, Meng, et al.
Publicado: (2026)
FractalForensics: Proactive Deepfake Detection and Localization via Fractal Watermarks
por: Wang, Tianyi, et al.
Publicado: (2025)
por: Wang, Tianyi, et al.
Publicado: (2025)
Training-Free Multimodal Deepfake Detection via Graph Reasoning
por: Liu, Yuxin, et al.
Publicado: (2025)
por: Liu, Yuxin, et al.
Publicado: (2025)
Exposing and Mitigating Temporal Attack in Deepfake Video Detection
por: Gu, Zheyuan, et al.
Publicado: (2026)
por: Gu, Zheyuan, et al.
Publicado: (2026)
DeepfakeBench-MM: A Comprehensive Benchmark for Multimodal Deepfake Detection
por: Zhao, Kangran, et al.
Publicado: (2025)
por: Zhao, Kangran, et al.
Publicado: (2025)
Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints
por: Ahmad, Wasim, et al.
Publicado: (2026)
por: Ahmad, Wasim, et al.
Publicado: (2026)
Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction
por: Nguyen, Hy, et al.
Publicado: (2025)
por: Nguyen, Hy, et al.
Publicado: (2025)
From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
Ejemplares similares
-
Text-based Talking Video Editing with Cascaded Conditional Diffusion
por: Han, Bo, et al.
Publicado: (2024) -
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025) -
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
por: Sugandhika, Chinthani, et al.
Publicado: (2025) -
Linguistic Profiling of Deepfakes: An Open Database for Next-Generation Deepfake Detection
por: Wang, Yabin, et al.
Publicado: (2024) -
DF40: Toward Next-Generation Deepfake Detection
por: Yan, Zhiyuan, et al.
Publicado: (2024)