Datasets, Clues and State-of-the-Arts for Multimedia Forensics: An Extensive Review
Fuente:
arXiv
Saved in:
| Main Authors: | Yadav, Ankit, Vishwakarma, Dinesh Kumar |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Effective Image Forensics via A Novel Computationally Efficient Framework and A New Image Splice Dataset
by: Yadav, Ankit, et al.
Published: (2024)
by: Yadav, Ankit, et al.
Published: (2024)
A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler
by: Yadav, Ankit, et al.
Published: (2024)
by: Yadav, Ankit, et al.
Published: (2024)
A Noise and Edge extraction-based dual-branch method for Shallowfake and Deepfake Localization
by: Dagar, Deepak, et al.
Published: (2024)
by: Dagar, Deepak, et al.
Published: (2024)
Gait Recognition with Temporal Kolmogorov-Arnold Networks
by: Asad, Mohammed, et al.
Published: (2026)
by: Asad, Mohammed, et al.
Published: (2026)
Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs
by: Pandey, Ananya, et al.
Published: (2024)
by: Pandey, Ananya, et al.
Published: (2024)
Tex-ViT: A Generalizable, Robust, Texture-based dual-branch cross-attention deepfake detector
by: Dagar, Deepak, et al.
Published: (2024)
by: Dagar, Deepak, et al.
Published: (2024)
Target-Dependent Multimodal Sentiment Analysis Via Employing Visual-to Emotional-Caption Translation Network using Visual-Caption Pairs
by: Pandey, Ananya, et al.
Published: (2024)
by: Pandey, Ananya, et al.
Published: (2024)
Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
by: Aggarwal, Sajal, et al.
Published: (2024)
by: Aggarwal, Sajal, et al.
Published: (2024)
VyAnG-Net: A Novel Multi-Modal Sarcasm Recognition Model by Uncovering Visual, Acoustic and Glossary Features
by: Pandey, Ananya, et al.
Published: (2024)
by: Pandey, Ananya, et al.
Published: (2024)
FCR: Investigating Generative AI models for Forensic Craniofacial Reconstruction
by: Prasad, Ravi Shankar, et al.
Published: (2025)
by: Prasad, Ravi Shankar, et al.
Published: (2025)
SPOT-Face: Forensic Face Identification using Attention Guided Optimal Transport
by: Prasad, Ravi Shankar, et al.
Published: (2026)
by: Prasad, Ravi Shankar, et al.
Published: (2026)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
by: Bhagtani, Kratika, et al.
Published: (2024)
by: Bhagtani, Kratika, et al.
Published: (2024)
Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning
by: zhang, Kaixin, et al.
Published: (2026)
by: zhang, Kaixin, et al.
Published: (2026)
Efficient Label Refinement for Face Parsing Under Extreme Poses Using 3D Gaussian Splatting
by: Gahlawat, Ankit, et al.
Published: (2025)
by: Gahlawat, Ankit, et al.
Published: (2025)
Foundation Models For Seismic Data Processing: An Extensive Review
by: Fuchs, Fabian, et al.
Published: (2025)
by: Fuchs, Fabian, et al.
Published: (2025)
Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models
by: Yadav, Ankit, et al.
Published: (2025)
by: Yadav, Ankit, et al.
Published: (2025)
Temporal Image Forensics: A Review and Critical Evaluation
by: Jöchl, Robert, et al.
Published: (2025)
by: Jöchl, Robert, et al.
Published: (2025)
DF2023: The Digital Forensics 2023 Dataset for Image Forgery Detection
by: Fischinger, David, et al.
Published: (2025)
by: Fischinger, David, et al.
Published: (2025)
AnimalClue: Recognizing Animals by their Traces
by: Shinoda, Risa, et al.
Published: (2025)
by: Shinoda, Risa, et al.
Published: (2025)
Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
by: Yadav, Ankit, et al.
Published: (2025)
by: Yadav, Ankit, et al.
Published: (2025)
EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
by: Yadav, Ankit, et al.
Published: (2025)
by: Yadav, Ankit, et al.
Published: (2025)
Deepfake Media Forensics: State of the Art and Challenges Ahead
by: Amerini, Irene, et al.
Published: (2024)
by: Amerini, Irene, et al.
Published: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
by: Liu, Yangzhou, et al.
Published: (2024)
by: Liu, Yangzhou, et al.
Published: (2024)
Face Detection: Present State and Research Directions
by: Prabhat, Purnendu, et al.
Published: (2024)
by: Prabhat, Purnendu, et al.
Published: (2024)
EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics
by: Nguyen, Van-Loc, et al.
Published: (2026)
by: Nguyen, Van-Loc, et al.
Published: (2026)
Classification with 2-D Convolutional Neural Networks for breast cancer diagnosis
by: Sharma, Anuraganand, et al.
Published: (2020)
by: Sharma, Anuraganand, et al.
Published: (2020)
Deepfake Forensic Analysis: Source Dataset Attribution and Legal Implications of Synthetic Media Manipulation
by: Cassia, Massimiliano, et al.
Published: (2025)
by: Cassia, Massimiliano, et al.
Published: (2025)
STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models
by: Yadav, Ankit, et al.
Published: (2026)
by: Yadav, Ankit, et al.
Published: (2026)
DataViz3D: An Novel Method Leveraging Online Holographic Modeling for Extensive Dataset Preprocessing and Visualization
by: Duan, Jinli
Published: (2024)
by: Duan, Jinli
Published: (2024)
Improving Hierarchical Representations of Vectorized HD Maps with Perspective Clues
by: Zhang, Chi, et al.
Published: (2024)
by: Zhang, Chi, et al.
Published: (2024)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
by: Xi, Gongli, et al.
Published: (2026)
by: Xi, Gongli, et al.
Published: (2026)
MVFNet: Multipurpose Video Forensics Network using Multiple Forms of Forensic Evidence
by: Nguyen, Tai D., et al.
Published: (2025)
by: Nguyen, Tai D., et al.
Published: (2025)
ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models
by: Lai, Yingxin, et al.
Published: (2026)
by: Lai, Yingxin, et al.
Published: (2026)
Identity Clue Refinement and Enhancement for Visible-Infrared Person Re-Identification
by: Zhang, Guoqing, et al.
Published: (2025)
by: Zhang, Guoqing, et al.
Published: (2025)
TopoGaussian: Inferring Internal Topology Structures from Visual Clues
by: Xiong, Xiaoyu, et al.
Published: (2025)
by: Xiong, Xiaoyu, et al.
Published: (2025)
CLIP Multi-modal Hashing for Multimedia Retrieval
by: Zhu, Jian, et al.
Published: (2024)
by: Zhu, Jian, et al.
Published: (2024)
Robust and Calibrated Detection of Authentic Multimedia Content
by: Hashmi, Sarim, et al.
Published: (2025)
by: Hashmi, Sarim, et al.
Published: (2025)
LWIRPOSE: A novel LWIR Thermal Image Dataset and Benchmark
by: Upadhyay, Avinash, et al.
Published: (2024)
by: Upadhyay, Avinash, et al.
Published: (2024)
DCPT: Darkness Clue-Prompted Tracking in Nighttime UAVs
by: Zhu, Jiawen, et al.
Published: (2023)
by: Zhu, Jiawen, et al.
Published: (2023)
Hand Biometrics in Digital Forensics
by: Bera, Asish, et al.
Published: (2024)
by: Bera, Asish, et al.
Published: (2024)
Similar Items
-
Towards Effective Image Forensics via A Novel Computationally Efficient Framework and A New Image Splice Dataset
by: Yadav, Ankit, et al.
Published: (2024) -
A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler
by: Yadav, Ankit, et al.
Published: (2024) -
A Noise and Edge extraction-based dual-branch method for Shallowfake and Deepfake Localization
by: Dagar, Deepak, et al.
Published: (2024) -
Gait Recognition with Temporal Kolmogorov-Arnold Networks
by: Asad, Mohammed, et al.
Published: (2026) -
Contrastive Learning-based Multi Modal Architecture for Emoticon Prediction by Employing Image-Text Pairs
by: Pandey, Ananya, et al.
Published: (2024)