AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Ziyin, Luo, Yunpeng, Wu, Yuanchen, Sun, Ke, Ji, Jiayi, Yan, Ke, Ding, Shouhong, Sun, Xiaoshuai, Wu, Yunsheng, Ji, Rongrong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring the Collaborative Advantage of Low-level Information on Generalizable AI-Generated Image Detection
por: Zhou, Ziyin, et al.
Publicado: (2025)
por: Zhou, Ziyin, et al.
Publicado: (2025)
Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis
por: Wu, Hang, et al.
Publicado: (2025)
por: Wu, Hang, et al.
Publicado: (2025)
Towards General Visual-Linguistic Face Forgery Detection
por: Sun, Ke, et al.
Publicado: (2023)
por: Sun, Ke, et al.
Publicado: (2023)
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
por: Zhou, Ziyin, et al.
Publicado: (2024)
por: Zhou, Ziyin, et al.
Publicado: (2024)
Towards General Visual-Linguistic Face Forgery Detection(V2)
por: Sun, Ke, et al.
Publicado: (2025)
por: Sun, Ke, et al.
Publicado: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
por: Wu, Mingrui, et al.
Publicado: (2026)
por: Wu, Mingrui, et al.
Publicado: (2026)
DiffusionFake: Enhancing Generalization in Deepfake Detection via Guided Stable Diffusion
por: Sun, Ke, et al.
Publicado: (2024)
por: Sun, Ke, et al.
Publicado: (2024)
LaRE$^2$: Latent Reconstruction Error Based Method for Diffusion-Generated Image Detection
por: Luo, Yunpeng, et al.
Publicado: (2024)
por: Luo, Yunpeng, et al.
Publicado: (2024)
DiffusionFace: Towards a Comprehensive Dataset for Diffusion-Based Face Forgery Analysis
por: Chen, Zhongxi, et al.
Publicado: (2024)
por: Chen, Zhongxi, et al.
Publicado: (2024)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2024)
por: Wu, Qiong, et al.
Publicado: (2024)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
por: Lin, Weihuang, et al.
Publicado: (2025)
por: Lin, Weihuang, et al.
Publicado: (2025)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
por: Li, Jiale, et al.
Publicado: (2025)
por: Li, Jiale, et al.
Publicado: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
por: Luo, Yaxin, et al.
Publicado: (2024)
por: Luo, Yaxin, et al.
Publicado: (2024)
Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
por: Wu, Mingrui, et al.
Publicado: (2024)
por: Wu, Mingrui, et al.
Publicado: (2024)
Test-Time Computing for Referring Multimodal Large Language Models
por: Wu, Mingrui, et al.
Publicado: (2026)
por: Wu, Mingrui, et al.
Publicado: (2026)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Image Captioning via Dynamic Path Customization
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Orthogonal Subspace Decomposition for Generalizable AI-Generated Image Detection
por: Yan, Zhiyuan, et al.
Publicado: (2024)
por: Yan, Zhiyuan, et al.
Publicado: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
por: Tong, Bo, et al.
Publicado: (2024)
por: Tong, Bo, et al.
Publicado: (2024)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
por: Wang, Enguang, et al.
Publicado: (2026)
por: Wang, Enguang, et al.
Publicado: (2026)
Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models
por: Zhou, Yue, et al.
Publicado: (2026)
por: Zhou, Yue, et al.
Publicado: (2026)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
por: Wu, Mingrui, et al.
Publicado: (2024)
por: Wu, Mingrui, et al.
Publicado: (2024)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
por: Ji, Jiayi, et al.
Publicado: (2023)
por: Ji, Jiayi, et al.
Publicado: (2023)
Mixed Degradation Image Restoration via Local Dynamic Optimization and Conditional Embedding
por: Gu, Yubin, et al.
Publicado: (2024)
por: Gu, Yubin, et al.
Publicado: (2024)
Any-to-3D Generation via Hybrid Diffusion Supervision
por: Fan, Yijun, et al.
Publicado: (2024)
por: Fan, Yijun, et al.
Publicado: (2024)
Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection
por: Lin, Kaiqing, et al.
Publicado: (2025)
por: Lin, Kaiqing, et al.
Publicado: (2025)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
por: Zhang, Yang, et al.
Publicado: (2026)
por: Zhang, Yang, et al.
Publicado: (2026)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2024)
por: Wu, Qiong, et al.
Publicado: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
por: Yang, Danni, et al.
Publicado: (2024)
por: Yang, Danni, et al.
Publicado: (2024)
3D-GRES: Generalized 3D Referring Expression Segmentation
por: Wu, Changli, et al.
Publicado: (2024)
por: Wu, Changli, et al.
Publicado: (2024)
Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation
por: Liu, Sihan, et al.
Publicado: (2023)
por: Liu, Sihan, et al.
Publicado: (2023)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
por: Wu, Qiong, et al.
Publicado: (2024)
por: Wu, Qiong, et al.
Publicado: (2024)
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation
por: Ke, Shuyan, et al.
Publicado: (2026)
por: Ke, Shuyan, et al.
Publicado: (2026)
Beat: Bi-directional One-to-Many Embedding Alignment for Text-based Person Retrieval
por: Ma, Yiwei, et al.
Publicado: (2024)
por: Ma, Yiwei, et al.
Publicado: (2024)
Ejemplares similares
-
Exploring the Collaborative Advantage of Low-level Information on Generalizable AI-Generated Image Detection
por: Zhou, Ziyin, et al.
Publicado: (2025) -
Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
por: Wu, Yuanchen, et al.
Publicado: (2025) -
M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis
por: Wu, Hang, et al.
Publicado: (2025) -
Towards General Visual-Linguistic Face Forgery Detection
por: Sun, Ke, et al.
Publicado: (2023) -
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
por: Zhou, Ziyin, et al.
Publicado: (2024)