Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Yiran, Cao, Yun, Yang, Bowen, Zhang, Zeyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
por: Pang, Yuqi, et al.
Publicado: (2025)
por: Pang, Yuqi, et al.
Publicado: (2025)
Integrating Multimodal Large Language Model Knowledge into Amodal Completion
por: Yun, Heecheol, et al.
Publicado: (2026)
por: Yun, Heecheol, et al.
Publicado: (2026)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
por: Zhu, Muzhi, et al.
Publicado: (2025)
por: Zhu, Muzhi, et al.
Publicado: (2025)
MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection
por: Moglia, Andrea, et al.
Publicado: (2024)
por: Moglia, Andrea, et al.
Publicado: (2024)
Can Multimodal Large Language Models Truly Understand Small Objects?
por: Han, Fujun, et al.
Publicado: (2026)
por: Han, Fujun, et al.
Publicado: (2026)
GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval
por: Yang, Bowen, et al.
Publicado: (2025)
por: Yang, Bowen, et al.
Publicado: (2025)
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
por: Chen, Shuo, et al.
Publicado: (2023)
por: Chen, Shuo, et al.
Publicado: (2023)
MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
por: Pang, Yuqi, et al.
Publicado: (2025)
por: Pang, Yuqi, et al.
Publicado: (2025)
Toward Cognitive Supersensing in Multimodal Large Language Model
por: Li, Boyi, et al.
Publicado: (2026)
por: Li, Boyi, et al.
Publicado: (2026)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
por: Liao, Haicheng, et al.
Publicado: (2023)
por: Liao, Haicheng, et al.
Publicado: (2023)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
por: Zheng, Shurong, et al.
Publicado: (2026)
por: Zheng, Shurong, et al.
Publicado: (2026)
TRINS: Towards Multimodal Language Models that Can Read
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
por: Fu, Xingyu, et al.
Publicado: (2024)
por: Fu, Xingyu, et al.
Publicado: (2024)
UlcerGPT: A Multimodal Approach Leveraging Large Language and Vision Models for Diabetic Foot Ulcer Image Transcription
por: Basiri, Reza, et al.
Publicado: (2024)
por: Basiri, Reza, et al.
Publicado: (2024)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
por: Muhtar, Dilxat, et al.
Publicado: (2024)
por: Muhtar, Dilxat, et al.
Publicado: (2024)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Can Multimodal Large Language Models Understand Pathologic Movements? A Pilot Study on Seizure Semiology
por: Zhang, Lina, et al.
Publicado: (2026)
por: Zhang, Lina, et al.
Publicado: (2026)
Multimodal Prompt Alignment for Facial Expression Recognition
por: Ma, Fuyan, et al.
Publicado: (2025)
por: Ma, Fuyan, et al.
Publicado: (2025)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
por: Li, Qingmei, et al.
Publicado: (2025)
por: Li, Qingmei, et al.
Publicado: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
por: Sun, Jianwen, et al.
Publicado: (2025)
por: Sun, Jianwen, et al.
Publicado: (2025)
Erase Persona, Forget Lore: Benchmarking Multimodal Copyright Unlearning in Large Vision Language Models
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
por: Kwon, JuneHyoung, et al.
Publicado: (2026)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
por: Li, Xiujun, et al.
Publicado: (2023)
por: Li, Xiujun, et al.
Publicado: (2023)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
por: Tang, Jianting, et al.
Publicado: (2025)
por: Tang, Jianting, et al.
Publicado: (2025)
Efficient Multimodal Large Language Models: A Survey
por: Jin, Yizhang, et al.
Publicado: (2024)
por: Jin, Yizhang, et al.
Publicado: (2024)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
por: Fang, Chengyu, et al.
Publicado: (2026)
por: Fang, Chengyu, et al.
Publicado: (2026)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
por: Zhang, Xingxuan, et al.
Publicado: (2024)
por: Zhang, Xingxuan, et al.
Publicado: (2024)
Through the Theory of Mind's Eye: Reading Minds with Multimodal Video Large Language Models
por: Chen, Zhawnen, et al.
Publicado: (2024)
por: Chen, Zhawnen, et al.
Publicado: (2024)
Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
por: Cao, Pu, et al.
Publicado: (2023)
por: Cao, Pu, et al.
Publicado: (2023)
Vision Language Model-Empowered Contract Theory for AIGC Task Allocation in Teleoperation
por: Zhan, Zijun, et al.
Publicado: (2024)
por: Zhan, Zijun, et al.
Publicado: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
por: Chen, Xiaohui, et al.
Publicado: (2024)
por: Chen, Xiaohui, et al.
Publicado: (2024)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
por: Chen, Junkai, et al.
Publicado: (2026)
por: Chen, Junkai, et al.
Publicado: (2026)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026)
por: Yin, Jianghao, et al.
Publicado: (2026)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
por: Tao, Zhou, et al.
Publicado: (2025)
por: Tao, Zhou, et al.
Publicado: (2025)
LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
por: Duan, Yinglin, et al.
Publicado: (2025)
por: Duan, Yinglin, et al.
Publicado: (2025)
Can visual language models resolve textual ambiguity with visual cues? Let visual puns tell you!
por: Chung, Jiwan, et al.
Publicado: (2024)
por: Chung, Jiwan, et al.
Publicado: (2024)
GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models
por: Ye, Zhankai, et al.
Publicado: (2026)
por: Ye, Zhankai, et al.
Publicado: (2026)
RU-AI: A Large Multimodal Dataset for Machine-Generated Content Detection
por: Huang, Liting, et al.
Publicado: (2024)
por: Huang, Liting, et al.
Publicado: (2024)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
por: Wu, Kai, et al.
Publicado: (2024)
por: Wu, Kai, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
por: He, Jinlong, et al.
Publicado: (2024)
por: He, Jinlong, et al.
Publicado: (2024)
Ejemplares similares
-
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
por: Pang, Yuqi, et al.
Publicado: (2025) -
Integrating Multimodal Large Language Model Knowledge into Amodal Completion
por: Yun, Heecheol, et al.
Publicado: (2026) -
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
por: Zhao, Henry Hengyuan, et al.
Publicado: (2023) -
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
por: Zhu, Muzhi, et al.
Publicado: (2025) -
MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection
por: Moglia, Andrea, et al.
Publicado: (2024)