HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Fan, Zhen, Ru, Wang, Jianing, Zhang, Yanhao, Chen, Haoxiang, Lu, Haonan, Zhao, Sicheng, Ding, Guiguang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
by: Yang, Fan, et al.
Published: (2024)
by: Yang, Fan, et al.
Published: (2024)
Towards Explainable Partial-AIGC Image Quality Assessment
by: Qian, Jiaying, et al.
Published: (2025)
by: Qian, Jiaying, et al.
Published: (2025)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
by: Xie, Qingsong, et al.
Published: (2025)
by: Xie, Qingsong, et al.
Published: (2025)
More is Better: Deep Domain Adaptation with Multiple Sources
by: Zhao, Sicheng, et al.
Published: (2024)
by: Zhao, Sicheng, et al.
Published: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
by: Shen, Leqi, et al.
Published: (2025)
by: Shen, Leqi, et al.
Published: (2025)
CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs
by: Wang, Ao, et al.
Published: (2023)
by: Wang, Ao, et al.
Published: (2023)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
by: Liang, Zhijia, et al.
Published: (2026)
by: Liang, Zhijia, et al.
Published: (2026)
Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection
by: Zhou, Yue, et al.
Published: (2025)
by: Zhou, Yue, et al.
Published: (2025)
Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility
by: Hao, Yutong, et al.
Published: (2025)
by: Hao, Yutong, et al.
Published: (2025)
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
by: Wu, Qi, et al.
Published: (2025)
by: Wu, Qi, et al.
Published: (2025)
Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection
by: Jiang, Changjiang, et al.
Published: (2025)
by: Jiang, Changjiang, et al.
Published: (2025)
FastVID: Dynamic Density Pruning for Fast Video Large Language Models
by: Shen, Leqi, et al.
Published: (2025)
by: Shen, Leqi, et al.
Published: (2025)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
by: Sun, Fengyuan, et al.
Published: (2025)
by: Sun, Fengyuan, et al.
Published: (2025)
BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios
by: Tilak, Advait, et al.
Published: (2026)
by: Tilak, Advait, et al.
Published: (2026)
TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval
by: Shen, Leqi, et al.
Published: (2024)
by: Shen, Leqi, et al.
Published: (2024)
Advancing Video Quality Assessment for AIGC
by: Yue, Xinli, et al.
Published: (2024)
by: Yue, Xinli, et al.
Published: (2024)
Hierarchical Fusion and Joint Aggregation: A Multi-Level Feature Representation Method for AIGC Image Quality Assessment
by: Meng, Linghe, et al.
Published: (2025)
by: Meng, Linghe, et al.
Published: (2025)
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
by: Tang, Zhenchen, et al.
Published: (2025)
by: Tang, Zhenchen, et al.
Published: (2025)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
by: Hao, Tianxiang, et al.
Published: (2023)
by: Hao, Tianxiang, et al.
Published: (2023)
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
by: Liu, Peng, et al.
Published: (2025)
by: Liu, Peng, et al.
Published: (2025)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
by: Shen, Leqi, et al.
Published: (2025)
by: Shen, Leqi, et al.
Published: (2025)
Human-AI Collaboration Mechanism Study on AIGC Assisted Image Production for Special Coverage
by: Yang, Yajie, et al.
Published: (2025)
by: Yang, Yajie, et al.
Published: (2025)
Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding
by: Zhang, Haoyu, et al.
Published: (2025)
by: Zhang, Haoyu, et al.
Published: (2025)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
by: Li, Weihong, et al.
Published: (2025)
by: Li, Weihong, et al.
Published: (2025)
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
by: Wu, Qiucheng, et al.
Published: (2026)
by: Wu, Qiucheng, et al.
Published: (2026)
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
by: Alawode, Basit, et al.
Published: (2026)
by: Alawode, Basit, et al.
Published: (2026)
EditGarment: An Instruction-Based Garment Editing Dataset Constructed with Automated MLLM Synthesis and Semantic-Aware Evaluation
by: Yin, Deqiang, et al.
Published: (2025)
by: Yin, Deqiang, et al.
Published: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
by: Liang, Yiwen, et al.
Published: (2025)
by: Liang, Yiwen, et al.
Published: (2025)
Thinking in Streaming Video
by: Liu, Zikang, et al.
Published: (2026)
by: Liu, Zikang, et al.
Published: (2026)
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility
by: Motamed, Saman, et al.
Published: (2025)
by: Motamed, Saman, et al.
Published: (2025)
Quantized Prompt for Efficient Generalization of Vision-Language Models
by: Hao, Tianxiang, et al.
Published: (2024)
by: Hao, Tianxiang, et al.
Published: (2024)
Source-Free Object Detection with Detection Transformer
by: Yao, Huizai, et al.
Published: (2025)
by: Yao, Huizai, et al.
Published: (2025)
Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See
by: Zhang, Zeliang, et al.
Published: (2024)
by: Zhang, Zeliang, et al.
Published: (2024)
UNICBench: UNIfied Counting Benchmark for MLLM
by: Rong, Chenggang, et al.
Published: (2026)
by: Rong, Chenggang, et al.
Published: (2026)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
by: Xu, Jingwei, et al.
Published: (2024)
by: Xu, Jingwei, et al.
Published: (2024)
Efficient Motion-Aware Video MLLM
by: Zhao, Zijia, et al.
Published: (2025)
by: Zhao, Zijia, et al.
Published: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
by: Ren, Xiaoming, et al.
Published: (2026)
by: Ren, Xiaoming, et al.
Published: (2026)
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
by: Han, Hui, et al.
Published: (2026)
by: Han, Hui, et al.
Published: (2026)
VCP-CLIP: A visual context prompting model for zero-shot anomaly segmentation
by: Qu, Zhen, et al.
Published: (2024)
by: Qu, Zhen, et al.
Published: (2024)
PCQA: A Strong Baseline for AIGC Quality Assessment Based on Prompt Condition
by: Fang, Xi, et al.
Published: (2024)
by: Fang, Xi, et al.
Published: (2024)
Similar Items
-
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
by: Yang, Fan, et al.
Published: (2024) -
Towards Explainable Partial-AIGC Image Quality Assessment
by: Qian, Jiaying, et al.
Published: (2025) -
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
by: Xie, Qingsong, et al.
Published: (2025) -
More is Better: Deep Domain Adaptation with Multiple Sources
by: Zhao, Sicheng, et al.
Published: (2024) -
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
by: Shen, Leqi, et al.
Published: (2025)