LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiarui, Duan, Huiyu, Zhao, Yu, Wang, Juntong, Zhai, Guangtao, Min, Xiongkuo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
par: Wang, Juntong, et autres
Publié: (2026)
par: Wang, Juntong, et autres
Publié: (2026)
Quality Assessment for AI Generated Images with Instruction Tuning
par: Wang, Jiarui, et autres
Publié: (2024)
par: Wang, Jiarui, et autres
Publié: (2024)
LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs
par: Yang, Woo Yi, et autres
Publié: (2025)
par: Yang, Woo Yi, et autres
Publié: (2025)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment
par: Wu, Sijing, et autres
Publié: (2025)
par: Wu, Sijing, et autres
Publié: (2025)
DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
par: Ge, Qihang, et autres
Publié: (2024)
par: Ge, Qihang, et autres
Publié: (2024)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
How is Visual Attention Influenced by Text Guidance? Database and Model
par: Sun, Yinan, et autres
Publié: (2024)
par: Sun, Yinan, et autres
Publié: (2024)
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
par: Zheng, Yushuo, et autres
Publié: (2026)
par: Zheng, Yushuo, et autres
Publié: (2026)
UniProcessor: A Text-induced Unified Low-level Image Processor
par: Duan, Huiyu, et autres
Publié: (2024)
par: Duan, Huiyu, et autres
Publié: (2024)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
par: Chen, Honghua, et autres
Publié: (2026)
par: Chen, Honghua, et autres
Publié: (2026)
Quality Assessment and Distortion-aware Saliency Prediction for AI-Generated Omnidirectional Images
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
par: Wu, Sijing, et autres
Publié: (2026)
par: Wu, Sijing, et autres
Publié: (2026)
LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue
par: Li, Chaoyue, et autres
Publié: (2026)
par: Li, Chaoyue, et autres
Publié: (2026)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
par: Zhu, Xiaorong, et autres
Publié: (2025)
par: Zhu, Xiaorong, et autres
Publié: (2025)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
par: Gao, Shiqi, et autres
Publié: (2026)
par: Gao, Shiqi, et autres
Publié: (2026)
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
par: Yan, Shilin, et autres
Publié: (2025)
par: Yan, Shilin, et autres
Publié: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
par: Li, Yunhao, et autres
Publié: (2026)
par: Li, Yunhao, et autres
Publié: (2026)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2025)
par: Jia, Ziheng, et autres
Publié: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
par: Gao, Lancheng, et autres
Publié: (2026)
par: Gao, Lancheng, et autres
Publié: (2026)
LMM-Regularized CLIP Embeddings for Image Classification
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
F-LMM: Grounding Frozen Large Multimodal Models
par: Wu, Size, et autres
Publié: (2024)
par: Wu, Size, et autres
Publié: (2024)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
par: Fu, Kang, et autres
Publié: (2025)
par: Fu, Kang, et autres
Publié: (2025)
Perceptual Video Quality Assessment: A Survey
par: Min, Xiongkuo, et autres
Publié: (2024)
par: Min, Xiongkuo, et autres
Publié: (2024)
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
par: Gao, Shiqi, et autres
Publié: (2026)
par: Gao, Shiqi, et autres
Publié: (2026)
Disturbing Image Detection Using LMM-Elicited Emotion Embeddings
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
par: Li, Yunhao, et autres
Publié: (2025)
par: Li, Yunhao, et autres
Publié: (2025)
Teaching LMMs for Image Quality Scoring and Interpreting
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
Documents similaires
-
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
par: Wang, Jiarui, et autres
Publié: (2024) -
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025) -
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
par: Wang, Juntong, et autres
Publié: (2025) -
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
par: Wang, Juntong, et autres
Publié: (2025) -
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
par: Wang, Juntong, et autres
Publié: (2025)