EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Shuhao, Fan, Haotian, Fu, Jiachen, Li, Liang, Li, Tao, Cui, Junhui, Wang, Yunqiu, Tai, Yang, Sun, Jingwei, Guo, Chunle, Li, Chongyi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
by: Liao, Wenjie, et al.
Published: (2025)
by: Liao, Wenjie, et al.
Published: (2025)
Better Supervised Fine-tuning for VQA: Integer-Only Loss
by: Qian, Baihong, et al.
Published: (2025)
by: Qian, Baihong, et al.
Published: (2025)
TimeMachine: Fine-Grained Facial Age Editing with Identity Preservation
by: Mi, Yilin, et al.
Published: (2025)
by: Mi, Yilin, et al.
Published: (2025)
DetectAnyLLM: Towards Generalizable and Robust Detection of Machine-Generated Text Across Domains and Models
by: Fu, Jiachen, et al.
Published: (2025)
by: Fu, Jiachen, et al.
Published: (2025)
IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model
by: Chen, Yifan, et al.
Published: (2026)
by: Chen, Yifan, et al.
Published: (2026)
ACORN: Adaptive Contrastive Optimization for Safe and Robust Fine-Grained Robotic Manipulation
by: Zhou, Zhongquan, et al.
Published: (2025)
by: Zhou, Zhongquan, et al.
Published: (2025)
K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences
by: Li, Zhikai, et al.
Published: (2024)
by: Li, Zhikai, et al.
Published: (2024)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
by: Ji, Fengxian, et al.
Published: (2025)
by: Ji, Fengxian, et al.
Published: (2025)
3D-UIR: 3D Gaussian for Underwater 3D Scene Reconstruction via Physics Based Appearance-Medium Decoupling
by: Yuan, Jieyu, et al.
Published: (2025)
by: Yuan, Jieyu, et al.
Published: (2025)
VTinker: Guided Flow Upsampling and Texture Mapping for High-Resolution Video Frame Interpolation
by: Wu, Chenyang, et al.
Published: (2025)
by: Wu, Chenyang, et al.
Published: (2025)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
T2I-FineEval: Fine-Grained Compositional Metric for Text-to-Image Evaluation
by: Hosseini, Seyed Mohammad Hadi, et al.
Published: (2025)
by: Hosseini, Seyed Mohammad Hadi, et al.
Published: (2025)
Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
by: Jiang, Changhao, et al.
Published: (2026)
by: Jiang, Changhao, et al.
Published: (2026)
Fine-Grained Sentiment Analysis of Electric Vehicle User Reviews: A Bidirectional LSTM Approach to Capturing Emotional Intensity in Chinese Text
by: Chen, Shuhao, et al.
Published: (2024)
by: Chen, Shuhao, et al.
Published: (2024)
BatchEval: Towards Human-like Text Evaluation
by: Yuan, Peiwen, et al.
Published: (2023)
by: Yuan, Peiwen, et al.
Published: (2023)
Incorporating Uncertainty-Guided and Top-k Codebook Matching for Real-World Blind Image Super-Resolution
by: Wen, Weilei, et al.
Published: (2025)
by: Wen, Weilei, et al.
Published: (2025)
The Devil is in the Details: Boosting Guided Depth Super-Resolution via Rethinking Cross-Modal Alignment and Aggregation
by: Jiang, Xinni, et al.
Published: (2024)
by: Jiang, Xinni, et al.
Published: (2024)
FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition
by: Yu, Enhui, et al.
Published: (2026)
by: Yu, Enhui, et al.
Published: (2026)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
by: Yan, Lian, et al.
Published: (2025)
by: Yan, Lian, et al.
Published: (2025)
Towards Fine-Grained Text-to-3D Quality Assessment: A Benchmark and A Two-Stage Rank-Learning Metric
by: Cui, Bingyang, et al.
Published: (2025)
by: Cui, Bingyang, et al.
Published: (2025)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
by: Liu, Chuang, et al.
Published: (2024)
by: Liu, Chuang, et al.
Published: (2024)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters
by: Luo, Hanjun, et al.
Published: (2026)
by: Luo, Hanjun, et al.
Published: (2026)
RAM++: Robust Representation Learning via Adaptive Mask for All-in-One Image Restoration
by: Zhang, Zilong, et al.
Published: (2025)
by: Zhang, Zilong, et al.
Published: (2025)
DiffRetouch: Using Diffusion to Retouch on the Shoulder of Experts
by: Duan, Zheng-Peng, et al.
Published: (2024)
by: Duan, Zheng-Peng, et al.
Published: (2024)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
by: Li, Xinhao, et al.
Published: (2024)
by: Li, Xinhao, et al.
Published: (2024)
Fine-Grained Traffic Inference from Road to Lane via Spatio-Temporal Graph Node Generation
by: Li, Shuhao, et al.
Published: (2025)
by: Li, Shuhao, et al.
Published: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Distortion risk measures of sums of two counter-monotonic risks
by: Huang, Chunle
Published: (2025)
by: Huang, Chunle
Published: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
by: Li, Youquan, et al.
Published: (2024)
by: Li, Youquan, et al.
Published: (2024)
Human-LLM Hybrid Text Answer Aggregation for Crowd Annotations
by: Li, Jiyi
Published: (2024)
by: Li, Jiyi
Published: (2024)
DeFine: A Decomposed and Fine-Grained Annotated Dataset for Long-form Article Generation
by: Wang, Ming, et al.
Published: (2025)
by: Wang, Ming, et al.
Published: (2025)
A Systematic Investigation on Deep Learning-Based Omnidirectional Image and Video Super-Resolution
by: Zhao, Qianqian, et al.
Published: (2025)
by: Zhao, Qianqian, et al.
Published: (2025)
Classic Video Denoising in a Machine Learning World: Robust, Fast, and Controllable
by: Jin, Xin, et al.
Published: (2025)
by: Jin, Xin, et al.
Published: (2025)
Fg-T2M++: LLMs-Augmented Fine-Grained Text Driven Human Motion Generation
by: Wang, Yin, et al.
Published: (2025)
by: Wang, Yin, et al.
Published: (2025)
LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text
by: yunhan, Li, et al.
Published: (2025)
by: yunhan, Li, et al.
Published: (2025)
SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials
by: Li, Zhaohui, et al.
Published: (2026)
by: Li, Zhaohui, et al.
Published: (2026)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
by: Islam, Mohammed Saidul, et al.
Published: (2026)
by: Islam, Mohammed Saidul, et al.
Published: (2026)
AFaCTA: Assisting the Annotation of Factual Claim Detection with Reliable LLM Annotators
by: Ni, Jingwei, et al.
Published: (2024)
by: Ni, Jingwei, et al.
Published: (2024)
Similar Items
-
ViDA-UGC: Detailed Image Quality Analysis via Visual Distortion Assessment for UGC Images
by: Liao, Wenjie, et al.
Published: (2025) -
Better Supervised Fine-tuning for VQA: Integer-Only Loss
by: Qian, Baihong, et al.
Published: (2025) -
TimeMachine: Fine-Grained Facial Age Editing with Identity Preservation
by: Mi, Yilin, et al.
Published: (2025) -
DetectAnyLLM: Towards Generalizable and Robust Detection of Machine-Generated Text Across Domains and Models
by: Fu, Jiachen, et al.
Published: (2025) -
IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model
by: Chen, Yifan, et al.
Published: (2026)