MACEval: A Multi-Agent Continual Evaluation Network for Large Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Zijian, Sun, Yuze, Tian, Yuan, Zhang, Wenjun, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Just Noticeable Difference for Large Multimodal Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
by: Zhang, Zeyu, et al.
Published: (2025)
by: Zhang, Zeyu, et al.
Published: (2025)
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
by: Chen, Zijian, et al.
Published: (2024)
by: Chen, Zijian, et al.
Published: (2024)
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
by: Tian, Yuan, et al.
Published: (2024)
by: Tian, Yuan, et al.
Published: (2024)
Can Large Models Fool the Eye? A New Turing Test for Biological Animation
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
by: Chen, Zijian, et al.
Published: (2024)
by: Chen, Zijian, et al.
Published: (2024)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
by: Wang, Xianfeng, et al.
Published: (2026)
by: Wang, Xianfeng, et al.
Published: (2026)
Engagement Prediction of Short Videos with Large Multimodal Models
by: Sun, Wei, et al.
Published: (2025)
by: Sun, Wei, et al.
Published: (2025)
PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
by: Zhang, Weixia, et al.
Published: (2021)
by: Zhang, Weixia, et al.
Published: (2021)
A$^3$: Towards Advertising Aesthetic Assessment
by: Ji, Kaiyuan, et al.
Published: (2026)
by: Ji, Kaiyuan, et al.
Published: (2026)
Mitigating Long-tail Distribution in Oracle Bone Inscriptions: Dataset, Model, and Benchmark
by: Li, Jinhao, et al.
Published: (2025)
by: Li, Jinhao, et al.
Published: (2025)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
by: Wang, Puyi, et al.
Published: (2024)
by: Wang, Puyi, et al.
Published: (2024)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
by: Zhang, Zhichao, et al.
Published: (2024)
by: Zhang, Zhichao, et al.
Published: (2024)
Medical Manifestation-Aware De-Identification
by: Tian, Yuan, et al.
Published: (2024)
by: Tian, Yuan, et al.
Published: (2024)
Exploring the Naturalness of AI-Generated Images
by: Chen, Zijian, et al.
Published: (2023)
by: Chen, Zijian, et al.
Published: (2023)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
by: Sun, Yinan, et al.
Published: (2024)
by: Sun, Yinan, et al.
Published: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
by: Zhang, Yiming, et al.
Published: (2025)
by: Zhang, Yiming, et al.
Published: (2025)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
by: Zhang, Kaiwei, et al.
Published: (2025)
by: Zhang, Kaiwei, et al.
Published: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
by: Zheng, Yushuo, et al.
Published: (2026)
by: Zheng, Yushuo, et al.
Published: (2026)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
by: Wang, Jiarui, et al.
Published: (2025)
by: Wang, Jiarui, et al.
Published: (2025)
Find Them All: Unveiling MLLMs for Versatile Person Re-identification
by: Li, Jinhao, et al.
Published: (2025)
by: Li, Jinhao, et al.
Published: (2025)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
by: Min, Xiongkuo, et al.
Published: (2024)
by: Min, Xiongkuo, et al.
Published: (2024)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
by: Liu, Lu, et al.
Published: (2026)
by: Liu, Lu, et al.
Published: (2026)
Semantics versus Identity: A Divide-and-Conquer Approach towards Adjustable Medical Image De-Identification
by: Tian, Yuan, et al.
Published: (2025)
by: Tian, Yuan, et al.
Published: (2025)
3DGS-IEval-15K: A Large-scale Image Quality Evaluation Database for 3D Gaussian-Splatting
by: Xing, Yuke, et al.
Published: (2025)
by: Xing, Yuke, et al.
Published: (2025)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
by: Ji, Kaiyuan, et al.
Published: (2025)
by: Ji, Kaiyuan, et al.
Published: (2025)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
by: Wang, Juntong, et al.
Published: (2026)
by: Wang, Juntong, et al.
Published: (2026)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
by: Chen, Honghua, et al.
Published: (2026)
by: Chen, Honghua, et al.
Published: (2026)
GraphGeo: Multi-Agent Debate Framework for Visual Geo-localization with Heterogeneous Graph Neural Networks
by: Zheng, Heng, et al.
Published: (2025)
by: Zheng, Heng, et al.
Published: (2025)
Towards All-in-One Medical Image Re-Identification
by: Tian, Yuan, et al.
Published: (2025)
by: Tian, Yuan, et al.
Published: (2025)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
by: Sun, Yinan, et al.
Published: (2025)
by: Sun, Yinan, et al.
Published: (2025)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
by: Fu, Kang, et al.
Published: (2025)
by: Fu, Kang, et al.
Published: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
by: Wang, Jiarui, et al.
Published: (2025)
by: Wang, Jiarui, et al.
Published: (2025)
ShadowRefiner: Towards Mask-free Shadow Removal via Fast Fourier Transformer
by: Dong, Wei, et al.
Published: (2024)
by: Dong, Wei, et al.
Published: (2024)
FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment
by: Wu, Sijing, et al.
Published: (2025)
by: Wu, Sijing, et al.
Published: (2025)
Constrained Dynamic Gaussian Splatting
by: Zheng, Zihan, et al.
Published: (2026)
by: Zheng, Zihan, et al.
Published: (2026)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
by: Wang, Juntong, et al.
Published: (2025)
by: Wang, Juntong, et al.
Published: (2025)
Similar Items
-
Just Noticeable Difference for Large Multimodal Models
by: Chen, Zijian, et al.
Published: (2025) -
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
by: Zhang, Zeyu, et al.
Published: (2025) -
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
by: Chen, Zijian, et al.
Published: (2024) -
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
by: Tian, Yuan, et al.
Published: (2024) -
Can Large Models Fool the Eye? A New Turing Test for Biological Animation
by: Chen, Zijian, et al.
Published: (2025)