MACEval: A Multi-Agent Continual Evaluation Network for Large Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zijian, Sun, Yuze, Tian, Yuan, Zhang, Wenjun, Zhai, Guangtao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Just Noticeable Difference for Large Multimodal Models
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
por: Chen, Zijian, et al.
Publicado: (2024)
por: Chen, Zijian, et al.
Publicado: (2024)
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
por: Tian, Yuan, et al.
Publicado: (2024)
por: Tian, Yuan, et al.
Publicado: (2024)
Can Large Models Fool the Eye? A New Turing Test for Biological Animation
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
GAIA: Rethinking Action Quality Assessment for AI-Generated Videos
por: Chen, Zijian, et al.
Publicado: (2024)
por: Chen, Zijian, et al.
Publicado: (2024)
KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
por: Wang, Xianfeng, et al.
Publicado: (2026)
por: Wang, Xianfeng, et al.
Publicado: (2026)
Engagement Prediction of Short Videos with Large Multimodal Models
por: Sun, Wei, et al.
Publicado: (2025)
por: Sun, Wei, et al.
Publicado: (2025)
PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
Task-Specific Normalization for Continual Learning of Blind Image Quality Models
por: Zhang, Weixia, et al.
Publicado: (2021)
por: Zhang, Weixia, et al.
Publicado: (2021)
A$^3$: Towards Advertising Aesthetic Assessment
por: Ji, Kaiyuan, et al.
Publicado: (2026)
por: Ji, Kaiyuan, et al.
Publicado: (2026)
Mitigating Long-tail Distribution in Oracle Bone Inscriptions: Dataset, Model, and Benchmark
por: Li, Jinhao, et al.
Publicado: (2025)
por: Li, Jinhao, et al.
Publicado: (2025)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
por: Wang, Puyi, et al.
Publicado: (2024)
por: Wang, Puyi, et al.
Publicado: (2024)
Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model
por: Zhang, Zhichao, et al.
Publicado: (2024)
por: Zhang, Zhichao, et al.
Publicado: (2024)
Medical Manifestation-Aware De-Identification
por: Tian, Yuan, et al.
Publicado: (2024)
por: Tian, Yuan, et al.
Publicado: (2024)
Exploring the Naturalness of AI-Generated Images
por: Chen, Zijian, et al.
Publicado: (2023)
por: Chen, Zijian, et al.
Publicado: (2023)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
por: Sun, Yinan, et al.
Publicado: (2024)
por: Sun, Yinan, et al.
Publicado: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
Mesh Mamba: A Unified State Space Model for Saliency Prediction in Non-Textured and Textured Meshes
por: Zhang, Kaiwei, et al.
Publicado: (2025)
por: Zhang, Kaiwei, et al.
Publicado: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
por: Zheng, Yushuo, et al.
Publicado: (2026)
por: Zheng, Yushuo, et al.
Publicado: (2026)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
por: Wang, Jiarui, et al.
Publicado: (2025)
por: Wang, Jiarui, et al.
Publicado: (2025)
Find Them All: Unveiling MLLMs for Versatile Person Re-identification
por: Li, Jinhao, et al.
Publicado: (2025)
por: Li, Jinhao, et al.
Publicado: (2025)
Exploring Rich Subjective Quality Information for Image Quality Assessment in the Wild
por: Min, Xiongkuo, et al.
Publicado: (2024)
por: Min, Xiongkuo, et al.
Publicado: (2024)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
por: Liu, Lu, et al.
Publicado: (2026)
por: Liu, Lu, et al.
Publicado: (2026)
Semantics versus Identity: A Divide-and-Conquer Approach towards Adjustable Medical Image De-Identification
por: Tian, Yuan, et al.
Publicado: (2025)
por: Tian, Yuan, et al.
Publicado: (2025)
3DGS-IEval-15K: A Large-scale Image Quality Evaluation Database for 3D Gaussian-Splatting
por: Xing, Yuke, et al.
Publicado: (2025)
por: Xing, Yuke, et al.
Publicado: (2025)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
por: Ji, Kaiyuan, et al.
Publicado: (2025)
por: Ji, Kaiyuan, et al.
Publicado: (2025)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
por: Wang, Juntong, et al.
Publicado: (2026)
por: Wang, Juntong, et al.
Publicado: (2026)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
por: Chen, Honghua, et al.
Publicado: (2026)
por: Chen, Honghua, et al.
Publicado: (2026)
GraphGeo: Multi-Agent Debate Framework for Visual Geo-localization with Heterogeneous Graph Neural Networks
por: Zheng, Heng, et al.
Publicado: (2025)
por: Zheng, Heng, et al.
Publicado: (2025)
Towards All-in-One Medical Image Re-Identification
por: Tian, Yuan, et al.
Publicado: (2025)
por: Tian, Yuan, et al.
Publicado: (2025)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy
por: Sun, Yinan, et al.
Publicado: (2025)
por: Sun, Yinan, et al.
Publicado: (2025)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
por: Fu, Kang, et al.
Publicado: (2025)
por: Fu, Kang, et al.
Publicado: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
por: Wang, Jiarui, et al.
Publicado: (2025)
por: Wang, Jiarui, et al.
Publicado: (2025)
ShadowRefiner: Towards Mask-free Shadow Removal via Fast Fourier Transformer
por: Dong, Wei, et al.
Publicado: (2024)
por: Dong, Wei, et al.
Publicado: (2024)
FVQ: A Large-Scale Dataset and an LMM-based Method for Face Video Quality Assessment
por: Wu, Sijing, et al.
Publicado: (2025)
por: Wu, Sijing, et al.
Publicado: (2025)
Constrained Dynamic Gaussian Splatting
por: Zheng, Zihan, et al.
Publicado: (2026)
por: Zheng, Zihan, et al.
Publicado: (2026)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
por: Wang, Juntong, et al.
Publicado: (2025)
por: Wang, Juntong, et al.
Publicado: (2025)
Ejemplares similares
-
Just Noticeable Difference for Large Multimodal Models
por: Chen, Zijian, et al.
Publicado: (2025) -
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
por: Zhang, Zeyu, et al.
Publicado: (2025) -
OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?
por: Chen, Zijian, et al.
Publicado: (2024) -
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
por: Tian, Yuan, et al.
Publicado: (2024) -
Can Large Models Fool the Eye? A New Turing Test for Biological Animation
por: Chen, Zijian, et al.
Publicado: (2025)