Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Fan, Tian, Shulin, Huang, Ziqi, Qiao, Yu, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024)
par: Tian, Shulin, et autres
Publié: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
par: Tu, Rong-Cheng, et autres
Publié: (2024)
par: Tu, Rong-Cheng, et autres
Publié: (2024)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
par: Zhu, Fanwei, et autres
Publié: (2025)
par: Zhu, Fanwei, et autres
Publié: (2025)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
par: Guo, Ziyu, et autres
Publié: (2024)
par: Guo, Ziyu, et autres
Publié: (2024)
A Survey on Evaluation of Multimodal Large Language Models
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
par: Huang, Jinsheng, et autres
Publié: (2024)
par: Huang, Jinsheng, et autres
Publié: (2024)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
par: Zhao, Yiming, et autres
Publié: (2025)
par: Zhao, Yiming, et autres
Publié: (2025)
Cut2Next: Generating Next Shot via In-Context Tuning
par: He, Jingwen, et autres
Publié: (2025)
par: He, Jingwen, et autres
Publié: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation
par: Nguyen, Giang Son, et autres
Publié: (2026)
par: Nguyen, Giang Son, et autres
Publié: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
par: Zhou, Ziwei, et autres
Publié: (2026)
par: Zhou, Ziwei, et autres
Publié: (2026)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
par: Qi, Yukun, et autres
Publié: (2025)
par: Qi, Yukun, et autres
Publié: (2025)
Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
par: Wu, Qianhui, et autres
Publié: (2025)
par: Wu, Qianhui, et autres
Publié: (2025)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
par: Leng, Jixuan, et autres
Publié: (2025)
par: Leng, Jixuan, et autres
Publié: (2025)
How Well Do Multi-modal LLMs Interpret CT Scans? An Auto-Evaluation Framework for Analyses
par: Zhu, Qingqing, et autres
Publié: (2024)
par: Zhu, Qingqing, et autres
Publié: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
par: Pang, Ziqi, et autres
Publié: (2023)
par: Pang, Ziqi, et autres
Publié: (2023)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
VideoScore2: Think before You Score in Generative Video Evaluation
par: He, Xuan, et autres
Publié: (2025)
par: He, Xuan, et autres
Publié: (2025)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
par: Wang, Qineng, et autres
Publié: (2025)
par: Wang, Qineng, et autres
Publié: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
par: Chen, Kesheng, et autres
Publié: (2026)
par: Chen, Kesheng, et autres
Publié: (2026)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation
par: Gao, Qiyue, et autres
Publié: (2025)
par: Gao, Qiyue, et autres
Publié: (2025)
MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding
par: Ye, Zhoutong, et autres
Publié: (2025)
par: Ye, Zhoutong, et autres
Publié: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
par: Liu, Daixian, et autres
Publié: (2026)
par: Liu, Daixian, et autres
Publié: (2026)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
par: Guo, Hongcheng, et autres
Publié: (2024)
par: Guo, Hongcheng, et autres
Publié: (2024)
Documents similaires
-
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024) -
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024) -
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
par: Tu, Rong-Cheng, et autres
Publié: (2024) -
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
par: Zhu, Fanwei, et autres
Publié: (2025) -
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)