Judge Model for Large-scale Multimodality Benchmarks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shih, Min-Han, Wu, Yu-Hsin, Chen, Yu-Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
InnoGym: Benchmarking the Innovation Potential of AI Agents
von: Zhang, Jintian, et al.
Veröffentlicht: (2025)
von: Zhang, Jintian, et al.
Veröffentlicht: (2025)
Exploring Model Kinship for Merging Large Language Models
von: Hu, Yedi, et al.
Veröffentlicht: (2024)
von: Hu, Yedi, et al.
Veröffentlicht: (2024)
Chain of Questions: Guiding Multimodal Curiosity in Language Models
von: Iji, Nima, et al.
Veröffentlicht: (2025)
von: Iji, Nima, et al.
Veröffentlicht: (2025)
Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts
von: Efat, Azher Ahmed, et al.
Veröffentlicht: (2026)
von: Efat, Azher Ahmed, et al.
Veröffentlicht: (2026)
Agent Planning with World Knowledge Model
von: Qiao, Shuofei, et al.
Veröffentlicht: (2024)
von: Qiao, Shuofei, et al.
Veröffentlicht: (2024)
SkillNet: Create, Evaluate, and Connect AI Skills
von: Liang, Yuan, et al.
Veröffentlicht: (2026)
von: Liang, Yuan, et al.
Veröffentlicht: (2026)
MedChat: A Multi-Agent Framework for Multimodal Diagnosis with Large Language Models
von: Liu, Philip R., et al.
Veröffentlicht: (2025)
von: Liu, Philip R., et al.
Veröffentlicht: (2025)
SynWorld: Virtual Scenario Synthesis for Agentic Action Knowledge Refinement
von: Fang, Runnan, et al.
Veröffentlicht: (2025)
von: Fang, Runnan, et al.
Veröffentlicht: (2025)
Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent System
von: Su, Haoyang, et al.
Veröffentlicht: (2024)
von: Su, Haoyang, et al.
Veröffentlicht: (2024)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
von: Jiang, Bowen, et al.
Veröffentlicht: (2024)
von: Jiang, Bowen, et al.
Veröffentlicht: (2024)
Agentic Knowledgeable Self-awareness
von: Qiao, Shuofei, et al.
Veröffentlicht: (2025)
von: Qiao, Shuofei, et al.
Veröffentlicht: (2025)
KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
von: Ren, Baochang, et al.
Veröffentlicht: (2025)
von: Ren, Baochang, et al.
Veröffentlicht: (2025)
LightMem: Lightweight and Efficient Memory-Augmented Generation
von: Fang, Jizhan, et al.
Veröffentlicht: (2025)
von: Fang, Jizhan, et al.
Veröffentlicht: (2025)
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
von: Cai, Shaofei, et al.
Veröffentlicht: (2025)
von: Cai, Shaofei, et al.
Veröffentlicht: (2025)
Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
von: Qin, Yulei, et al.
Veröffentlicht: (2025)
von: Qin, Yulei, et al.
Veröffentlicht: (2025)
FEAT: A Multi-Agent Forensic AI System with Domain-Adapted Large Language Model for Automated Cause-of-Death Analysis
von: Shen, Chen, et al.
Veröffentlicht: (2025)
von: Shen, Chen, et al.
Veröffentlicht: (2025)
Gen-n-Val: Agentic Image Data Generation and Validation
von: Huang, Jing-En, et al.
Veröffentlicht: (2025)
von: Huang, Jing-En, et al.
Veröffentlicht: (2025)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
von: Sun, Zeyi, et al.
Veröffentlicht: (2025)
von: Sun, Zeyi, et al.
Veröffentlicht: (2025)
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
von: Pang, Wei, et al.
Veröffentlicht: (2025)
von: Pang, Wei, et al.
Veröffentlicht: (2025)
TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft
von: Long, Qian, et al.
Veröffentlicht: (2024)
von: Long, Qian, et al.
Veröffentlicht: (2024)
ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows
von: Pellicer, Alvaro Lopez, et al.
Veröffentlicht: (2026)
von: Pellicer, Alvaro Lopez, et al.
Veröffentlicht: (2026)
EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow
von: Pan, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Pan, Xiaoyu, et al.
Veröffentlicht: (2025)
Towards Rationality in Language and Multimodal Agents: A Survey
von: Jiang, Bowen, et al.
Veröffentlicht: (2024)
von: Jiang, Bowen, et al.
Veröffentlicht: (2024)
AllocMV: Optimal Resource Allocation for Music Video Generation via Structured Persistent State
von: Wang, Huimin, et al.
Veröffentlicht: (2026)
von: Wang, Huimin, et al.
Veröffentlicht: (2026)
MARIC: Multi-Agent Reasoning for Image Classification
von: Seo, Wonduk, et al.
Veröffentlicht: (2025)
von: Seo, Wonduk, et al.
Veröffentlicht: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
von: Mo, Shentong, et al.
Veröffentlicht: (2026)
von: Mo, Shentong, et al.
Veröffentlicht: (2026)
An Agentic System for Rare Disease Diagnosis with Traceable Reasoning
von: Zhao, Weike, et al.
Veröffentlicht: (2025)
von: Zhao, Weike, et al.
Veröffentlicht: (2025)
UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving
von: Wang, Yuping, et al.
Veröffentlicht: (2025)
von: Wang, Yuping, et al.
Veröffentlicht: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
Picking the Right Specialist: Attentive Neural Process-based Selection of Task-Specialized Models as Tools for Agentic Healthcare Systems
von: Saha, Pramit, et al.
Veröffentlicht: (2026)
von: Saha, Pramit, et al.
Veröffentlicht: (2026)
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
von: Lu, Quanfeng, et al.
Veröffentlicht: (2025)
von: Lu, Quanfeng, et al.
Veröffentlicht: (2025)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
von: Liu, Runtao, et al.
Veröffentlicht: (2025)
von: Liu, Runtao, et al.
Veröffentlicht: (2025)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
von: Dai, Pengyu, et al.
Veröffentlicht: (2026)
von: Dai, Pengyu, et al.
Veröffentlicht: (2026)
RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration
von: Chen, Xiuyuan, et al.
Veröffentlicht: (2025)
von: Chen, Xiuyuan, et al.
Veröffentlicht: (2025)
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
von: Chen, Tianxing, et al.
Veröffentlicht: (2025)
von: Chen, Tianxing, et al.
Veröffentlicht: (2025)
Enhancing Agentic Autonomous Scientific Discovery with Vision-Language Model Capabilities
von: Gandhi, Kahaan, et al.
Veröffentlicht: (2025)
von: Gandhi, Kahaan, et al.
Veröffentlicht: (2025)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos
von: Wei, Kangda, et al.
Veröffentlicht: (2025)
von: Wei, Kangda, et al.
Veröffentlicht: (2025)
Metropolis-Hastings Captioning Game: Knowledge Fusion of Vision Language Models via Decentralized Bayesian Inference
von: Matsui, Yuta, et al.
Veröffentlicht: (2025)
von: Matsui, Yuta, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
InnoGym: Benchmarking the Innovation Potential of AI Agents
von: Zhang, Jintian, et al.
Veröffentlicht: (2025) -
Exploring Model Kinship for Merging Large Language Models
von: Hu, Yedi, et al.
Veröffentlicht: (2024) -
Chain of Questions: Guiding Multimodal Curiosity in Language Models
von: Iji, Nima, et al.
Veröffentlicht: (2025) -
Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts
von: Efat, Azher Ahmed, et al.
Veröffentlicht: (2026) -
Agent Planning with World Knowledge Model
von: Qiao, Shuofei, et al.
Veröffentlicht: (2024)