Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Ruochen, Zhang, Wenxuan, Chia, Yew Ken, Xu, Weiwen, Zhao, Deli, Bing, Lidong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
von: Gao, Yiwen, et al.
Veröffentlicht: (2026)
von: Gao, Yiwen, et al.
Veröffentlicht: (2026)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
von: Li, Xingxuan, et al.
Veröffentlicht: (2023)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
von: Li, Xingxuan, et al.
Veröffentlicht: (2024)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
von: Li, Long, et al.
Veröffentlicht: (2024)
von: Li, Long, et al.
Veröffentlicht: (2024)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
von: Chen, Guizhen, et al.
Veröffentlicht: (2025)
von: Chen, Guizhen, et al.
Veröffentlicht: (2025)
Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction
von: Chia, Yew Ken, et al.
Veröffentlicht: (2023)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2023)
Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models
von: Liu, Chaoqun, et al.
Veröffentlicht: (2024)
von: Liu, Chaoqun, et al.
Veröffentlicht: (2024)
How do Large Language Models Handle Multilingualism?
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
von: Zhao, Yiran, et al.
Veröffentlicht: (2024)
Pruning General Large Language Models into Customized Expert Models
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
von: Zhao, Yirao, et al.
Veröffentlicht: (2025)
Multilingual Jailbreak Challenges in Large Language Models
von: Deng, Yue, et al.
Veröffentlicht: (2023)
von: Deng, Yue, et al.
Veröffentlicht: (2023)
M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
AgentReview: Exploring Peer Review Dynamics with LLM Agents
von: Jin, Yiqiao, et al.
Veröffentlicht: (2024)
von: Jin, Yiqiao, et al.
Veröffentlicht: (2024)
Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers
von: Zhao, Yiran, et al.
Veröffentlicht: (2025)
von: Zhao, Yiran, et al.
Veröffentlicht: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
von: Luo, Ziyang, et al.
Veröffentlicht: (2024)
von: Luo, Ziyang, et al.
Veröffentlicht: (2024)
AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment
von: Loi, Dario, et al.
Veröffentlicht: (2025)
von: Loi, Dario, et al.
Veröffentlicht: (2025)
GeoPQA: Bridging the Visual Perception Gap in MLLMs for Geometric Reasoning
von: Chen, Guizhen, et al.
Veröffentlicht: (2025)
von: Chen, Guizhen, et al.
Veröffentlicht: (2025)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
von: Zhu, Kaijie, et al.
Veröffentlicht: (2024)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2024)
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents
von: Tang, Jiabin, et al.
Veröffentlicht: (2025)
von: Tang, Jiabin, et al.
Veröffentlicht: (2025)
A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
von: Mu, Wenxuan, et al.
Veröffentlicht: (2025)
von: Mu, Wenxuan, et al.
Veröffentlicht: (2025)
AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
von: Yang, Shu, et al.
Veröffentlicht: (2026)
von: Yang, Shu, et al.
Veröffentlicht: (2026)
Multi-Agent Tool-Integrated Policy Optimization
von: Mo, Zhanfeng, et al.
Veröffentlicht: (2025)
von: Mo, Zhanfeng, et al.
Veröffentlicht: (2025)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
von: Yuan, Dong, et al.
Veröffentlicht: (2024)
von: Yuan, Dong, et al.
Veröffentlicht: (2024)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
von: Wang, Wei, et al.
Veröffentlicht: (2024)
von: Wang, Wei, et al.
Veröffentlicht: (2024)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
von: Zhang, Wenqi, et al.
Veröffentlicht: (2025)
von: Zhang, Wenqi, et al.
Veröffentlicht: (2025)
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
von: Li, Ruosen, et al.
Veröffentlicht: (2023)
von: Li, Ruosen, et al.
Veröffentlicht: (2023)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
von: Fu, Lingyue, et al.
Veröffentlicht: (2025)
Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation
von: Chen, Junjie, et al.
Veröffentlicht: (2024)
von: Chen, Junjie, et al.
Veröffentlicht: (2024)
SeaLLMs -- Large Language Models for Southeast Asia
von: Nguyen, Xuan-Phi, et al.
Veröffentlicht: (2023)
von: Nguyen, Xuan-Phi, et al.
Veröffentlicht: (2023)
ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning
von: Sun, Yu, et al.
Veröffentlicht: (2025)
von: Sun, Yu, et al.
Veröffentlicht: (2025)
MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation
von: Gao, Xian, et al.
Veröffentlicht: (2025)
von: Gao, Xian, et al.
Veröffentlicht: (2025)
AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment
von: Lan, Xiaochong, et al.
Veröffentlicht: (2025)
von: Lan, Xiaochong, et al.
Veröffentlicht: (2025)
SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
von: Liu, Chaoqun, et al.
Veröffentlicht: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
von: Cheng, Zesen, et al.
Veröffentlicht: (2024)
Evaluation and Facilitation of Online Discussions in the LLM Era: A Survey
von: Korre, Katerina, et al.
Veröffentlicht: (2025)
von: Korre, Katerina, et al.
Veröffentlicht: (2025)
Re2: A Consistency-ensured Dataset for Full-stage Peer Review and Multi-turn Rebuttal Discussions
von: Zhang, Daoze, et al.
Veröffentlicht: (2025)
von: Zhang, Daoze, et al.
Veröffentlicht: (2025)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
von: Lin, Shuhang, et al.
Veröffentlicht: (2024)
von: Lin, Shuhang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
von: Gao, Yiwen, et al.
Veröffentlicht: (2026) -
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
von: Li, Xingxuan, et al.
Veröffentlicht: (2023) -
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
von: Li, Xingxuan, et al.
Veröffentlicht: (2024) -
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024) -
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
von: Li, Long, et al.
Veröffentlicht: (2024)