Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Ruochen, Zhang, Wenxuan, Chia, Yew Ken, Xu, Weiwen, Zhao, Deli, Bing, Lidong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
por: Gao, Yiwen, et al.
Publicado: (2026)
por: Gao, Yiwen, et al.
Publicado: (2026)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
por: Li, Xingxuan, et al.
Publicado: (2023)
por: Li, Xingxuan, et al.
Publicado: (2023)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
por: Li, Xingxuan, et al.
Publicado: (2024)
por: Li, Xingxuan, et al.
Publicado: (2024)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
por: Li, Long, et al.
Publicado: (2024)
por: Li, Long, et al.
Publicado: (2024)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages
por: Zhang, Wenxuan, et al.
Publicado: (2024)
por: Zhang, Wenxuan, et al.
Publicado: (2024)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
por: Chen, Guizhen, et al.
Publicado: (2025)
por: Chen, Guizhen, et al.
Publicado: (2025)
Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction
por: Chia, Yew Ken, et al.
Publicado: (2023)
por: Chia, Yew Ken, et al.
Publicado: (2023)
Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models
por: Liu, Chaoqun, et al.
Publicado: (2024)
por: Liu, Chaoqun, et al.
Publicado: (2024)
How do Large Language Models Handle Multilingualism?
por: Zhao, Yiran, et al.
Publicado: (2024)
por: Zhao, Yiran, et al.
Publicado: (2024)
AdaMergeX: Cross-Lingual Transfer with Large Language Models via Adaptive Adapter Merging
por: Zhao, Yiran, et al.
Publicado: (2024)
por: Zhao, Yiran, et al.
Publicado: (2024)
Pruning General Large Language Models into Customized Expert Models
por: Zhao, Yirao, et al.
Publicado: (2025)
por: Zhao, Yirao, et al.
Publicado: (2025)
Multilingual Jailbreak Challenges in Large Language Models
por: Deng, Yue, et al.
Publicado: (2023)
por: Deng, Yue, et al.
Publicado: (2023)
M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
AgentReview: Exploring Peer Review Dynamics with LLM Agents
por: Jin, Yiqiao, et al.
Publicado: (2024)
por: Jin, Yiqiao, et al.
Publicado: (2024)
Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers
por: Zhao, Yiran, et al.
Publicado: (2025)
por: Zhao, Yiran, et al.
Publicado: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment
por: Loi, Dario, et al.
Publicado: (2025)
por: Loi, Dario, et al.
Publicado: (2025)
GeoPQA: Bridging the Visual Perception Gap in MLLMs for Geometric Reasoning
por: Chen, Guizhen, et al.
Publicado: (2025)
por: Chen, Guizhen, et al.
Publicado: (2025)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
por: Zhu, Kaijie, et al.
Publicado: (2024)
por: Zhu, Kaijie, et al.
Publicado: (2024)
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents
por: Tang, Jiabin, et al.
Publicado: (2025)
por: Tang, Jiabin, et al.
Publicado: (2025)
A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
por: Mu, Wenxuan, et al.
Publicado: (2025)
por: Mu, Wenxuan, et al.
Publicado: (2025)
AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
por: Yang, Shu, et al.
Publicado: (2026)
por: Yang, Shu, et al.
Publicado: (2026)
Multi-Agent Tool-Integrated Policy Optimization
por: Mo, Zhanfeng, et al.
Publicado: (2025)
por: Mo, Zhanfeng, et al.
Publicado: (2025)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
por: Yuan, Dong, et al.
Publicado: (2024)
por: Yuan, Dong, et al.
Publicado: (2024)
BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems
por: Wang, Wei, et al.
Publicado: (2024)
por: Wang, Wei, et al.
Publicado: (2024)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
por: Li, Ruosen, et al.
Publicado: (2023)
por: Li, Ruosen, et al.
Publicado: (2023)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
por: Fu, Lingyue, et al.
Publicado: (2025)
por: Fu, Lingyue, et al.
Publicado: (2025)
Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation
por: Chen, Junjie, et al.
Publicado: (2024)
por: Chen, Junjie, et al.
Publicado: (2024)
SeaLLMs -- Large Language Models for Southeast Asia
por: Nguyen, Xuan-Phi, et al.
Publicado: (2023)
por: Nguyen, Xuan-Phi, et al.
Publicado: (2023)
ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning
por: Sun, Yu, et al.
Publicado: (2025)
por: Sun, Yu, et al.
Publicado: (2025)
MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation
por: Gao, Xian, et al.
Publicado: (2025)
por: Gao, Xian, et al.
Publicado: (2025)
AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment
por: Lan, Xiaochong, et al.
Publicado: (2025)
por: Lan, Xiaochong, et al.
Publicado: (2025)
SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
por: Liu, Chaoqun, et al.
Publicado: (2025)
por: Liu, Chaoqun, et al.
Publicado: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Evaluation and Facilitation of Online Discussions in the LLM Era: A Survey
por: Korre, Katerina, et al.
Publicado: (2025)
por: Korre, Katerina, et al.
Publicado: (2025)
Re2: A Consistency-ensured Dataset for Full-stage Peer Review and Multi-turn Rebuttal Discussions
por: Zhang, Daoze, et al.
Publicado: (2025)
por: Zhang, Daoze, et al.
Publicado: (2025)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
por: Lin, Shuhang, et al.
Publicado: (2024)
por: Lin, Shuhang, et al.
Publicado: (2024)
Ejemplares similares
-
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
por: Gao, Yiwen, et al.
Publicado: (2026) -
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
por: Li, Xingxuan, et al.
Publicado: (2023) -
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
por: Li, Xingxuan, et al.
Publicado: (2024) -
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
por: Chia, Yew Ken, et al.
Publicado: (2024) -
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
por: Li, Long, et al.
Publicado: (2024)