VeRO: An Evaluation Harness for Agents to Optimize Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ursekar, Varun, Shanker, Apaar, Chatrath, Veronica, Xue, Yuan, Denton, Sam |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents
par: Manglik, Akshay, et autres
Publié: (2026)
par: Manglik, Akshay, et autres
Publié: (2026)
Assessing Robustness to Spurious Correlations in Post-Training Language Models
par: Shuieh, Julia, et autres
Publié: (2025)
par: Shuieh, Julia, et autres
Publié: (2025)
Balancing Cost and Effectiveness of Synthetic Data Generation Strategies for LLMs
par: Chan, Yung-Chieh, et autres
Publié: (2024)
par: Chan, Yung-Chieh, et autres
Publié: (2024)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
AgentBench: Evaluating LLMs as Agents
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
par: Lù, Xing Han, et autres
Publié: (2025)
par: Lù, Xing Han, et autres
Publié: (2025)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
par: Ma, Chang, et autres
Publié: (2024)
par: Ma, Chang, et autres
Publié: (2024)
AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
par: Du, Shangheng, et autres
Publié: (2025)
par: Du, Shangheng, et autres
Publié: (2025)
AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
par: Younesian, Sharareh, et autres
Publié: (2026)
par: Younesian, Sharareh, et autres
Publié: (2026)
IntellAgent: A Multi-Agent Framework for Evaluating Conversational AI Systems
par: Levi, Elad, et autres
Publié: (2025)
par: Levi, Elad, et autres
Publié: (2025)
Survey on Evaluation of LLM-based Agents
par: Yehudai, Asaf, et autres
Publié: (2025)
par: Yehudai, Asaf, et autres
Publié: (2025)
Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents
par: Li, Xirui, et autres
Publié: (2026)
par: Li, Xirui, et autres
Publié: (2026)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
par: Guo, Zikang, et autres
Publié: (2025)
par: Guo, Zikang, et autres
Publié: (2025)
PersonaGym: Evaluating Persona Agents and LLMs
par: Samuel, Vinay, et autres
Publié: (2024)
par: Samuel, Vinay, et autres
Publié: (2024)
Structured Agent Distillation for Large Language Model
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
MPO: Boosting LLM Agents with Meta Plan Optimization
par: Xiong, Weimin, et autres
Publié: (2025)
par: Xiong, Weimin, et autres
Publié: (2025)
KwaiAgents: Generalized Information-seeking Agent System with Large Language Models
par: Pan, Haojie, et autres
Publié: (2023)
par: Pan, Haojie, et autres
Publié: (2023)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
par: Subramani, Nishant, et autres
Publié: (2025)
par: Subramani, Nishant, et autres
Publié: (2025)
Reinforce LLM Reasoning through Multi-Agent Reflection
par: Yuan, Yurun, et autres
Publié: (2025)
par: Yuan, Yurun, et autres
Publié: (2025)
GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
par: Shetty, Manish, et autres
Publié: (2025)
par: Shetty, Manish, et autres
Publié: (2025)
Evaluating Language-Model Agents on Realistic Autonomous Tasks
par: Kinniment, Megan, et autres
Publié: (2023)
par: Kinniment, Megan, et autres
Publié: (2023)
SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents
par: Zhou, Xuhui, et autres
Publié: (2023)
par: Zhou, Xuhui, et autres
Publié: (2023)
Evaluating Tool-Augmented Agents in Remote Sensing Platforms
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
SafeArena: Evaluating the Safety of Autonomous Web Agents
par: Tur, Ada Defne, et autres
Publié: (2025)
par: Tur, Ada Defne, et autres
Publié: (2025)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
par: Song, Yifan, et autres
Publié: (2024)
par: Song, Yifan, et autres
Publié: (2024)
Recursive Agent Optimization
par: Gandhi, Apurva, et autres
Publié: (2026)
par: Gandhi, Apurva, et autres
Publié: (2026)
FutureSim: Replaying World Events to Evaluate Adaptive Agents
par: Goel, Shashwat, et autres
Publié: (2026)
par: Goel, Shashwat, et autres
Publié: (2026)
MASEval: Extending Multi-Agent Evaluation from Models to Systems
par: Emde, Cornelius, et autres
Publié: (2026)
par: Emde, Cornelius, et autres
Publié: (2026)
Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
par: Wang, Jianghui, et autres
Publié: (2025)
par: Wang, Jianghui, et autres
Publié: (2025)
Evaluating Very Long-Term Conversational Memory of LLM Agents
par: Maharana, Adyasha, et autres
Publié: (2024)
par: Maharana, Adyasha, et autres
Publié: (2024)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
par: Zhu, Kaijie, et autres
Publié: (2024)
par: Zhu, Kaijie, et autres
Publié: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
Memento-Skills: Let Agents Design Agents
par: Zhou, Huichi, et autres
Publié: (2026)
par: Zhou, Huichi, et autres
Publié: (2026)
Adaptive Social Learning via Mode Policy Optimization for Language Agents
par: Wang, Minzheng, et autres
Publié: (2025)
par: Wang, Minzheng, et autres
Publié: (2025)
Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies
par: Zhou, Han, et autres
Publié: (2025)
par: Zhou, Han, et autres
Publié: (2025)
Verbal Process Supervision Elicits Better Coding Agents
par: Chen, Hao-Yuan, et autres
Publié: (2025)
par: Chen, Hao-Yuan, et autres
Publié: (2025)
Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents
par: Tang, Zhengyang, et autres
Publié: (2026)
par: Tang, Zhengyang, et autres
Publié: (2026)
Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
par: Turk, Matt
Publié: (2026)
par: Turk, Matt
Publié: (2026)
AgentRM: Enhancing Agent Generalization with Reward Modeling
par: Xia, Yu, et autres
Publié: (2025)
par: Xia, Yu, et autres
Publié: (2025)
SynthAgent: Adapting Web Agents with Synthetic Supervision
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
Documents similaires
-
Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents
par: Manglik, Akshay, et autres
Publié: (2026) -
Assessing Robustness to Spurious Correlations in Post-Training Language Models
par: Shuieh, Julia, et autres
Publié: (2025) -
Balancing Cost and Effectiveness of Synthetic Data Generation Strategies for LLMs
par: Chan, Yung-Chieh, et autres
Publié: (2024) -
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
par: Butt, Natasha, et autres
Publié: (2024) -
AgentBench: Evaluating LLMs as Agents
par: Liu, Xiao, et autres
Publié: (2023)