CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
Fuente:
arXiv
Saved in:
| Main Authors: | Fu, Lingyue, Ding, Xin, Pan, Linyue, Zhu, Yaoming, Zhang, Shao, Qiu, Lin, Liu, Weiwen, Zhang, Weinan, Cao, Xuezhi, Cai, Xunliang, Ding, Jiaxin, Yu, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
by: Guan, Hao, et al.
Published: (2026)
by: Guan, Hao, et al.
Published: (2026)
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
DebugTA: An LLM-Based Agent for Simplifying Debugging and Teaching in Programming Education
by: Fu, Lingyue, et al.
Published: (2025)
by: Fu, Lingyue, et al.
Published: (2025)
MMSkills: Towards Multimodal Skills for General Visual Agents
by: Zhang, Kangning, et al.
Published: (2026)
by: Zhang, Kangning, et al.
Published: (2026)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
by: wang, Jiaming, et al.
Published: (2025)
by: wang, Jiaming, et al.
Published: (2025)
Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
by: Zhang, Shao, et al.
Published: (2025)
by: Zhang, Shao, et al.
Published: (2025)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
by: Li, Qingyao, et al.
Published: (2023)
by: Li, Qingyao, et al.
Published: (2023)
AdverMCTS: Combating Pseudo-Correctness in Code Generation via Adversarial Monte Carlo Tree Search
by: Li, Qingyao, et al.
Published: (2026)
by: Li, Qingyao, et al.
Published: (2026)
Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese
by: Wang, Xihuai, et al.
Published: (2025)
by: Wang, Xihuai, et al.
Published: (2025)
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
by: Ding, Peng, et al.
Published: (2025)
by: Ding, Peng, et al.
Published: (2025)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
by: Huang, Junjie, et al.
Published: (2026)
by: Huang, Junjie, et al.
Published: (2026)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
by: Sun, Mingyang, et al.
Published: (2025)
by: Sun, Mingyang, et al.
Published: (2025)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
by: Zhu, Jiachen, et al.
Published: (2025)
by: Zhu, Jiachen, et al.
Published: (2025)
From "What to Eat?" to Perfect Recipe: ChefMind's Chain-of-Exploration for Ambiguous User Intent in Recipe Recommendation
by: Fu, Yu, et al.
Published: (2025)
by: Fu, Yu, et al.
Published: (2025)
Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack
by: Ding, Peng, et al.
Published: (2025)
by: Ding, Peng, et al.
Published: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
by: Guo, Zhengkang, et al.
Published: (2026)
by: Guo, Zhengkang, et al.
Published: (2026)
AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
by: Yang, Yingxuan, et al.
Published: (2025)
by: Yang, Yingxuan, et al.
Published: (2025)
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
by: Zhu, Yaoming, et al.
Published: (2025)
by: Zhu, Yaoming, et al.
Published: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
by: Jiayang, Cheng, et al.
Published: (2026)
by: Jiayang, Cheng, et al.
Published: (2026)
Superplatforms Have to Attack AI Agents
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System
by: Pan, Shuai, et al.
Published: (2026)
by: Pan, Shuai, et al.
Published: (2026)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
by: Wang, Jingxing, et al.
Published: (2026)
by: Wang, Jingxing, et al.
Published: (2026)
CodeGRAG: Bridging the Gap between Natural Language and Programming Language via Graphical Retrieval Augmented Generation
by: Du, Kounianhua, et al.
Published: (2024)
by: Du, Kounianhua, et al.
Published: (2024)
D2K: Turning Historical Data into Retrievable Knowledge for Recommender Systems
by: Qin, Jiarui, et al.
Published: (2024)
by: Qin, Jiarui, et al.
Published: (2024)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
by: Ding, Peng, et al.
Published: (2024)
by: Ding, Peng, et al.
Published: (2024)
Instance-level Randomization: Toward More Stable LLM Evaluations
by: Li, Yiyang, et al.
Published: (2025)
by: Li, Yiyang, et al.
Published: (2025)
Iterated Agent for Symbolic Regression
by: Song, Zhuo-Yang, et al.
Published: (2025)
by: Song, Zhuo-Yang, et al.
Published: (2025)
SoDA: An Efficient Interaction Paradigm for the Agentic Web
by: Cui, Zicai, et al.
Published: (2025)
by: Cui, Zicai, et al.
Published: (2025)
SkillPager: Query-Adaptive Intra-Skill Navigation via Semantic Node Retrieval
by: Cui, Zicai, et al.
Published: (2026)
by: Cui, Zicai, et al.
Published: (2026)
Measuring Code Efficiency Optimization Capabilities with ACEOB
by: Pan, Yue, et al.
Published: (2024)
by: Pan, Yue, et al.
Published: (2024)
An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors
by: Yu, Jiaxin, et al.
Published: (2024)
by: Yu, Jiaxin, et al.
Published: (2024)
LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation
by: Chen, Jizheng, et al.
Published: (2026)
by: Chen, Jizheng, et al.
Published: (2026)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
by: Zhang, Qiang, et al.
Published: (2026)
by: Zhang, Qiang, et al.
Published: (2026)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
by: Zhu, Jiachen, et al.
Published: (2026)
by: Zhu, Jiachen, et al.
Published: (2026)
Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning
by: Wu, Zheng, et al.
Published: (2026)
by: Wu, Zheng, et al.
Published: (2026)
A Scenario-Driven Cognitive Approach to Next-Generation AI Memory
by: Cai, Linyue, et al.
Published: (2025)
by: Cai, Linyue, et al.
Published: (2025)
CreAgentive: An Agent Workflow Driven Multi-Category Creative Generation Engine
by: Cheng, Yuyang, et al.
Published: (2025)
by: Cheng, Yuyang, et al.
Published: (2025)
NL-Debugging: Exploiting Natural Language as an Intermediate Representation for Code Debugging
by: Zhang, Weiming, et al.
Published: (2025)
by: Zhang, Weiming, et al.
Published: (2025)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
by: Nie, Dujun, et al.
Published: (2026)
by: Nie, Dujun, et al.
Published: (2026)
Similar Items
-
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
by: Fu, Lingyue, et al.
Published: (2025) -
SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle
by: Guan, Hao, et al.
Published: (2026) -
CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks
by: Fu, Lingyue, et al.
Published: (2025) -
DebugTA: An LLM-Based Agent for Simplifying Debugging and Teaching in Programming Education
by: Fu, Lingyue, et al.
Published: (2025) -
MMSkills: Towards Multimodal Skills for General Visual Agents
by: Zhang, Kangning, et al.
Published: (2026)