AGENTCL: Toward Rigorous Evaluation of Continual Learning in Language Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Shu, Yiheng, Gutiérrez, Bernal Jiménez, Jonnalagedda, Saisri Padmaja, Yao, Yuguang, Sun, Huan, Su, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
REMem: Reasoning with Episodic Memory in Language Agent
by: Shu, Yiheng, et al.
Published: (2026)
by: Shu, Yiheng, et al.
Published: (2026)
From RAG to Memory: Non-Parametric Continual Learning for Large Language Models
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2025)
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2025)
HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2024)
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2024)
ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery
by: Chen, Ziru, et al.
Published: (2024)
by: Chen, Ziru, et al.
Published: (2024)
Data Distribution Bottlenecks in Grounding Language Models to Knowledge Bases
by: Shu, Yiheng, et al.
Published: (2023)
by: Shu, Yiheng, et al.
Published: (2023)
Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
by: Gou, Boyu, et al.
Published: (2025)
by: Gou, Boyu, et al.
Published: (2025)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
by: Gou, Boyu, et al.
Published: (2024)
by: Gou, Boyu, et al.
Published: (2024)
A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents
by: Mo, Lingbo, et al.
Published: (2024)
by: Mo, Lingbo, et al.
Published: (2024)
Middleware for LLMs: Tools Are Instrumental for Language Agents in Complex Environments
by: Gu, Yu, et al.
Published: (2024)
by: Gu, Yu, et al.
Published: (2024)
Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science
by: Fan, Jingru, et al.
Published: (2026)
by: Fan, Jingru, et al.
Published: (2026)
XSkill: Continual Learning from Experience and Skills in Multimodal Agents
by: Jiang, Guanyu, et al.
Published: (2026)
by: Jiang, Guanyu, et al.
Published: (2026)
Balancing Rigor and Utility: Mitigating Cognitive Biases in Large Language Models for Multiple-Choice Questions
by: Zhong, Hanyang, et al.
Published: (2024)
by: Zhong, Hanyang, et al.
Published: (2024)
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
by: Sun, Yifan, et al.
Published: (2025)
by: Sun, Yifan, et al.
Published: (2025)
Towards Effective GenAI Multi-Agent Collaboration: Design and Evaluation for Enterprise Applications
by: Shu, Raphael, et al.
Published: (2024)
by: Shu, Raphael, et al.
Published: (2024)
Towards Understanding Continual Factual Knowledge Acquisition of Language Models: From Theory to Algorithm
by: Wang, Haoyu, et al.
Published: (2026)
by: Wang, Haoyu, et al.
Published: (2026)
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
by: Bragg, Jonathan, et al.
Published: (2025)
by: Bragg, Jonathan, et al.
Published: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
by: Tu, Shangqing, et al.
Published: (2023)
by: Tu, Shangqing, et al.
Published: (2023)
An Illusion of Progress? Assessing the Current State of Web Agents
by: Xue, Tianci, et al.
Published: (2025)
by: Xue, Tianci, et al.
Published: (2025)
Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
by: Song, Yueqi, et al.
Published: (2025)
by: Song, Yueqi, et al.
Published: (2025)
AgentBench: Evaluating LLMs as Agents
by: Liu, Xiao, et al.
Published: (2023)
by: Liu, Xiao, et al.
Published: (2023)
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025)
by: Geng, Saibo, et al.
Published: (2025)
A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models
by: Jones, Jaylen, et al.
Published: (2024)
by: Jones, Jaylen, et al.
Published: (2024)
Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
by: Kapoor, Sayash, et al.
Published: (2025)
by: Kapoor, Sayash, et al.
Published: (2025)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
by: Nguyen, Son The, et al.
Published: (2024)
by: Nguyen, Son The, et al.
Published: (2024)
STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator
by: Sordo, Alessio, et al.
Published: (2026)
by: Sordo, Alessio, et al.
Published: (2026)
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
by: Yu, Zhuang, et al.
Published: (2025)
by: Yu, Zhuang, et al.
Published: (2025)
UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions
by: Han, Wenkang, et al.
Published: (2025)
by: Han, Wenkang, et al.
Published: (2025)
CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models
by: Kalyan, Pavan, et al.
Published: (2025)
by: Kalyan, Pavan, et al.
Published: (2025)
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
by: Min, Hyangsuk, et al.
Published: (2025)
by: Min, Hyangsuk, et al.
Published: (2025)
ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
by: Li, Dawei, et al.
Published: (2026)
by: Li, Dawei, et al.
Published: (2026)
Continual Learning in Large Language Models: Methods, Challenges, and Opportunities
by: Chen, Hongyang, et al.
Published: (2026)
by: Chen, Hongyang, et al.
Published: (2026)
Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems
by: Yu, Ye, et al.
Published: (2026)
by: Yu, Ye, et al.
Published: (2026)
Towards Adaptive Mechanism Activation in Language Agent
by: Huang, Ziyang, et al.
Published: (2024)
by: Huang, Ziyang, et al.
Published: (2024)
Empowering Large Language Model Agents through Action Learning
by: Zhao, Haiteng, et al.
Published: (2024)
by: Zhao, Haiteng, et al.
Published: (2024)
MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models
by: Liu, Zhiwei, et al.
Published: (2025)
by: Liu, Zhiwei, et al.
Published: (2025)
InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks
by: Hu, Xueyu, et al.
Published: (2024)
by: Hu, Xueyu, et al.
Published: (2024)
RISK: A Framework for GUI Agents in E-commerce Risk Management
by: Chen, Renqi, et al.
Published: (2025)
by: Chen, Renqi, et al.
Published: (2025)
Evaluating ChatGPT as a Recommender System: A Rigorous Approach
by: Di Palma, Dario, et al.
Published: (2023)
by: Di Palma, Dario, et al.
Published: (2023)
MineAgent: Towards Remote-Sensing Mineral Exploration with Multimodal Large Language Models
by: Yu, Beibei, et al.
Published: (2024)
by: Yu, Beibei, et al.
Published: (2024)
Flexora: Flexible Low Rank Adaptation for Large Language Models
by: Wei, Chenxing, et al.
Published: (2024)
by: Wei, Chenxing, et al.
Published: (2024)
Similar Items
-
REMem: Reasoning with Episodic Memory in Language Agent
by: Shu, Yiheng, et al.
Published: (2026) -
From RAG to Memory: Non-Parametric Continual Learning for Large Language Models
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2025) -
HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
by: Gutiérrez, Bernal Jiménez, et al.
Published: (2024) -
ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery
by: Chen, Ziru, et al.
Published: (2024) -
Data Distribution Bottlenecks in Grounding Language Models to Knowledge Bases
by: Shu, Yiheng, et al.
Published: (2023)