Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Haonan, Feng, Qiguan, Jiang, Kehan, Ye, Haoran, Zhang, Xin, Song, Guojie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language Models
by: Ren, Yuanyi, et al.
Published: (2024)
by: Ren, Yuanyi, et al.
Published: (2024)
Meta-R1: Empowering Large Reasoning Models with Metacognition
by: Dong, Haonan, et al.
Published: (2025)
by: Dong, Haonan, et al.
Published: (2025)
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
by: Zhang, TianZe, et al.
Published: (2026)
by: Zhang, TianZe, et al.
Published: (2026)
FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models
by: Jiang, Kehan, et al.
Published: (2026)
by: Jiang, Kehan, et al.
Published: (2026)
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
by: Ye, Haoran, et al.
Published: (2024)
by: Ye, Haoran, et al.
Published: (2024)
Generative Psycho-Lexical Approach for Constructing Value Systems in Large Language Models
by: Ye, Haoran, et al.
Published: (2025)
by: Ye, Haoran, et al.
Published: (2025)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
by: Tan, Haoran, et al.
Published: (2025)
by: Tan, Haoran, et al.
Published: (2025)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
by: Chen, Jingxuan, et al.
Published: (2024)
by: Chen, Jingxuan, et al.
Published: (2024)
Meta Context Engineering via Agentic Skill Evolution
by: Ye, Haoran, et al.
Published: (2026)
by: Ye, Haoran, et al.
Published: (2026)
Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance
by: Chen, Wenhao, et al.
Published: (2026)
by: Chen, Wenhao, et al.
Published: (2026)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
by: Ye, Haoran, et al.
Published: (2025)
by: Ye, Haoran, et al.
Published: (2025)
LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
by: Zheng, Junhao, et al.
Published: (2025)
by: Zheng, Junhao, et al.
Published: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
by: Jing, Huihao, et al.
Published: (2025)
by: Jing, Huihao, et al.
Published: (2025)
ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents
by: Levy, Ido, et al.
Published: (2024)
by: Levy, Ido, et al.
Published: (2024)
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
by: Shi, Wentao, et al.
Published: (2026)
by: Shi, Wentao, et al.
Published: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
by: Song, Zhiheng, et al.
Published: (2026)
by: Song, Zhiheng, et al.
Published: (2026)
AgentBench: Evaluating LLMs as Agents
by: Liu, Xiao, et al.
Published: (2023)
by: Liu, Xiao, et al.
Published: (2023)
LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health
by: Tian, Ye, et al.
Published: (2026)
by: Tian, Ye, et al.
Published: (2026)
Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values
by: Yao, Jing, et al.
Published: (2025)
by: Yao, Jing, et al.
Published: (2025)
DCA-Bench: A Benchmark for Dataset Curation Agents
by: Huang, Benhao, et al.
Published: (2024)
by: Huang, Benhao, et al.
Published: (2024)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
by: Zheng, Jingnan, et al.
Published: (2024)
by: Zheng, Jingnan, et al.
Published: (2024)
AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems
by: Shang, Yu, et al.
Published: (2025)
by: Shang, Yu, et al.
Published: (2025)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
by: Wu, Qinzhuo, et al.
Published: (2026)
by: Wu, Qinzhuo, et al.
Published: (2026)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
by: Xu, Weikai, et al.
Published: (2025)
by: Xu, Weikai, et al.
Published: (2025)
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
by: Mitchener, Ludovico, et al.
Published: (2025)
by: Mitchener, Ludovico, et al.
Published: (2025)
Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks
by: Deganutti, Adrienne, et al.
Published: (2026)
by: Deganutti, Adrienne, et al.
Published: (2026)
ProBench: Benchmarking GUI Agents with Accurate Process Information
by: Yang, Leyang, et al.
Published: (2025)
by: Yang, Leyang, et al.
Published: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
by: Deng, Shihan, et al.
Published: (2024)
by: Deng, Shihan, et al.
Published: (2024)
BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs
by: Guo, Mingning, et al.
Published: (2025)
by: Guo, Mingning, et al.
Published: (2025)
OCDB: Revisiting Causal Discovery with a Comprehensive Benchmark and Evaluation Framework
by: Zhou, Wei, et al.
Published: (2024)
by: Zhou, Wei, et al.
Published: (2024)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise
by: Bogavelli, Tara, et al.
Published: (2025)
by: Bogavelli, Tara, et al.
Published: (2025)
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
by: Ma, Haoxuan, et al.
Published: (2026)
by: Ma, Haoxuan, et al.
Published: (2026)
ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents
by: Li, Chao, et al.
Published: (2026)
by: Li, Chao, et al.
Published: (2026)
GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis
by: Yu, Bo, et al.
Published: (2026)
by: Yu, Bo, et al.
Published: (2026)
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
by: Duston, Titouan, et al.
Published: (2025)
by: Duston, Titouan, et al.
Published: (2025)
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
by: Wu, Bin, et al.
Published: (2026)
by: Wu, Bin, et al.
Published: (2026)
BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics
by: Fa, Dionizije, et al.
Published: (2026)
by: Fa, Dionizije, et al.
Published: (2026)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
by: Liu, Shuyi, et al.
Published: (2025)
by: Liu, Shuyi, et al.
Published: (2025)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
by: Wang, Shouju, et al.
Published: (2026)
by: Wang, Shouju, et al.
Published: (2026)
Similar Items
-
ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language Models
by: Ren, Yuanyi, et al.
Published: (2024) -
Meta-R1: Empowering Large Reasoning Models with Metacognition
by: Dong, Haonan, et al.
Published: (2025) -
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
by: Zhang, TianZe, et al.
Published: (2026) -
FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models
by: Jiang, Kehan, et al.
Published: (2026) -
Measuring Human and AI Values Based on Generative Psychometrics with Large Language Models
by: Ye, Haoran, et al.
Published: (2024)