AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Keyu, Shi, Junhao, Xiao, Yang, Jiang, Mohan, Sun, Jie, Wu, Yunze, Fu, Dayuan, Xia, Shijie, Cai, Xiaojie, Xu, Tianze, Si, Weiye, Li, Wenjie, Wang, Dequan, Liu, Pengfei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
par: Jiang, Mohan, et autres
Publié: (2026)
par: Jiang, Mohan, et autres
Publié: (2026)
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
par: Li, Keyu, et autres
Publié: (2025)
par: Li, Keyu, et autres
Publié: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
par: Wu, Yunze, et autres
Publié: (2025)
par: Wu, Yunze, et autres
Publié: (2025)
Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training
par: Fu, Dayuan, et autres
Publié: (2025)
par: Fu, Dayuan, et autres
Publié: (2025)
LIMI: Less is More for Agency
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Context Engineering 2.0: The Context of Context Engineering
par: Hua, Qishuo, et autres
Publié: (2025)
par: Hua, Qishuo, et autres
Publié: (2025)
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
par: Xu, Tianze, et autres
Publié: (2025)
par: Xu, Tianze, et autres
Publié: (2025)
Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems
par: Li, Keyu, et autres
Publié: (2026)
par: Li, Keyu, et autres
Publié: (2026)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Exploration on Real World Assets and Tokenization
par: Xia, Ning, et autres
Publié: (2025)
par: Xia, Ning, et autres
Publié: (2025)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
par: Zheng, Yuxiang, et autres
Publié: (2025)
par: Zheng, Yuxiang, et autres
Publié: (2025)
NovoBench: Benchmarking Deep Learning-based De Novo Peptide Sequencing Methods in Proteomics
par: Zhou, Jingbo, et autres
Publié: (2024)
par: Zhou, Jingbo, et autres
Publié: (2024)
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
par: Jiang, Mohan, et autres
Publié: (2025)
par: Jiang, Mohan, et autres
Publié: (2025)
S2R-Bench: A Sim-to-Real Evaluation Benchmark for Autonomous Driving
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
par: Jin, Pengwei, et autres
Publié: (2025)
par: Jin, Pengwei, et autres
Publié: (2025)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
par: Hu, Lingxiang, et autres
Publié: (2026)
par: Hu, Lingxiang, et autres
Publié: (2026)
Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
par: Du, Pengfei
Publié: (2026)
par: Du, Pengfei
Publié: (2026)
A2Perf: Real-World Autonomous Agents Benchmark
par: Uchendu, Ikechukwu, et autres
Publié: (2025)
par: Uchendu, Ikechukwu, et autres
Publié: (2025)
CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
par: Yu, Yating, et autres
Publié: (2025)
par: Yu, Yating, et autres
Publié: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026)
par: Yang, Jie, et autres
Publié: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
par: Long, Xiang, et autres
Publié: (2026)
par: Long, Xiang, et autres
Publié: (2026)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
par: Zhang, Lei, et autres
Publié: (2024)
par: Zhang, Lei, et autres
Publié: (2024)
$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens
par: Zhang, Xinrong, et autres
Publié: (2024)
par: Zhang, Xinrong, et autres
Publié: (2024)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
par: Zhang, Yibo, et autres
Publié: (2026)
par: Zhang, Yibo, et autres
Publié: (2026)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
par: Tu, Xinming, et autres
Publié: (2026)
par: Tu, Xinming, et autres
Publié: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)
par: Shen, Yuanzhe, et autres
Publié: (2026)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
par: Guang, Jiahui, et autres
Publié: (2026)
par: Guang, Jiahui, et autres
Publié: (2026)
Lattice Boltzmann Model for Learning Real-World Pixel Dynamicity
par: Zheng, Guangze, et autres
Publié: (2025)
par: Zheng, Guangze, et autres
Publié: (2025)
TokenPowerBench: Benchmarking the Power Consumption of LLM Inference
par: Niu, Chenxu, et autres
Publié: (2025)
par: Niu, Chenxu, et autres
Publié: (2025)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
par: Zhang, Qiaohong, et autres
Publié: (2026)
par: Zhang, Qiaohong, et autres
Publié: (2026)
ContextBench: A Benchmark for Context Retrieval in Coding Agents
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model
par: You, Junqi, et autres
Publié: (2024)
par: You, Junqi, et autres
Publié: (2024)
BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution
par: Wu, Yangzhen, et autres
Publié: (2026)
par: Wu, Yangzhen, et autres
Publié: (2026)
DHG-Bench: A Comprehensive Benchmark for Deep Hypergraph Learning
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
Documents similaires
-
daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently
par: Jiang, Mohan, et autres
Publié: (2026) -
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
par: Li, Keyu, et autres
Publié: (2025) -
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
par: Wu, Yunze, et autres
Publié: (2025) -
Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training
par: Fu, Dayuan, et autres
Publié: (2025) -
LIMI: Less is More for Agency
par: Xiao, Yang, et autres
Publié: (2025)