AIM-Bench: Evaluating Decision-making Biases of Agentic LLM as Inventory Manager
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Xuhua, Xie, Yuxuan, Chen, Caihua, Sun, Yuxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
par: Zhao, Yuxuan, et autres
Publié: (2026)
par: Zhao, Yuxuan, et autres
Publié: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025)
par: Xu, Kaixuan, et autres
Publié: (2025)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
par: Zhao, Yujie, et autres
Publié: (2026)
par: Zhao, Yujie, et autres
Publié: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
par: Gao, Yuxuan, et autres
Publié: (2026)
par: Gao, Yuxuan, et autres
Publié: (2026)
Agentic LLM Framework for Adaptive Decision Discourse
par: Dolant, Antoine, et autres
Publié: (2025)
par: Dolant, Antoine, et autres
Publié: (2025)
Large Language Newsvendor: Decision Biases and Cognitive Mechanisms
par: Liu, Jifei, et autres
Publié: (2025)
par: Liu, Jifei, et autres
Publié: (2025)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
par: Xu, Xinbo, et autres
Publié: (2026)
par: Xu, Xinbo, et autres
Publié: (2026)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
par: Chen, Wanyi, et autres
Publié: (2026)
par: Chen, Wanyi, et autres
Publié: (2026)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
par: Zhu, Pengyu, et autres
Publié: (2026)
par: Zhu, Pengyu, et autres
Publié: (2026)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
par: Zhang, Haoran, et autres
Publié: (2025)
par: Zhang, Haoran, et autres
Publié: (2025)
Decision-making with Speculative Opponent Models
par: Sun, Jing, et autres
Publié: (2022)
par: Sun, Jing, et autres
Publié: (2022)
Agentic AI Framework for Smart Inventory Replenishment
par: Syed, Toqeer Ali, et autres
Publié: (2025)
par: Syed, Toqeer Ali, et autres
Publié: (2025)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
par: He, Pengfei, et autres
Publié: (2025)
par: He, Pengfei, et autres
Publié: (2025)
CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
par: Chen, John, et autres
Publié: (2026)
par: Chen, John, et autres
Publié: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
par: Zhang, Linghua, et autres
Publié: (2026)
par: Zhang, Linghua, et autres
Publié: (2026)
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
par: Li, Xiangyi, et autres
Publié: (2026)
par: Li, Xiangyi, et autres
Publié: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
par: Lu, Jiaxuan, et autres
Publié: (2026)
par: Lu, Jiaxuan, et autres
Publié: (2026)
Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
par: Shi, Bingkang, et autres
Publié: (2025)
par: Shi, Bingkang, et autres
Publié: (2025)
Gender and Positional Biases in LLM-Based Hiring Decisions: Evidence from Comparative CV/Résumé Evaluations
par: Rozado, David
Publié: (2025)
par: Rozado, David
Publié: (2025)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
par: Jin, Tengjun, et autres
Publié: (2025)
par: Jin, Tengjun, et autres
Publié: (2025)
LLM Biases
par: Han, Jinhui, et autres
Publié: (2026)
par: Han, Jinhui, et autres
Publié: (2026)
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
par: Zhu, Xuanyu, et autres
Publié: (2026)
par: Zhu, Xuanyu, et autres
Publié: (2026)
ORPilot: A Production-Oriented Agentic LLM-for-OR Tool for Optimization Modeling
par: Xie, Guangrui
Publié: (2026)
par: Xie, Guangrui
Publié: (2026)
GameDevBench: Evaluating Agentic Capabilities Through Game Development
par: Chi, Wayne, et autres
Publié: (2026)
par: Chi, Wayne, et autres
Publié: (2026)
Evaluating Small Language Models for Agentic On-Farm Decision Support Systems
par: Liu, Enhong, et autres
Publié: (2025)
par: Liu, Enhong, et autres
Publié: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
par: Wu, Yunze, et autres
Publié: (2025)
par: Wu, Yunze, et autres
Publié: (2025)
From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness
par: Cao, Linbo, et autres
Publié: (2026)
par: Cao, Linbo, et autres
Publié: (2026)
Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search
par: McCleary, Kyle, et autres
Publié: (2026)
par: McCleary, Kyle, et autres
Publié: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
par: Liu, Yuxuan, et autres
Publié: (2026)
par: Liu, Yuxuan, et autres
Publié: (2026)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
par: Wang, Weiyi, et autres
Publié: (2026)
par: Wang, Weiyi, et autres
Publié: (2026)
Fairness Shields: Safeguarding against Biased Decision Makers
par: Cano, Filip, et autres
Publié: (2024)
par: Cano, Filip, et autres
Publié: (2024)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
par: Liu, Yinuo, et autres
Publié: (2026)
par: Liu, Yinuo, et autres
Publié: (2026)
Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction
par: Vishwakarma, Harit, et autres
Publié: (2024)
par: Vishwakarma, Harit, et autres
Publié: (2024)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
par: Li, Zongjie, et autres
Publié: (2023)
par: Li, Zongjie, et autres
Publié: (2023)
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
par: Liu, Ruoqi, et autres
Publié: (2026)
par: Liu, Ruoqi, et autres
Publié: (2026)
DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
par: Xie, Yaqi, et autres
Publié: (2026)
par: Xie, Yaqi, et autres
Publié: (2026)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
par: Deng, Shihan, et autres
Publié: (2024)
par: Deng, Shihan, et autres
Publié: (2024)
SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents
par: Nandi, Subhrangshu, et autres
Publié: (2025)
par: Nandi, Subhrangshu, et autres
Publié: (2025)
Documents similaires
-
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
par: Zhao, Yuxuan, et autres
Publié: (2026) -
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025) -
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
par: Zhao, Yujie, et autres
Publié: (2026) -
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
par: Gao, Yuxuan, et autres
Publié: (2026) -
Agentic LLM Framework for Adaptive Decision Discourse
par: Dolant, Antoine, et autres
Publié: (2025)