AIM-Bench: Evaluating Decision-making Biases of Agentic LLM as Inventory Manager
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Xuhua, Xie, Yuxuan, Chen, Caihua, Sun, Yuxiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
by: Zhao, Yuxuan, et al.
Published: (2026)
by: Zhao, Yuxuan, et al.
Published: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
by: Xu, Kaixuan, et al.
Published: (2025)
by: Xu, Kaixuan, et al.
Published: (2025)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
by: Zhao, Yujie, et al.
Published: (2026)
by: Zhao, Yujie, et al.
Published: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
by: Gao, Yuxuan, et al.
Published: (2026)
by: Gao, Yuxuan, et al.
Published: (2026)
Agentic LLM Framework for Adaptive Decision Discourse
by: Dolant, Antoine, et al.
Published: (2025)
by: Dolant, Antoine, et al.
Published: (2025)
Large Language Newsvendor: Decision Biases and Cognitive Mechanisms
by: Liu, Jifei, et al.
Published: (2025)
by: Liu, Jifei, et al.
Published: (2025)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
by: Xu, Xinbo, et al.
Published: (2026)
by: Xu, Xinbo, et al.
Published: (2026)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
by: Chen, Wanyi, et al.
Published: (2026)
by: Chen, Wanyi, et al.
Published: (2026)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
by: Zhu, Pengyu, et al.
Published: (2026)
by: Zhu, Pengyu, et al.
Published: (2026)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
by: Zhang, Haoran, et al.
Published: (2025)
by: Zhang, Haoran, et al.
Published: (2025)
Decision-making with Speculative Opponent Models
by: Sun, Jing, et al.
Published: (2022)
by: Sun, Jing, et al.
Published: (2022)
Agentic AI Framework for Smart Inventory Replenishment
by: Syed, Toqeer Ali, et al.
Published: (2025)
by: Syed, Toqeer Ali, et al.
Published: (2025)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V
by: Chen, John, et al.
Published: (2026)
by: Chen, John, et al.
Published: (2026)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
by: Zhang, Linghua, et al.
Published: (2026)
by: Zhang, Linghua, et al.
Published: (2026)
ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces
by: Li, Xiangyi, et al.
Published: (2026)
by: Li, Xiangyi, et al.
Published: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
by: Lu, Jiaxuan, et al.
Published: (2026)
by: Lu, Jiaxuan, et al.
Published: (2026)
Actions Speak Louder than Words: Agent Decisions Reveal Implicit Biases in Language Models
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
FAIRGAMER: Evaluating Social Biases in LLM-Based Video Game NPCs
by: Shi, Bingkang, et al.
Published: (2025)
by: Shi, Bingkang, et al.
Published: (2025)
Gender and Positional Biases in LLM-Based Hiring Decisions: Evidence from Comparative CV/Résumé Evaluations
by: Rozado, David
Published: (2025)
by: Rozado, David
Published: (2025)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
by: Jin, Tengjun, et al.
Published: (2025)
by: Jin, Tengjun, et al.
Published: (2025)
LLM Biases
by: Han, Jinhui, et al.
Published: (2026)
by: Han, Jinhui, et al.
Published: (2026)
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
by: Zhu, Xuanyu, et al.
Published: (2026)
by: Zhu, Xuanyu, et al.
Published: (2026)
ORPilot: A Production-Oriented Agentic LLM-for-OR Tool for Optimization Modeling
by: Xie, Guangrui
Published: (2026)
by: Xie, Guangrui
Published: (2026)
GameDevBench: Evaluating Agentic Capabilities Through Game Development
by: Chi, Wayne, et al.
Published: (2026)
by: Chi, Wayne, et al.
Published: (2026)
Evaluating Small Language Models for Agentic On-Farm Decision Support Systems
by: Liu, Enhong, et al.
Published: (2025)
by: Liu, Enhong, et al.
Published: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
by: Wu, Yunze, et al.
Published: (2025)
by: Wu, Yunze, et al.
Published: (2025)
From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness
by: Cao, Linbo, et al.
Published: (2026)
by: Cao, Linbo, et al.
Published: (2026)
Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search
by: McCleary, Kyle, et al.
Published: (2026)
by: McCleary, Kyle, et al.
Published: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
by: Liu, Yuxuan, et al.
Published: (2026)
by: Liu, Yuxuan, et al.
Published: (2026)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
by: Wang, Weiyi, et al.
Published: (2026)
by: Wang, Weiyi, et al.
Published: (2026)
Fairness Shields: Safeguarding against Biased Decision Makers
by: Cano, Filip, et al.
Published: (2024)
by: Cano, Filip, et al.
Published: (2024)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
by: Liu, Yi, et al.
Published: (2026)
by: Liu, Yi, et al.
Published: (2026)
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
by: Liu, Yinuo, et al.
Published: (2026)
by: Liu, Yinuo, et al.
Published: (2026)
Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction
by: Vishwakarma, Harit, et al.
Published: (2024)
by: Vishwakarma, Harit, et al.
Published: (2024)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
by: Li, Zongjie, et al.
Published: (2023)
by: Li, Zongjie, et al.
Published: (2023)
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
by: Liu, Ruoqi, et al.
Published: (2026)
by: Liu, Ruoqi, et al.
Published: (2026)
DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
by: Xie, Yaqi, et al.
Published: (2026)
by: Xie, Yaqi, et al.
Published: (2026)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
by: Deng, Shihan, et al.
Published: (2024)
by: Deng, Shihan, et al.
Published: (2024)
SOP-Bench: Complex Industrial SOPs for Evaluating LLM Agents
by: Nandi, Subhrangshu, et al.
Published: (2025)
by: Nandi, Subhrangshu, et al.
Published: (2025)
Similar Items
-
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
by: Zhao, Yuxuan, et al.
Published: (2026) -
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
by: Xu, Kaixuan, et al.
Published: (2025) -
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
by: Zhao, Yujie, et al.
Published: (2026) -
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
by: Gao, Yuxuan, et al.
Published: (2026) -
Agentic LLM Framework for Adaptive Decision Discourse
by: Dolant, Antoine, et al.
Published: (2025)