Evaluating Strategic Reasoning in Forecasting Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liptay, Tom, Schwarz, Dan, Poyiadzi, Rafael, Wildman, Jack, Bosse, Nikos I. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automating Forecasting Question Generation and Resolution for AI Evaluation
par: Bosse, Nikos I., et autres
Publié: (2026)
par: Bosse, Nikos I., et autres
Publié: (2026)
Bench to the Future: A Pastcasting Benchmark for Forecasting Agents
par: FutureSearch, et autres
Publié: (2025)
par: FutureSearch, et autres
Publié: (2025)
Deep Research Bench: Evaluating AI Web Research Agents
par: FutureSearch, et autres
Publié: (2025)
par: FutureSearch, et autres
Publié: (2025)
RAmBLA: A Framework for Evaluating the Reliability of LLMs as Assistants in the Biomedical Domain
par: Bolton, William James, et autres
Publié: (2024)
par: Bolton, William James, et autres
Publié: (2024)
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
par: Wang, Kevin, et autres
Publié: (2026)
par: Wang, Kevin, et autres
Publié: (2026)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
par: Costarelli, Anthony, et autres
Publié: (2024)
par: Costarelli, Anthony, et autres
Publié: (2024)
A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models
par: Yashwanth, Tadisetty Sai, et autres
Publié: (2025)
par: Yashwanth, Tadisetty Sai, et autres
Publié: (2025)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
par: He, Yidong, et autres
Publié: (2026)
par: He, Yidong, et autres
Publié: (2026)
Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
par: Kumarage, Tharindu, et autres
Publié: (2026)
par: Kumarage, Tharindu, et autres
Publié: (2026)
Responsibility-aware Strategic Reasoning in Probabilistic Multi-Agent Systems
par: Mu, Chunyan, et autres
Publié: (2024)
par: Mu, Chunyan, et autres
Publié: (2024)
Agents Require Metacognitive and Strategic Reasoning to Succeed in the Coming Labor Markets
par: Zhang, Simpson, et autres
Publié: (2025)
par: Zhang, Simpson, et autres
Publié: (2025)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
par: Yuan, Huining, et autres
Publié: (2025)
par: Yuan, Huining, et autres
Publié: (2025)
Efficient Deterministic Renewable Energy Forecasting Guided by Multiple-Location Weather Data
par: Symeonidis, Charalampos, et autres
Publié: (2024)
par: Symeonidis, Charalampos, et autres
Publié: (2024)
TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems
par: Ahamed, Md Atik, et autres
Publié: (2026)
par: Ahamed, Md Atik, et autres
Publié: (2026)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
par: Xu, Zelai, et autres
Publié: (2025)
par: Xu, Zelai, et autres
Publié: (2025)
KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning
par: Feng, Kun, et autres
Publié: (2026)
par: Feng, Kun, et autres
Publié: (2026)
The Reasons that Agents Act: Intention and Instrumental Goals
par: Ward, Francis Rhys, et autres
Publié: (2024)
par: Ward, Francis Rhys, et autres
Publié: (2024)
ReasonAgain: Using Extractable Symbolic Programs to Evaluate Mathematical Reasoning
par: Yu, Xiaodong, et autres
Publié: (2024)
par: Yu, Xiaodong, et autres
Publié: (2024)
From Extraction to Synthesis: Entangled Heuristics for Agent-Augmented Strategic Reasoning
par: Ghisellini, Renato, et autres
Publié: (2025)
par: Ghisellini, Renato, et autres
Publié: (2025)
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
par: Ahn, Daechul, et autres
Publié: (2025)
par: Ahn, Daechul, et autres
Publié: (2025)
MIRAI: Evaluating LLM Agents for Event Forecasting
par: Ye, Chenchen, et autres
Publié: (2024)
par: Ye, Chenchen, et autres
Publié: (2024)
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
par: Borchmann, Łukasz, et autres
Publié: (2026)
par: Borchmann, Łukasz, et autres
Publié: (2026)
Agents of Change: Self-Evolving LLM Agents for Strategic Planning
par: Belle, Nikolas, et autres
Publié: (2025)
par: Belle, Nikolas, et autres
Publié: (2025)
STARK: Strategic Team of Agents for Refining Kernels
par: Dong, Juncheng, et autres
Publié: (2025)
par: Dong, Juncheng, et autres
Publié: (2025)
MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
par: Montalvo, Marc S., et autres
Publié: (2025)
par: Montalvo, Marc S., et autres
Publié: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
par: Guo, Zhengkang, et autres
Publié: (2026)
par: Guo, Zhengkang, et autres
Publié: (2026)
RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction
par: Ko, Hanbum, et autres
Publié: (2026)
par: Ko, Hanbum, et autres
Publié: (2026)
SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence
par: Bu, Yuyan, et autres
Publié: (2026)
par: Bu, Yuyan, et autres
Publié: (2026)
AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning
par: Fu, Suzhong, et autres
Publié: (2026)
par: Fu, Suzhong, et autres
Publié: (2026)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
par: Liu, Jincheng, et autres
Publié: (2025)
par: Liu, Jincheng, et autres
Publié: (2025)
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
AsyncVoice Agent: Real-Time Explanation for LLM Planning and Reasoning
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
par: Wu, Jiaao, et autres
Publié: (2026)
par: Wu, Jiaao, et autres
Publié: (2026)
AgentCaster: Reasoning-Guided Tornado Forecasting
par: Chen, Michael
Publié: (2025)
par: Chen, Michael
Publié: (2025)
TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs
par: Wang, Haochuan, et autres
Publié: (2024)
par: Wang, Haochuan, et autres
Publié: (2024)
GTBench: Uncovering the Strategic Reasoning Limitations of LLMs via Game-Theoretic Evaluations
par: Duan, Jinhao, et autres
Publié: (2024)
par: Duan, Jinhao, et autres
Publié: (2024)
ASTRA: A Negotiation Agent with Adaptive and Strategic Reasoning via Tool-integrated Action for Dynamic Offer Optimization
par: Kwon, Deuksin, et autres
Publié: (2025)
par: Kwon, Deuksin, et autres
Publié: (2025)
Human-Centered Evaluation of XAI Methods
par: Dawoud, Karam, et autres
Publié: (2023)
par: Dawoud, Karam, et autres
Publié: (2023)
Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents
par: Putta, Pranav, et autres
Publié: (2024)
par: Putta, Pranav, et autres
Publié: (2024)
Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play
par: Ekne, H. C.
Publié: (2026)
par: Ekne, H. C.
Publié: (2026)
Documents similaires
-
Automating Forecasting Question Generation and Resolution for AI Evaluation
par: Bosse, Nikos I., et autres
Publié: (2026) -
Bench to the Future: A Pastcasting Benchmark for Forecasting Agents
par: FutureSearch, et autres
Publié: (2025) -
Deep Research Bench: Evaluating AI Web Research Agents
par: FutureSearch, et autres
Publié: (2025) -
RAmBLA: A Framework for Evaluating the Reliability of LLMs as Assistants in the Biomedical Domain
par: Bolton, William James, et autres
Publié: (2024) -
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
par: Wang, Kevin, et autres
Publié: (2026)