A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yashwanth, Tadisetty Sai, C, Dhatri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Structure of Floating-Point Noise in Batch-Invariant GPU Matrix Multiplication
di: Yashwanth, Tadisetty Sai
Pubblicazione: (2025)
di: Yashwanth, Tadisetty Sai
Pubblicazione: (2025)
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
di: Jain, Daksh, et al.
Pubblicazione: (2025)
di: Jain, Daksh, et al.
Pubblicazione: (2025)
Real Time Child Abduction And Detection System
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
di: Hu, Sihao, et al.
Pubblicazione: (2024)
di: Hu, Sihao, et al.
Pubblicazione: (2024)
The Aegis Protocol: A Foundational Security Framework for Autonomous AI Agents
di: Adapala, Sai Teja Reddy, et al.
Pubblicazione: (2025)
di: Adapala, Sai Teja Reddy, et al.
Pubblicazione: (2025)
Evaluating Strategic Reasoning in Forecasting Agents
di: Liptay, Tom, et al.
Pubblicazione: (2026)
di: Liptay, Tom, et al.
Pubblicazione: (2026)
MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
di: Wang, Kevin, et al.
Pubblicazione: (2026)
di: Wang, Kevin, et al.
Pubblicazione: (2026)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
di: He, Yidong, et al.
Pubblicazione: (2026)
di: He, Yidong, et al.
Pubblicazione: (2026)
Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play
di: Ekne, H. C.
Pubblicazione: (2026)
di: Ekne, H. C.
Pubblicazione: (2026)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
di: Liu, Jincheng, et al.
Pubblicazione: (2025)
PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?
di: Hua, Dongdong, et al.
Pubblicazione: (2026)
di: Hua, Dongdong, et al.
Pubblicazione: (2026)
SV3.3B: A Sports Video Understanding Model for Action Recognition
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
di: Kodathala, Sai Varun, et al.
Pubblicazione: (2025)
Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons
di: Son, Seonil, et al.
Pubblicazione: (2024)
di: Son, Seonil, et al.
Pubblicazione: (2024)
Responsibility-aware Strategic Reasoning in Probabilistic Multi-Agent Systems
di: Mu, Chunyan, et al.
Pubblicazione: (2024)
di: Mu, Chunyan, et al.
Pubblicazione: (2024)
CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
Cooperative Strategic Planning Enhances Reasoning Capabilities in Large Language Models
di: Wang, Danqing, et al.
Pubblicazione: (2024)
di: Wang, Danqing, et al.
Pubblicazione: (2024)
Crimson: Empowering Strategic Reasoning in Cybersecurity through Large Language Models
di: Jin, Jiandong, et al.
Pubblicazione: (2024)
di: Jin, Jiandong, et al.
Pubblicazione: (2024)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
di: Yuan, Huining, et al.
Pubblicazione: (2025)
di: Yuan, Huining, et al.
Pubblicazione: (2025)
Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models
di: Wit, Maria Carolina Cornelia, et al.
Pubblicazione: (2025)
di: Wit, Maria Carolina Cornelia, et al.
Pubblicazione: (2025)
K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning
di: Zhang, Yadong, et al.
Pubblicazione: (2024)
di: Zhang, Yadong, et al.
Pubblicazione: (2024)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
di: Yin, Qiyue, et al.
Pubblicazione: (2025)
di: Yin, Qiyue, et al.
Pubblicazione: (2025)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
di: Xu, Zelai, et al.
Pubblicazione: (2025)
di: Xu, Zelai, et al.
Pubblicazione: (2025)
Neural Algorithmic Reasoners informed Large Language Model for Multi-Agent Path Finding
di: Feng, Pu, et al.
Pubblicazione: (2025)
di: Feng, Pu, et al.
Pubblicazione: (2025)
Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval
di: Jelodar, Hamed, et al.
Pubblicazione: (2026)
di: Jelodar, Hamed, et al.
Pubblicazione: (2026)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models
di: Ma, Siqi, et al.
Pubblicazione: (2025)
di: Ma, Siqi, et al.
Pubblicazione: (2025)
DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
di: Mo, Yunxiang, et al.
Pubblicazione: (2025)
di: Mo, Yunxiang, et al.
Pubblicazione: (2025)
Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning
di: Yu, Song, et al.
Pubblicazione: (2025)
di: Yu, Song, et al.
Pubblicazione: (2025)
Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
di: Ahn, Daechul, et al.
Pubblicazione: (2025)
di: Ahn, Daechul, et al.
Pubblicazione: (2025)
PokéAI: A Goal-Generating, Battle-Optimizing Multi-agent System for Pokemon Red
di: Liu, Zihao, et al.
Pubblicazione: (2025)
di: Liu, Zihao, et al.
Pubblicazione: (2025)
Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
di: Lu, Leo, et al.
Pubblicazione: (2025)
di: Lu, Leo, et al.
Pubblicazione: (2025)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
di: Li, Pengfeng, et al.
Pubblicazione: (2026)
di: Li, Pengfeng, et al.
Pubblicazione: (2026)
JudgeSQL: Reasoning over SQL Candidates with Weighted Consensus Tournament
di: Bai, Jiayuan, et al.
Pubblicazione: (2025)
di: Bai, Jiayuan, et al.
Pubblicazione: (2025)
LLM-Guided Synthetic Augmentation (LGSA) for Mitigating Bias in AI Systems
di: Karri, Sai Suhruth Reddy, et al.
Pubblicazione: (2025)
di: Karri, Sai Suhruth Reddy, et al.
Pubblicazione: (2025)
Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models
di: Qiu, Xihe, et al.
Pubblicazione: (2024)
di: Qiu, Xihe, et al.
Pubblicazione: (2024)
An Automated Multi-modal Evaluation Framework for Mobile Intelligent Assistants Based on Large Language Models and Multi-Agent Collaboration
di: Wang, Meiping, et al.
Pubblicazione: (2025)
di: Wang, Meiping, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
di: Patel, Nisarg, et al.
Pubblicazione: (2024)
di: Patel, Nisarg, et al.
Pubblicazione: (2024)
Improving Physics Reasoning in Large Language Models Using Mixture of Refinement Agents
di: Jaiswal, Raj, et al.
Pubblicazione: (2024)
di: Jaiswal, Raj, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Structure of Floating-Point Noise in Batch-Invariant GPU Matrix Multiplication
di: Yashwanth, Tadisetty Sai
Pubblicazione: (2025) -
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
di: Jain, Daksh, et al.
Pubblicazione: (2025) -
Real Time Child Abduction And Detection System
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025) -
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
di: Hu, Sihao, et al.
Pubblicazione: (2024) -
The Aegis Protocol: A Foundational Security Framework for Autonomous AI Agents
di: Adapala, Sai Teja Reddy, et al.
Pubblicazione: (2025)