MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Kevin, Thöni, Anna, Kempinski, Benjamin, Cheng, Bobby, Yao, Jianzhu, Finch, Benjamin, Guertler, Leon, Nadkarni, Viraj, Jiang, Yihan, Korshuk, Aliaksei, Buyantuev, Alexander, Makarov, Ilya, Wu, Siyuan, Cheng, Yu-Chi, Ju, Yan-Ru, Wu, Ti-Rong, Chu, I-Hsuan, Yang, Yu-Yu, Wu, I-Chen, Huang, Yitian, Cao, Qinlu, Sun, Yiheng, Dai, Yuhong, Yao, Hongkun, Fu, Jingxuan, Zhang, Jiwei, Liao, Hao, Ebeling, Mossimo, Arun, Govind, Bathini, Sadhvik, Arya, Mihir S, Anish, Avinash, Ranjan, Aditya, Phatnani, Kirtana Sunil, KS, Paval, Mehta, Vrushali, S, Aravind, Arora, Nikhil, Upadhyay, Tanya, Bandagale, Amol, Lu, Yuan, Hsiao, ChunEn, Lin, YuTing, Chung, Arvin, Thomas, Jerry John, Laurière, Mathieu, Choshen, Leshem, Bachrach, Yoram, Viswanath, Pramod, Polukarov, Maria, Tan, Cheston, Kachman, Tal, Wang, Atlas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution
par: Korshuk, Aliaksei, et autres
Publié: (2026)
par: Korshuk, Aliaksei, et autres
Publié: (2026)
Going with the Flow: Approximating Banzhaf Values via Graph Neural Networks
par: Kempinski, Benjamin, et autres
Publié: (2025)
par: Kempinski, Benjamin, et autres
Publié: (2025)
InfluenceNet: AI Models for Banzhaf and Shapley Value Prediction
par: Kempinski, Benjamin, et autres
Publié: (2025)
par: Kempinski, Benjamin, et autres
Publié: (2025)
Deep Learning for Oral Health: Benchmarking ViT, DeiT, BEiT, ConvNeXt, and Swin Transformer
par: George, Ajo Babu, et autres
Publié: (2025)
par: George, Ajo Babu, et autres
Publié: (2025)
Neural Mean-Field Games: Extending Mean-Field Game Theory with Neural Stochastic Differential Equations
par: Thöni, Anna C. M., et autres
Publié: (2025)
par: Thöni, Anna C. M., et autres
Publié: (2025)
Evaluation of a Robust Control System in Real-World Cable-Driven Parallel Robots
par: Nurtdinov, Damir, et autres
Publié: (2025)
par: Nurtdinov, Damir, et autres
Publié: (2025)
ProtoN: Prototype Node Graph Neural Network for Unconstrained Multi-Impression Ear Recognition
par: Peddi, Santhoshkumar, et autres
Publié: (2025)
par: Peddi, Santhoshkumar, et autres
Publié: (2025)
TextArena
par: Guertler, Leon, et autres
Publié: (2025)
par: Guertler, Leon, et autres
Publié: (2025)
STLM Engineering Report: Dropout
par: Hillier, Dylan, et autres
Publié: (2024)
par: Hillier, Dylan, et autres
Publié: (2024)
Modelling Chemical Reaction Networks using Neural Ordinary Differential Equations
par: Thöni, Anna C. M., et autres
Publié: (2025)
par: Thöni, Anna C. M., et autres
Publié: (2025)
Super Tiny Language Models
par: Hillier, Dylan, et autres
Publié: (2024)
par: Hillier, Dylan, et autres
Publié: (2024)
Analyzing Customer Engagement for E-commerce Brands Using Instagram: A Social Media Analytics Approach
par: Vrushali
Publié: (2025)
par: Vrushali
Publié: (2025)
SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs
par: Pan, Chao, et autres
Publié: (2026)
par: Pan, Chao, et autres
Publié: (2026)
AI-Enhanced Factor Analysis for Predicting S&P 500 Stock Dynamics
par: Gu, Jiajun, et autres
Publié: (2024)
par: Gu, Jiajun, et autres
Publié: (2024)
David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning
par: Nellessen, Samuel, et autres
Publié: (2026)
par: Nellessen, Samuel, et autres
Publié: (2026)
Conditions for Equivalence of Random Interlacements and Random Walk Reflected off of Infinity
par: Yu, Yao
Publié: (2025)
par: Yu, Yao
Publié: (2025)
In Situ Inorganic/Organic Protective Layer on Carbon Paper as Advanced Current Collector for Robust Li Metal Anode
par: Youpeng Li, et autres
Publié: (2024)
par: Youpeng Li, et autres
Publié: (2024)
Beyond Equations: Large Language Models as a New Frontier for Resilient Ecosystem Modelling
par: Yu Wu
Publié: (2025)
par: Yu Wu
Publié: (2025)
ReCode: Updating Code API Knowledge with Reinforcement Learning
par: Wu, Haoze, et autres
Publié: (2025)
par: Wu, Haoze, et autres
Publié: (2025)
Incompressible limit for the 3D compressible FENE dumbbell model
par: Gao, Jincheng, et autres
Publié: (2025)
par: Gao, Jincheng, et autres
Publié: (2025)
Inference Attacks: A Taxonomy, Survey, and Promising Directions
par: Wu, Feng, et autres
Publié: (2024)
par: Wu, Feng, et autres
Publié: (2024)
Three‐dimensional simulation and performance control of a wet packing system with ultra‐fine stone powder and cement particles
par: Junhao Liang, et autres
Publié: (2026)
par: Junhao Liang, et autres
Publié: (2026)
Introduction of Organic Dyes into Cadmium(II) MOF for Tunable Light Emission and Highly Sensitive Probing Antibiotics
par: Haozhen Wu, et autres
Publié: (2024)
par: Haozhen Wu, et autres
Publié: (2024)
Insight into sulfapyridine degradation mechanism and antibacterial activity change using enhanced hydrolysis
par: Pengcheng Yao, et autres
Publié: (2024)
par: Pengcheng Yao, et autres
Publié: (2024)
Graphene-like nanoribbons connected by four-/five- membered rings on pentacene/picene precursors, Au(110) surface
par: Yao, Yu, et autres
Publié: (2023)
par: Yao, Yu, et autres
Publié: (2023)
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
par: Liu, Bo, et autres
Publié: (2025)
par: Liu, Bo, et autres
Publié: (2025)
ComicScene154: A Scene Dataset for Comic Analysis
par: Paval, Sandro, et autres
Publié: (2025)
par: Paval, Sandro, et autres
Publié: (2025)
Lattice Translation Modulated Symmetries and TFTs
par: Yao, Ching-Yu
Publié: (2025)
par: Yao, Ching-Yu
Publié: (2025)
A theoretical systems chronopharmacology approach for COVID‐19: Modeling circadian regulation of lung infection and potential precision therapies
par: Yu‐Yao Tseng
Publié: (2024)
par: Yu‐Yao Tseng
Publié: (2024)
Quantum Gravity via Vacuum Viscosity and the Expanding Earth Hypothesis: A Thermodynamic Model of Nucleon Mass Accretion
par: Papou, Aliaksei
Publié: (2026)
par: Papou, Aliaksei
Publié: (2026)
Planck Meets Hubble within Cosmological Natural Units and Frequency-Dependent Yukawa Potentials Bridging Gravity, QCD, and Nuclear Scales
par: Papou, Aliaksei
Publié: (2026)
par: Papou, Aliaksei
Publié: (2026)
TSR demo code sharing page
par: Laureshyn, Aliaksei
Publié: (2026)
par: Laureshyn, Aliaksei
Publié: (2026)
Bridging MOND and $\Lambda$CDM by Cosmological Jerk and the $v^3$ Scaling
par: Papou, Aliaksei
Publié: (2026)
par: Papou, Aliaksei
Publié: (2026)
Exploring Background Contributions in $H \to Z γ$ Decay
par: Kachanovich, Aliaksei
Publié: (2025)
par: Kachanovich, Aliaksei
Publié: (2025)
Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance
par: Kaliutau, Aliaksei
Publié: (2025)
par: Kaliutau, Aliaksei
Publié: (2025)
Background processes in Higgs decay to Z gamma
par: Kachanovich, Aliaksei
Publié: (2025)
par: Kachanovich, Aliaksei
Publié: (2025)
Robust Market Making: To Quote, or not To Quote
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
ARL-Based Multi-Action Market Making with Hawkes Processes and Variable Volatility
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
Multi-Agent Reinforcement Learning for Market Making: Competition without Collusion
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
Gaussian rational numbers in Cantor sets in the complex plane
par: Wu, Yu-Feng
Publié: (2025)
par: Wu, Yu-Feng
Publié: (2025)
Documents similaires
-
MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution
par: Korshuk, Aliaksei, et autres
Publié: (2026) -
Going with the Flow: Approximating Banzhaf Values via Graph Neural Networks
par: Kempinski, Benjamin, et autres
Publié: (2025) -
InfluenceNet: AI Models for Banzhaf and Shapley Value Prediction
par: Kempinski, Benjamin, et autres
Publié: (2025) -
Deep Learning for Oral Health: Benchmarking ViT, DeiT, BEiT, ConvNeXt, and Swin Transformer
par: George, Ajo Babu, et autres
Publié: (2025) -
Neural Mean-Field Games: Extending Mean-Field Game Theory with Neural Stochastic Differential Equations
par: Thöni, Anna C. M., et autres
Publié: (2025)