Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Chengshuai, Li, Wenzhe, Liang, Xinran, Lu, Yizhou, Yang, Wenjia, Feng, Ruirong, Karten, Seth, Yang, Ziran, Ding, Zihan, Sarch, Gabriel, Chen, Danqi, Narasimhan, Karthik, Jin, Chi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FightLadder: A Benchmark for Competitive Multi-Agent Reinforcement Learning
por: Li, Wenzhe, et al.
Publicado: (2024)
por: Li, Wenzhe, et al.
Publicado: (2024)
Continual Harness: Online Adaptation for Self-Improving Foundation Agents
por: Karten, Seth, et al.
Publicado: (2026)
por: Karten, Seth, et al.
Publicado: (2026)
LLM Economist: Large Population Models and Mechanism Design in Multi-Agent Generative Simulacra
por: Karten, Seth, et al.
Publicado: (2025)
por: Karten, Seth, et al.
Publicado: (2025)
Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces
por: Karten, Seth, et al.
Publicado: (2026)
por: Karten, Seth, et al.
Publicado: (2026)
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
por: Chen, Howard, et al.
Publicado: (2025)
por: Chen, Howard, et al.
Publicado: (2025)
Automatic Generation of High-Performance RL Environments
por: Karten, Seth, et al.
Publicado: (2026)
por: Karten, Seth, et al.
Publicado: (2026)
PokéChamp: an Expert-level Minimax Language Agent
por: Karten, Seth, et al.
Publicado: (2025)
por: Karten, Seth, et al.
Publicado: (2025)
Vero: An Open RL Recipe for General Visual Reasoning
por: Sarch, Gabriel, et al.
Publicado: (2026)
por: Sarch, Gabriel, et al.
Publicado: (2026)
Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames
por: Ravi, Sahithya, et al.
Publicado: (2025)
por: Ravi, Sahithya, et al.
Publicado: (2025)
Transformers as Game Players: Provable In-context Game-playing Capabilities of Pre-trained Models
por: Shi, Chengshuai, et al.
Publicado: (2024)
por: Shi, Chengshuai, et al.
Publicado: (2024)
The Finite Primitive Basis Theorem for Computational Imaging: Formal Foundations of the OperatorGraph Representation
por: Yang, Chengshuai
Publicado: (2026)
por: Yang, Chengshuai
Publicado: (2026)
A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation
por: Yang, Chengshuai
Publicado: (2026)
por: Yang, Chengshuai
Publicado: (2026)
Designing Any Imaging System from Natural Language: Agent-Constrained Composition over a Finite Primitive Basis
por: Yang, Chengshuai
Publicado: (2026)
por: Yang, Chengshuai
Publicado: (2026)
Cultivating Game Sense for Yourself: Making VLMs Gaming Experts
por: Lu, Wenxuan, et al.
Publicado: (2025)
por: Lu, Wenxuan, et al.
Publicado: (2025)
Autonomous Decision Making for UAV Cooperative Pursuit-Evasion Game with Reinforcement Learning
por: Zhao, Yang, et al.
Publicado: (2024)
por: Zhao, Yang, et al.
Publicado: (2024)
VLMs Guided Interpretable Decision Making for Autonomous Driving
por: Hu, Xin, et al.
Publicado: (2025)
por: Hu, Xin, et al.
Publicado: (2025)
GameDevBench: Evaluating Agentic Capabilities Through Game Development
por: Chi, Wayne, et al.
Publicado: (2026)
por: Chi, Wayne, et al.
Publicado: (2026)
Odysseus and the Cult of Apollo at Delos
por: Jim Marks
Publicado: (2016)
por: Jim Marks
Publicado: (2016)
Game-Theoretic Multiagent Reinforcement Learning
por: Yang, Yaodong, et al.
Publicado: (2020)
por: Yang, Yaodong, et al.
Publicado: (2020)
Eleven Primitives and Three Gates: The Universal Structure of Computational Imaging
por: Yang, Chengshuai, et al.
Publicado: (2026)
por: Yang, Chengshuai, et al.
Publicado: (2026)
InverseNet: Benchmarking Operator Mismatch and Calibration Across Compressive Imaging Modalities
por: Yang, Chengshuai, et al.
Publicado: (2026)
por: Yang, Chengshuai, et al.
Publicado: (2026)
LLMs are Superior Feedback Providers: Bootstrapping Reasoning for Lie Detection with Self-Generated Feedback
por: Banerjee, Tanushree, et al.
Publicado: (2024)
por: Banerjee, Tanushree, et al.
Publicado: (2024)
SPARKLE: A Nonparametric Approach for Online Decision-Making with High-Dimensional Covariates
por: Wang, Wenjia, et al.
Publicado: (2025)
por: Wang, Wenjia, et al.
Publicado: (2025)
LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization
por: Zhao, Yang, et al.
Publicado: (2026)
por: Zhao, Yang, et al.
Publicado: (2026)
Scaling Laws for Imitation Learning in Single-Agent Games
por: Tuyls, Jens, et al.
Publicado: (2023)
por: Tuyls, Jens, et al.
Publicado: (2023)
VideoGameBench: Can Vision-Language Models complete popular video games?
por: Zhang, Alex L., et al.
Publicado: (2025)
por: Zhang, Alex L., et al.
Publicado: (2025)
Efficient Prompt Optimization Through the Lens of Best Arm Identification
por: Shi, Chengshuai, et al.
Publicado: (2024)
por: Shi, Chengshuai, et al.
Publicado: (2024)
Grounded Reinforcement Learning for Visual Reasoning
por: Sarch, Gabriel, et al.
Publicado: (2025)
por: Sarch, Gabriel, et al.
Publicado: (2025)
Entropy, Thermodynamics and the Geometrization of the Language Model
por: Yang, Wenzhe
Publicado: (2024)
por: Yang, Wenzhe
Publicado: (2024)
Securing Equal Share: A Principled Approach for Learning Multiplayer Symmetric Games
por: Ge, Jiawei, et al.
Publicado: (2024)
por: Ge, Jiawei, et al.
Publicado: (2024)
Hierarchical Decision-Making in Population Games
por: Chen, Yu-Wen, et al.
Publicado: (2025)
por: Chen, Yu-Wen, et al.
Publicado: (2025)
A Multi-Resolution Dynamic Game Framework for Cross-Echelon Decision-Making in Cyber Warfare
por: Yang, Ya-Ting, et al.
Publicado: (2025)
por: Yang, Ya-Ting, et al.
Publicado: (2025)
Reinforcement Learning in High-frequency Market Making
por: Zheng, Yuheng, et al.
Publicado: (2024)
por: Zheng, Yuheng, et al.
Publicado: (2024)
Code as Reward: Empowering Reinforcement Learning with VLMs
por: Venuto, David, et al.
Publicado: (2024)
por: Venuto, David, et al.
Publicado: (2024)
AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game
por: Chi, Yizhou, et al.
Publicado: (2024)
por: Chi, Yizhou, et al.
Publicado: (2024)
Morphology-Aware Graph Reinforcement Learning for Tensegrity Robot Locomotion
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs
por: Yan, Yuming, et al.
Publicado: (2026)
por: Yan, Yuming, et al.
Publicado: (2026)
Understanding the Effects of AI-Assisted Critical Thinking on Human-AI Decision Making
por: Tian, Harry Yizhou, et al.
Publicado: (2026)
por: Tian, Harry Yizhou, et al.
Publicado: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Intent-Context Synergy Reinforcement Learning for Autonomous UAV Decision-Making in Air Combat
por: Fu, Jiahao, et al.
Publicado: (2026)
por: Fu, Jiahao, et al.
Publicado: (2026)
Ejemplares similares
-
FightLadder: A Benchmark for Competitive Multi-Agent Reinforcement Learning
por: Li, Wenzhe, et al.
Publicado: (2024) -
Continual Harness: Online Adaptation for Self-Improving Foundation Agents
por: Karten, Seth, et al.
Publicado: (2026) -
LLM Economist: Large Population Models and Mechanism Design in Multi-Agent Generative Simulacra
por: Karten, Seth, et al.
Publicado: (2025) -
Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces
por: Karten, Seth, et al.
Publicado: (2026) -
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
por: Chen, Howard, et al.
Publicado: (2025)