Reevaluating Policy Gradient Methods for Imperfect-Information Games
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rudolph, Max, Lichtle, Nathan, Mohammadpour, Sobhan, Bayen, Alexandre, Kolter, J. Zico, Zhang, Amy, Farina, Gabriele, Vinitsky, Eugene, Sokota, Samuel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search
par: Sokota, Samuel, et autres
Publié: (2025)
par: Sokota, Samuel, et autres
Publié: (2025)
The Update-Equivalence Framework for Decision-Time Planning
par: Sokota, Samuel, et autres
Publié: (2023)
par: Sokota, Samuel, et autres
Publié: (2023)
A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate Convergence
par: Liu, Mingyang, et autres
Publié: (2024)
par: Liu, Mingyang, et autres
Publié: (2024)
Traffic Smoothing Controllers for Autonomous Vehicles Using Deep Reinforcement Learning and Real-World Trajectory Data
par: Lichtlé, Nathan, et autres
Publié: (2024)
par: Lichtlé, Nathan, et autres
Publié: (2024)
Learning Correlated Reward Models: Statistical Barriers and Opportunities
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2025)
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2025)
(U)NFV: Supervised and Unsupervised Neural Finite Volume Methods for Solving Hyperbolic PDEs
par: Lichtlé, Nathan, et autres
Publié: (2025)
par: Lichtlé, Nathan, et autres
Publié: (2025)
Arc travel time and path choice model estimation subsumed
par: Mohammadpour, Sobhan, et autres
Publié: (2022)
par: Mohammadpour, Sobhan, et autres
Publié: (2022)
GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning
par: Fan, Zhiyuan, et autres
Publié: (2026)
par: Fan, Zhiyuan, et autres
Publié: (2026)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
par: Akinwande, Victor, et autres
Publié: (2024)
par: Akinwande, Victor, et autres
Publié: (2024)
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
par: Huang, Benhao, et autres
Publié: (2026)
par: Huang, Benhao, et autres
Publié: (2026)
Why is SAM Robust to Label Noise?
par: Baek, Christina, et autres
Publié: (2024)
par: Baek, Christina, et autres
Publié: (2024)
Mimetic Initialization of MLPs
par: Trockman, Asher, et autres
Publié: (2026)
par: Trockman, Asher, et autres
Publié: (2026)
Human-compatible driving partners through data-regularized self-play reinforcement learning
par: Cornelisse, Daphne, et autres
Publié: (2024)
par: Cornelisse, Daphne, et autres
Publié: (2024)
FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
Video Game Level Design as a Multi-Agent Reinforcement Learning Problem
par: Earle, Sam, et autres
Publié: (2025)
par: Earle, Sam, et autres
Publié: (2025)
From Variance to Veracity: Unbundling and Mitigating Gradient Variance in Differentiable Bundle Adjustment Layers
par: Gurumurthy, Swaminathan, et autres
Publié: (2024)
par: Gurumurthy, Swaminathan, et autres
Publié: (2024)
Computing Low-Entropy Couplings for Large-Support Distributions
par: Sokota, Samuel, et autres
Publié: (2024)
par: Sokota, Samuel, et autres
Publié: (2024)
Decoupling regularization from the action space
par: Mohammadpour, Sobhan, et autres
Publié: (2024)
par: Mohammadpour, Sobhan, et autres
Publié: (2024)
Predicting the Performance of Black-box LLMs through Follow-up Queries
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
One-Step Diffusion Distillation via Deep Equilibrium Models
par: Geng, Zhengyang, et autres
Publié: (2023)
par: Geng, Zhengyang, et autres
Publié: (2023)
Diffusing Differentiable Representations
par: Savani, Yash, et autres
Publié: (2024)
par: Savani, Yash, et autres
Publié: (2024)
A Graph Convolutional Network with Signal Phasing Information for Arterial Traffic Prediction
par: Chan, Victor, et autres
Publié: (2020)
par: Chan, Victor, et autres
Publié: (2020)
Generative Posterior Networks for Approximately Bayesian Epistemic Uncertainty Estimation
par: Roderick, Melrose, et autres
Publié: (2023)
par: Roderick, Melrose, et autres
Publié: (2023)
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks
par: Kim, Eungyeup, et autres
Publié: (2026)
par: Kim, Eungyeup, et autres
Publié: (2026)
Maximum entropy GFlowNets with soft Q-learning
par: Mohammadpour, Sobhan, et autres
Publié: (2023)
par: Mohammadpour, Sobhan, et autres
Publié: (2023)
Control Problems for Conservation Laws with Traffic Applications Modeling, Analysis, and Numerical Methods
par: Alexandre Bayen
par: Alexandre Bayen
Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games
par: Lanier, JB, et autres
Publié: (2026)
par: Lanier, JB, et autres
Publié: (2026)
The Mixing method: low-rank coordinate descent for semidefinite programming with diagonal constraints
par: Wang, Po-Wei, et autres
Publié: (2017)
par: Wang, Po-Wei, et autres
Publié: (2017)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Massive Activations in Large Language Models
par: Sun, Mingjie, et autres
Publié: (2024)
par: Sun, Mingjie, et autres
Publié: (2024)
Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression
par: Zhai, Runtian, et autres
Publié: (2023)
par: Zhai, Runtian, et autres
Publié: (2023)
An Axiomatic Approach to Model-Agnostic Concept Explanations
par: Feng, Zhili, et autres
Publié: (2024)
par: Feng, Zhili, et autres
Publié: (2024)
Rethinking Distance Metrics for Counterfactual Explainability
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
A Simple and Effective Pruning Approach for Large Language Models
par: Sun, Mingjie, et autres
Publié: (2023)
par: Sun, Mingjie, et autres
Publié: (2023)
Looking beyond the next token
par: Thankaraj, Abitha, et autres
Publié: (2025)
par: Thankaraj, Abitha, et autres
Publié: (2025)
From Entropy to Epiplexity: Rethinking Information for Computationally Bounded Intelligence
par: Finzi, Marc, et autres
Publié: (2026)
par: Finzi, Marc, et autres
Publié: (2026)
Supervised and Unsupervised Neural Network Solver for First Order Hyperbolic Nonlinear PDEs
par: Baba, Zakaria, et autres
Publié: (2026)
par: Baba, Zakaria, et autres
Publié: (2026)
MAPLE: Multi-State Aggregated Policy Evaluation for AlphaZero in Imperfect-Information Games
par: Li, Qian-Rong, et autres
Publié: (2026)
par: Li, Qian-Rong, et autres
Publié: (2026)
Weight Ensembling Improves Reasoning in Language Models
par: Dang, Xingyu, et autres
Publié: (2025)
par: Dang, Xingyu, et autres
Publié: (2025)
Documents similaires
-
Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search
par: Sokota, Samuel, et autres
Publié: (2025) -
The Update-Equivalence Framework for Decision-Time Planning
par: Sokota, Samuel, et autres
Publié: (2023) -
A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate Convergence
par: Liu, Mingyang, et autres
Publié: (2024) -
Traffic Smoothing Controllers for Autonomous Vehicles Using Deep Reinforcement Learning and Real-World Trajectory Data
par: Lichtlé, Nathan, et autres
Publié: (2024) -
Learning Correlated Reward Models: Statistical Barriers and Opportunities
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2025)