Model-Based Reinforcement Learning for Atari
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kaiser, Lukasz, Babaeizadeh, Mohammad, Milos, Piotr, Osinski, Blazej, Campbell, Roy H, Czechowski, Konrad, Erhan, Dumitru, Finn, Chelsea, Kozakowski, Piotr, Levine, Sergey, Mohiuddin, Afroz, Sepassi, Ryan, Tucker, George, Michalewski, Henryk |
|---|---|
| Format: | Preprint |
| Publié: |
2019
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Off-Policy Correction For Multi-Agent Reinforcement Learning
par: Zawalski, Michał, et autres
Publié: (2021)
par: Zawalski, Michał, et autres
Publié: (2021)
Simulation-based reinforcement learning for real-world autonomous driving
par: Osiński, Błażej, et autres
Publié: (2019)
par: Osiński, Błażej, et autres
Publié: (2019)
Structured Packing in LLM Training Improves Long Context Utilization
par: Staniszewski, Konrad, et autres
Publié: (2023)
par: Staniszewski, Konrad, et autres
Publié: (2023)
tsGT: Stochastic Time Series Modeling With Transformer
par: Kuciński, Łukasz, et autres
Publié: (2024)
par: Kuciński, Łukasz, et autres
Publié: (2024)
Fast and Precise: Adjusting Planning Horizon with Adaptive Subgoal Search
par: Zawalski, Michał, et autres
Publié: (2022)
par: Zawalski, Michał, et autres
Publié: (2022)
Subgoal Search For Complex Reasoning Tasks
par: Czechowski, Konrad, et autres
Publié: (2021)
par: Czechowski, Konrad, et autres
Publié: (2021)
Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Models
par: Mouselinos, Spyridon, et autres
Publié: (2024)
par: Mouselinos, Spyridon, et autres
Publié: (2024)
Connections between certain numbers related to derangements and $r$-permutations
par: Miska, Piotr, et autres
Publié: (2024)
par: Miska, Piotr, et autres
Publié: (2024)
What factors affect the ‘flocking’ of birdwatchers during bird rarity observations?
par: Piotr Tryjanowski, et autres
Publié: (2024)
par: Piotr Tryjanowski, et autres
Publié: (2024)
Catalytic Role Of Noise And Necessity Of Inductive Biases In The Emergence Of Compositional Communication
par: Kuciński, Łukasz, et autres
Publié: (2021)
par: Kuciński, Łukasz, et autres
Publié: (2021)
Polygenic Discordance in Sibling Pairs: The Paradoxical Cost of Being the "Healthy" Child in a High-ADHD-Risk Family (Study Protocol)
par: Lewandowski, Łukasz Piotr
Publié: (2026)
par: Lewandowski, Łukasz Piotr
Publié: (2026)
Lightweight Latent Verifiers for Efficient Meta-Generation Strategies
par: Piotrowski, Bartosz, et autres
Publié: (2025)
par: Piotrowski, Bartosz, et autres
Publié: (2025)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
par: Wagenmaker, Andrew, et autres
Publié: (2025)
par: Wagenmaker, Andrew, et autres
Publié: (2025)
The Bonebridge Active Bone Conduction Hearing Implant: Safety, Effectiveness and Outcomes Based on 355 Patients
par: Piotr Henryk Skarzynski, et autres
Publié: (2025)
par: Piotr Henryk Skarzynski, et autres
Publié: (2025)
Renormalization in Lorenz maps -- completely invariant sets and periodic orbits
par: Cholewa, Łukasz, et autres
Publié: (2021)
par: Cholewa, Łukasz, et autres
Publié: (2021)
Objectivity of classical quantum stochastic processes
par: Szańkowski, Piotr, et autres
Publié: (2023)
par: Szańkowski, Piotr, et autres
Publié: (2023)
The influx of refugees from Ukraine and changes in Polish educational policy: A case study of the National External Examinations System
par: Piotr Załęski, et autres
Publié: (2025)
par: Piotr Załęski, et autres
Publié: (2025)
Tinnitus: The Phantom Sound (Part V) Psychological Aspects – volume 1
par: Holdefer, Lisiane, et autres
Publié: (2025)
par: Holdefer, Lisiane, et autres
Publié: (2025)
RoboReward: General-Purpose Vision-Language Reward Models for Robotics
par: Lee, Tony, et autres
Publié: (2026)
par: Lee, Tony, et autres
Publié: (2026)
Robotic Control via Embodied Chain-of-Thought Reasoning
par: Zawalski, Michał, et autres
Publié: (2024)
par: Zawalski, Michał, et autres
Publié: (2024)
Grounding Data Science Code Generation with Input-Output Specifications
par: Wen, Yeming, et autres
Publié: (2024)
par: Wen, Yeming, et autres
Publié: (2024)
Stability of solutions of the porous medium equation with growth with respect to the diffusion exponent
par: Dębiec, Tomasz, et autres
Publié: (2024)
par: Dębiec, Tomasz, et autres
Publié: (2024)
Seguimento ambulatorial de um grupo de prematuros e a prevalência do aleitamento na alta hospitalar e ao sexto mês de vida: contribuições da Fonoaudiologia
par: Aliana Eduarda Czechowski
Publié: (2010)
par: Aliana Eduarda Czechowski
Publié: (2010)
HackAtari: Atari Learning Environments for Robust and Continual Reinforcement Learning
par: Delfosse, Quentin, et autres
Publié: (2024)
par: Delfosse, Quentin, et autres
Publié: (2024)
Trustworthy Retrosynthesis: Eliminating Hallucinations with a Diverse Ensemble of Reaction Scorers
par: Sadowski, Michal, et autres
Publié: (2025)
par: Sadowski, Michal, et autres
Publié: (2025)
A framework for distributed discrete evacuation strategies
par: Borowiecki, Piotr, et autres
Publié: (2025)
par: Borowiecki, Piotr, et autres
Publié: (2025)
Data integration of non-probability and probability samples with predictive mean matching
par: Chlebicki, Piotr, et autres
Publié: (2024)
par: Chlebicki, Piotr, et autres
Publié: (2024)
nonprobsvy -- An R package for modern methods for non-probability surveys
par: Chrostowski, Łukasz, et autres
Publié: (2025)
par: Chrostowski, Łukasz, et autres
Publié: (2025)
Adapt On-the-Go: Behavior Modulation for Single-Life Robot Deployment
par: Chen, Annie S., et autres
Publié: (2023)
par: Chen, Annie S., et autres
Publié: (2023)
Benchmarking of Different YOLO Models for CAPTCHAs Detection and Classification
par: Wysocki, Mikołaj, et autres
Publié: (2025)
par: Wysocki, Mikołaj, et autres
Publié: (2025)
Subject Access Points in the MARC Record and Archival Finding Aid: Enough or Too Many?
par: Cox, Elizabeth, et autres
Publié: (2007)
par: Cox, Elizabeth, et autres
Publié: (2007)
The Influence of MoS2 Thickness on the Efficiency of Solar Energy Conversion in TiO2/MoS2/P3HT Cells
par: Kamila Kollbek, et autres
Publié: (2024)
par: Kamila Kollbek, et autres
Publié: (2024)
Since Faithfulness Fails: The Performance Limits of Neural Causal Discovery
par: Olko, Mateusz, et autres
Publié: (2025)
par: Olko, Mateusz, et autres
Publié: (2025)
Colorization of Optically Transparent Surfactants to Track Their Movement in Biphasic Systems Used for Differentiation of Nanomaterials
par: Podlesny, Blazej, et autres
Publié: (2025)
par: Podlesny, Blazej, et autres
Publié: (2025)
Atari-GPT: Benchmarking Multimodal Large Language Models as Low-Level Policies in Atari Games
par: Waytowich, Nicholas R., et autres
Publié: (2024)
par: Waytowich, Nicholas R., et autres
Publié: (2024)
Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models
par: Chen, Annie S., et autres
Publié: (2024)
par: Chen, Annie S., et autres
Publié: (2024)
Strategic Cost Selection in Participatory Budgeting
par: Faliszewski, Piotr, et autres
Publié: (2024)
par: Faliszewski, Piotr, et autres
Publié: (2024)
Micro‐ and nanoplastics in the human genitourinary system: oncological impact – a systematic review
par: Nicole Akpang, et autres
Publié: (2026)
par: Nicole Akpang, et autres
Publié: (2026)
Diastatotropis petulae Tryzna, Blazej & Rakotonirina 2024, sp. nov.
par: Trýzna, Miloš, et autres
Publié: (2024)
par: Trýzna, Miloš, et autres
Publié: (2024)
Operator splitting algorithm for structured population models on metric spaces
par: Lindow, Carolin, et autres
Publié: (2025)
par: Lindow, Carolin, et autres
Publié: (2025)
Documents similaires
-
Off-Policy Correction For Multi-Agent Reinforcement Learning
par: Zawalski, Michał, et autres
Publié: (2021) -
Simulation-based reinforcement learning for real-world autonomous driving
par: Osiński, Błażej, et autres
Publié: (2019) -
Structured Packing in LLM Training Improves Long Context Utilization
par: Staniszewski, Konrad, et autres
Publié: (2023) -
tsGT: Stochastic Time Series Modeling With Transformer
par: Kuciński, Łukasz, et autres
Publié: (2024) -
Fast and Precise: Adjusting Planning Horizon with Adaptive Subgoal Search
par: Zawalski, Michał, et autres
Publié: (2022)