Reward-Free Curricula for Training Robust World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rigter, Marc, Jiang, Minqi, Posner, Ingmar |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
World Models via Policy-Guided Trajectory Diffusion
par: Rigter, Marc, et autres
Publié: (2023)
par: Rigter, Marc, et autres
Publié: (2023)
SPARTAN: A Sparse Transformer World Model Attending to What Matters
par: Lei, Anson, et autres
Publié: (2024)
par: Lei, Anson, et autres
Publié: (2024)
AVID: Adapting Video Diffusion Models to World Models
par: Rigter, Marc, et autres
Publié: (2024)
par: Rigter, Marc, et autres
Publié: (2024)
Compete and Compose: Learning Independent Mechanisms for Modular World Models
par: Lei, Anson, et autres
Publié: (2024)
par: Lei, Anson, et autres
Publié: (2024)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
par: Scherer, Christian, et autres
Publié: (2026)
par: Scherer, Christian, et autres
Publié: (2026)
DITTO: Offline Imitation Learning with World Models
par: DeMoss, Branton, et autres
Publié: (2023)
par: DeMoss, Branton, et autres
Publié: (2023)
Gaitor: Learning a Unified Representation Across Gaits for Real-World Quadruped Locomotion
par: Mitchell, Alexander L., et autres
Publié: (2024)
par: Mitchell, Alexander L., et autres
Publié: (2024)
Intrinsically Interpretable Attention via Sparse Post-Training
par: Draye, Florent, et autres
Publié: (2025)
par: Draye, Florent, et autres
Publié: (2025)
Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
par: Kawaharazuka, Kento, et autres
Publié: (2025)
par: Kawaharazuka, Kento, et autres
Publié: (2025)
Posterior Sampling Reinforcement Learning with Gaussian Processes for Continuous Control: Sublinear Regret Bounds for Unbounded State Spaces
par: Flynn, Hamish, et autres
Publié: (2026)
par: Flynn, Hamish, et autres
Publié: (2026)
D-Cubed: Latent Diffusion Trajectory Optimisation for Dexterous Deformable Manipulation
par: Yamada, Jun, et autres
Publié: (2024)
par: Yamada, Jun, et autres
Publié: (2024)
LUMOS: Language-Conditioned Imitation Learning with World Models
par: Nematollahi, Iman, et autres
Publié: (2025)
par: Nematollahi, Iman, et autres
Publié: (2025)
Disentangling Dynamical Systems: Causal Representation Learning Meets Local Sparse Attention
par: Baumgartner, Markus W., et autres
Publié: (2026)
par: Baumgartner, Markus W., et autres
Publié: (2026)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
par: Diaz-Bone, Leander, et autres
Publié: (2025)
par: Diaz-Bone, Leander, et autres
Publié: (2025)
Birdie: Advancing State Space Models with Reward-Driven Objectives and Curricula
par: Blouir, Sam, et autres
Publié: (2024)
par: Blouir, Sam, et autres
Publié: (2024)
COMBO-Grasp: Learning Constraint-Based Manipulation for Bimanual Occluded Grasping
par: Yamada, Jun, et autres
Publié: (2025)
par: Yamada, Jun, et autres
Publié: (2025)
Learning to Act without Actions
par: Schmidt, Dominik, et autres
Publié: (2023)
par: Schmidt, Dominik, et autres
Publié: (2023)
The Complexity Dynamics of Grokking
par: DeMoss, Branton, et autres
Publié: (2024)
par: DeMoss, Branton, et autres
Publié: (2024)
Bootstrapping Task Spaces for Self-Improvement
par: Jiang, Minqi, et autres
Publié: (2025)
par: Jiang, Minqi, et autres
Publié: (2025)
XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning
par: Palenicek, Daniel, et autres
Publié: (2025)
par: Palenicek, Daniel, et autres
Publié: (2025)
Offline Adaptation of Quadruped Locomotion using Diffusion Models
par: O'Mahoney, Reece, et autres
Publié: (2024)
par: O'Mahoney, Reece, et autres
Publié: (2024)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
par: Palenicek, Daniel, et autres
Publié: (2026)
par: Palenicek, Daniel, et autres
Publié: (2026)
Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control
par: Yamada, Jun, et autres
Publié: (2025)
par: Yamada, Jun, et autres
Publié: (2025)
Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training
par: Lin, Jinhong, et autres
Publié: (2026)
par: Lin, Jinhong, et autres
Publié: (2026)
Adversarial Training of Reward Models
par: Bukharin, Alexander, et autres
Publié: (2025)
par: Bukharin, Alexander, et autres
Publié: (2025)
Semi-Supervised Reward Modeling via Iterative Self-Training
par: He, Yifei, et autres
Publié: (2024)
par: He, Yifei, et autres
Publié: (2024)
Curricula for Learning Robust Policies with Factored State Representations in Changing Environments
par: Panayiotou, Panayiotis, et autres
Publié: (2024)
par: Panayiotou, Panayiotis, et autres
Publié: (2024)
Multi-Agent Diagnostics for Robustness via Illuminated Diversity
par: Samvelyan, Mikayel, et autres
Publié: (2024)
par: Samvelyan, Mikayel, et autres
Publié: (2024)
Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models
par: Tiwari, Rishabh, et autres
Publié: (2026)
par: Tiwari, Rishabh, et autres
Publié: (2026)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
par: Li, Mengqi, et autres
Publié: (2025)
par: Li, Mengqi, et autres
Publié: (2025)
Assessing Superposition-Targeted Coverage Criteria for Quantum Neural Networks
par: Shao, Minqi, et autres
Publié: (2024)
par: Shao, Minqi, et autres
Publié: (2024)
Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring
par: Paul, Indraneil, et autres
Publié: (2026)
par: Paul, Indraneil, et autres
Publié: (2026)
Sim-to-Real Transfer for Muscle-Actuated Robots via Generalized Actuator Networks
par: Schneider, Jan, et autres
Publié: (2026)
par: Schneider, Jan, et autres
Publié: (2026)
Robust Reward Modeling via Causal Rubrics
par: Srivastava, Pragya, et autres
Publié: (2025)
par: Srivastava, Pragya, et autres
Publié: (2025)
Improved Bounds for Reward-Agnostic and Reward-Free Exploration
par: Ridel, Oran, et autres
Publié: (2026)
par: Ridel, Oran, et autres
Publié: (2026)
Reward-free World Models for Online Imitation Learning
par: Li, Shangzhe, et autres
Publié: (2024)
par: Li, Shangzhe, et autres
Publié: (2024)
Thermodynamics of Reinforcement Learning Curricula
par: Adamczyk, Jacob, et autres
Publié: (2026)
par: Adamczyk, Jacob, et autres
Publié: (2026)
Concurrent Training and Layer Pruning of Deep Neural Networks
par: Guenter, Valentin Frank Ingmar, et autres
Publié: (2024)
par: Guenter, Valentin Frank Ingmar, et autres
Publié: (2024)
Simple, Good, Fast: Self-Supervised World Models Free of Baggage
par: Robine, Jan, et autres
Publié: (2025)
par: Robine, Jan, et autres
Publié: (2025)
Adversarial Training for Process Reward Models
par: Juneja, Gurusha, et autres
Publié: (2025)
par: Juneja, Gurusha, et autres
Publié: (2025)
Documents similaires
-
World Models via Policy-Guided Trajectory Diffusion
par: Rigter, Marc, et autres
Publié: (2023) -
SPARTAN: A Sparse Transformer World Model Attending to What Matters
par: Lei, Anson, et autres
Publié: (2024) -
AVID: Adapting Video Diffusion Models to World Models
par: Rigter, Marc, et autres
Publié: (2024) -
Compete and Compose: Learning Independent Mechanisms for Modular World Models
par: Lei, Anson, et autres
Publié: (2024) -
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
par: Scherer, Christian, et autres
Publié: (2026)