A Forensic Analysis of Synthetic Data in RL: Diagnosing and Solving Algorithmic Failures in Model-Based Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Barkley, Brett, Fridovich-Keil, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning
di: Barkley, Brett, et al.
Pubblicazione: (2024)
di: Barkley, Brett, et al.
Pubblicazione: (2024)
SCOPED: Score-Curvature Out-of-distribution Proximity Evaluator for Diffusion
di: Barkley, Brett, et al.
Pubblicazione: (2025)
di: Barkley, Brett, et al.
Pubblicazione: (2025)
Scaling Pretrained Representations Enables Label-Free Out-of-Distribution Detection Without Fine-Tuning
di: Barkley, Brett, et al.
Pubblicazione: (2026)
di: Barkley, Brett, et al.
Pubblicazione: (2026)
Learning to Walk from Three Minutes of Real-World Data with Semi-structured Dynamics Models
di: Levy, Jacob, et al.
Pubblicazione: (2024)
di: Levy, Jacob, et al.
Pubblicazione: (2024)
Decomposing Control Lyapunov Functions for Efficient Reinforcement Learning
di: Lopez, Antonio, et al.
Pubblicazione: (2024)
di: Lopez, Antonio, et al.
Pubblicazione: (2024)
A Recovery Guarantee for Sparse Neural Networks
di: Fridovich-Keil, Sara, et al.
Pubblicazione: (2025)
di: Fridovich-Keil, Sara, et al.
Pubblicazione: (2025)
Solving Inverse Problems in Protein Space Using Diffusion-Based Priors
di: Levy, Axel, et al.
Pubblicazione: (2024)
di: Levy, Axel, et al.
Pubblicazione: (2024)
A Flow Matching Algorithm for Many-Shot Adaptation to Unseen Distributions
di: Ingebrand, Tyler, et al.
Pubblicazione: (2026)
di: Ingebrand, Tyler, et al.
Pubblicazione: (2026)
Learning responsibility allocations for multi-agent interactions: A differentiable optimization approach with control barrier functions
di: Remy, Isaac, et al.
Pubblicazione: (2024)
di: Remy, Isaac, et al.
Pubblicazione: (2024)
Synthetic Designed Experiments for Diagnosing Vision Model Failure
di: Sarkar, Krisanu
Pubblicazione: (2026)
di: Sarkar, Krisanu
Pubblicazione: (2026)
Symbolic Regression on Sparse and Noisy Data with Gaussian Processes
di: Hsin, Junette, et al.
Pubblicazione: (2023)
di: Hsin, Junette, et al.
Pubblicazione: (2023)
Data-Driven Modeling and Correction of Vehicle Dynamics
di: Ly, Nguyen, et al.
Pubblicazione: (2025)
di: Ly, Nguyen, et al.
Pubblicazione: (2025)
KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems
di: Kheirandish, Alireza, et al.
Pubblicazione: (2026)
di: Kheirandish, Alireza, et al.
Pubblicazione: (2026)
Scalable Policy-Based RL Algorithms for POMDPs
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
A Multi-Fidelity Control Variate Approach for Policy Gradient Estimation
di: Liu, Xinjie, et al.
Pubblicazione: (2025)
di: Liu, Xinjie, et al.
Pubblicazione: (2025)
Neural Operators for Multi-Task Control and Adaptation
di: Sewell, David, et al.
Pubblicazione: (2026)
di: Sewell, David, et al.
Pubblicazione: (2026)
Monotonic Transformation Invariant Multi-task Learning
di: Murthy, Surya, et al.
Pubblicazione: (2025)
di: Murthy, Surya, et al.
Pubblicazione: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
di: Cohen, Taco, et al.
Pubblicazione: (2025)
di: Cohen, Taco, et al.
Pubblicazione: (2025)
ACTER: Diverse and Actionable Counterfactual Sequences for Explaining and Diagnosing RL Policies
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
di: Gajcin, Jasmina, et al.
Pubblicazione: (2024)
A Framework for Finding Local Saddle Points in Two-Player Zero-Sum Black-Box Games
di: Agarwal, Shubhankar, et al.
Pubblicazione: (2025)
di: Agarwal, Shubhankar, et al.
Pubblicazione: (2025)
Generalized Information Gathering Under Dynamics Uncertainty
di: Palafox, Fernando, et al.
Pubblicazione: (2026)
di: Palafox, Fernando, et al.
Pubblicazione: (2026)
Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis
di: Tan, Zhiyin, et al.
Pubblicazione: (2026)
di: Tan, Zhiyin, et al.
Pubblicazione: (2026)
Controllability in preference-conditioned multi-objective reinforcement learning
di: Molins, Pau de las Heras, et al.
Pubblicazione: (2026)
di: Molins, Pau de las Heras, et al.
Pubblicazione: (2026)
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis
di: Huang, Ruiquan, et al.
Pubblicazione: (2025)
di: Huang, Ruiquan, et al.
Pubblicazione: (2025)
Bayesian Inverse Games with High-Dimensional Multi-Modal Observations
di: Jain, Yash, et al.
Pubblicazione: (2026)
di: Jain, Yash, et al.
Pubblicazione: (2026)
Inference Time Policy Optimization for Offline RL with Differentiable World Models
di: Deb, Rohan, et al.
Pubblicazione: (2026)
di: Deb, Rohan, et al.
Pubblicazione: (2026)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
di: Sancaktar, Cansu, et al.
Pubblicazione: (2026)
di: Sancaktar, Cansu, et al.
Pubblicazione: (2026)
Meta-Learning Online Dynamics Model Adaptation in Off-Road Autonomous Driving
di: Levy, Jacob, et al.
Pubblicazione: (2025)
di: Levy, Jacob, et al.
Pubblicazione: (2025)
Accurate, provable and fast polychromatic tomographic reconstruction: A variational inequality approach
di: Lou, Mengqi, et al.
Pubblicazione: (2025)
di: Lou, Mengqi, et al.
Pubblicazione: (2025)
Synthetic Survival Data Generation for Heart Failure Prognosis Using Deep Generative Models
di: Puttanawarut, Chanon, et al.
Pubblicazione: (2025)
di: Puttanawarut, Chanon, et al.
Pubblicazione: (2025)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
BOFormer: Learning to Solve Multi-Objective Bayesian Optimization via Non-Markovian RL
di: Hung, Yu-Heng, et al.
Pubblicazione: (2025)
di: Hung, Yu-Heng, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
Dense Dynamics-Aware Reward Synthesis: Integrating Prior Experience with Demonstrations
di: Koprulu, Cevahir, et al.
Pubblicazione: (2024)
di: Koprulu, Cevahir, et al.
Pubblicazione: (2024)
Deceptive Exploration in Multi-armed Bandits
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
di: Vurankaya, I. Arda, et al.
Pubblicazione: (2025)
Active Inverse Learning in Stackelberg Trajectory Games
di: Ward, William, et al.
Pubblicazione: (2023)
di: Ward, William, et al.
Pubblicazione: (2023)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Diagnosing Generalization Failures from Representational Geometry Markers
di: Chou, Chi-Ning, et al.
Pubblicazione: (2026)
di: Chou, Chi-Ning, et al.
Pubblicazione: (2026)
Geometric Re-Analysis of Classical MDP Solving Algorithms
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning
di: Barkley, Brett, et al.
Pubblicazione: (2024) -
SCOPED: Score-Curvature Out-of-distribution Proximity Evaluator for Diffusion
di: Barkley, Brett, et al.
Pubblicazione: (2025) -
Scaling Pretrained Representations Enables Label-Free Out-of-Distribution Detection Without Fine-Tuning
di: Barkley, Brett, et al.
Pubblicazione: (2026) -
Learning to Walk from Three Minutes of Real-World Data with Semi-structured Dynamics Models
di: Levy, Jacob, et al.
Pubblicazione: (2024) -
Decomposing Control Lyapunov Functions for Efficient Reinforcement Learning
di: Lopez, Antonio, et al.
Pubblicazione: (2024)