APC-RL: Exceeding Data-Driven Behavior Priors with Adaptive Policy Composition
Fuente:
arXiv
Salvato in:
| Autori principali: | Rietz, Finn, Martires, Pedro Zuidberg dos, Stork, Johannes Andreas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
di: Rietz, Finn, et al.
Pubblicazione: (2024)
di: Rietz, Finn, et al.
Pubblicazione: (2024)
Probabilistic Neural Circuits
di: Martires, Pedro Zuidberg Dos
Pubblicazione: (2024)
di: Martires, Pedro Zuidberg Dos
Pubblicazione: (2024)
Progress Constraints for Reinforcement Learning in Behavior Trees
di: Rietz, Finn, et al.
Pubblicazione: (2026)
di: Rietz, Finn, et al.
Pubblicazione: (2026)
Prioritized Soft Q-Decomposition for Lexicographic Reinforcement Learning
di: Rietz, Finn, et al.
Pubblicazione: (2023)
di: Rietz, Finn, et al.
Pubblicazione: (2023)
Have Large Language Models Learned to Reason? A Characterization via 3-SAT Phase Transition
di: Hazra, Rishi, et al.
Pubblicazione: (2025)
di: Hazra, Rishi, et al.
Pubblicazione: (2025)
A Quantum Information Theoretic Approach to Tractable Probabilistic Models
di: Martires, Pedro Zuidberg Dos
Pubblicazione: (2025)
di: Martires, Pedro Zuidberg Dos
Pubblicazione: (2025)
Neurosymbolic Decision Trees
di: Möller, Matthias, et al.
Pubblicazione: (2025)
di: Möller, Matthias, et al.
Pubblicazione: (2025)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
di: Wagenmaker, Andrew, et al.
Pubblicazione: (2025)
di: Wagenmaker, Andrew, et al.
Pubblicazione: (2025)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
di: Romeo, Carlo, et al.
Pubblicazione: (2026)
Independence Is Not an Issue in Neurosymbolic AI
di: Faronius, Håkan Karlsson, et al.
Pubblicazione: (2025)
di: Faronius, Håkan Karlsson, et al.
Pubblicazione: (2025)
Offline RL for Adaptive Policy Retrieval in Prior Authorization
di: Sharifullin, Ruslan, et al.
Pubblicazione: (2026)
di: Sharifullin, Ruslan, et al.
Pubblicazione: (2026)
DataSP: A Differential All-to-All Shortest Path Algorithm for Learning Costs and Predicting Paths with Context
di: Lahoud, Alan A., et al.
Pubblicazione: (2024)
di: Lahoud, Alan A., et al.
Pubblicazione: (2024)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
COvolve: Adversarial Co-Evolution of Large-Language-Model-Generated Policies and Environments via Two-Player Zero-Sum Game
di: Sygkounas, Alkis, et al.
Pubblicazione: (2026)
di: Sygkounas, Alkis, et al.
Pubblicazione: (2026)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
di: Luo, Yu, et al.
Pubblicazione: (2024)
di: Luo, Yu, et al.
Pubblicazione: (2024)
KLay: Accelerating Arithmetic Circuits for Neurosymbolic AI
di: Maene, Jaron, et al.
Pubblicazione: (2024)
di: Maene, Jaron, et al.
Pubblicazione: (2024)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
SayCanPay: Heuristic Planning with Large Language Models using Learnable Domain Knowledge
di: Hazra, Rishi, et al.
Pubblicazione: (2023)
di: Hazra, Rishi, et al.
Pubblicazione: (2023)
Declarative Probabilistic Logic Programming in Discrete-Continuous Domains
di: Martires, Pedro Zuidberg Dos, et al.
Pubblicazione: (2023)
di: Martires, Pedro Zuidberg Dos, et al.
Pubblicazione: (2023)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
FASTER: Value-Guided Sampling for Fast RL
di: Dong, Perry, et al.
Pubblicazione: (2026)
di: Dong, Perry, et al.
Pubblicazione: (2026)
Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models
di: Deproost, Senne, et al.
Pubblicazione: (2026)
di: Deproost, Senne, et al.
Pubblicazione: (2026)
A Fast Convoluted Story: Scaling Probabilistic Inference for Integer Arithmetic
di: De Smet, Lennert, et al.
Pubblicazione: (2024)
di: De Smet, Lennert, et al.
Pubblicazione: (2024)
Q-Guided Stein Variational Model Predictive Control via RL-informed Policy Prior
di: Cai, Shizhe, et al.
Pubblicazione: (2025)
di: Cai, Shizhe, et al.
Pubblicazione: (2025)
Safe Exploration via Policy Priors
di: Wendl, Manuel, et al.
Pubblicazione: (2026)
di: Wendl, Manuel, et al.
Pubblicazione: (2026)
General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies
di: Wang, Jianxun, et al.
Pubblicazione: (2026)
di: Wang, Jianxun, et al.
Pubblicazione: (2026)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
di: He, Longxiang, et al.
Pubblicazione: (2025)
di: He, Longxiang, et al.
Pubblicazione: (2025)
Conservative Prediction via Data-Driven Confidence Minimization
di: Choi, Caroline, et al.
Pubblicazione: (2023)
di: Choi, Caroline, et al.
Pubblicazione: (2023)
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
Continual Task Learning through Adaptive Policy Self-Composition
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
ShuttleEnv: An Interactive Data-Driven RL Environment for Badminton Strategy Modeling
di: Li, Ang, et al.
Pubblicazione: (2026)
di: Li, Ang, et al.
Pubblicazione: (2026)
CaRL: Learning Scalable Planning Policies with Simple Rewards
di: Jaeger, Bernhard, et al.
Pubblicazione: (2025)
di: Jaeger, Bernhard, et al.
Pubblicazione: (2025)
Two Constraint Compilation Methods for Lifted Planning
di: Mantenoglou, Periklis, et al.
Pubblicazione: (2025)
di: Mantenoglou, Periklis, et al.
Pubblicazione: (2025)
Semirings for Probabilistic and Neuro-Symbolic Logic Programming
di: Derkinderen, Vincent, et al.
Pubblicazione: (2024)
di: Derkinderen, Vincent, et al.
Pubblicazione: (2024)
Can Large Language Models Reason? A Characterization via 3-SAT
di: Hazra, Rishi, et al.
Pubblicazione: (2024)
di: Hazra, Rishi, et al.
Pubblicazione: (2024)
Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL
di: Rietz, Finn, et al.
Pubblicazione: (2025)
di: Rietz, Finn, et al.
Pubblicazione: (2025)
RL for Reasoning by Adaptively Revealing Rationales
di: Amani, Mohammad Hossein, et al.
Pubblicazione: (2025)
di: Amani, Mohammad Hossein, et al.
Pubblicazione: (2025)
Efficient Data Collection for Robotic Manipulation via Compositional Generalization
di: Gao, Jensen, et al.
Pubblicazione: (2024)
di: Gao, Jensen, et al.
Pubblicazione: (2024)
Scalable Policy-Based RL Algorithms for POMDPs
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
Simulation Priors for Data-Efficient Deep Learning
di: Treven, Lenart, et al.
Pubblicazione: (2025)
di: Treven, Lenart, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Interpretable Reinforcement Learning with Constrained Normalizing Flow Policies
di: Rietz, Finn, et al.
Pubblicazione: (2024) -
Probabilistic Neural Circuits
di: Martires, Pedro Zuidberg Dos
Pubblicazione: (2024) -
Progress Constraints for Reinforcement Learning in Behavior Trees
di: Rietz, Finn, et al.
Pubblicazione: (2026) -
Prioritized Soft Q-Decomposition for Lexicographic Reinforcement Learning
di: Rietz, Finn, et al.
Pubblicazione: (2023) -
Have Large Language Models Learned to Reason? A Characterization via 3-SAT Phase Transition
di: Hazra, Rishi, et al.
Pubblicazione: (2025)