RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
Fuente:
arXiv
Salvato in:
| Autori principali: | Bhatia, Abhinav, Nashed, Samer B., Zilberstein, Shlomo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
di: Liu, Shaoteng, et al.
Pubblicazione: (2024)
Meta-World+: An Improved, Standardized, RL Benchmark
di: McLean, Reginald, et al.
Pubblicazione: (2025)
di: McLean, Reginald, et al.
Pubblicazione: (2025)
Meta-RL Induces Exploration in Language Agents
di: Jiang, Yulun, et al.
Pubblicazione: (2025)
di: Jiang, Yulun, et al.
Pubblicazione: (2025)
RL2Grid: Benchmarking Reinforcement Learning in Power Grid Operations
di: Marchesini, Enrico, et al.
Pubblicazione: (2025)
di: Marchesini, Enrico, et al.
Pubblicazione: (2025)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
AstRL: Analog and Mixed-Signal Circuit Synthesis with Deep Reinforcement Learning
di: Guo, Felicia B., et al.
Pubblicazione: (2026)
di: Guo, Felicia B., et al.
Pubblicazione: (2026)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
di: Su, Jianhai, et al.
Pubblicazione: (2025)
di: Su, Jianhai, et al.
Pubblicazione: (2025)
Momentum Boosted Episodic Memory for Improving Learning in Long-Tailed RL Environments
di: Fernandes, Dolton, et al.
Pubblicazione: (2025)
di: Fernandes, Dolton, et al.
Pubblicazione: (2025)
Transitive RL: Value Learning via Divide and Conquer
di: Park, Seohong, et al.
Pubblicazione: (2025)
di: Park, Seohong, et al.
Pubblicazione: (2025)
PathletRL++: Optimizing Trajectory Pathlet Extraction and Dictionary Formation via Reinforcement Learning
di: Alix, Gian, et al.
Pubblicazione: (2024)
di: Alix, Gian, et al.
Pubblicazione: (2024)
VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
di: Cai, Xin-Qiang, et al.
Pubblicazione: (2026)
RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
di: Samineni, Soumya Rani, et al.
Pubblicazione: (2025)
Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
di: Chen, Zihan, et al.
Pubblicazione: (2025)
di: Chen, Zihan, et al.
Pubblicazione: (2025)
RL4CO: an Extensive Reinforcement Learning for Combinatorial Optimization Benchmark
di: Berto, Federico, et al.
Pubblicazione: (2023)
di: Berto, Federico, et al.
Pubblicazione: (2023)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
di: Xu, Yifan, et al.
Pubblicazione: (2025)
di: Xu, Yifan, et al.
Pubblicazione: (2025)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
di: Zhang, Xikai, et al.
Pubblicazione: (2026)
di: Zhang, Xikai, et al.
Pubblicazione: (2026)
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
di: Wang, Jichao, et al.
Pubblicazione: (2026)
di: Wang, Jichao, et al.
Pubblicazione: (2026)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
di: Sikchi, Harshit, et al.
Pubblicazione: (2023)
Reinforcement Learning (RL) Meets Urban Climate Modeling: Investigating the Efficacy and Impacts of RL-Based HVAC Control
di: Yu, Junjie, et al.
Pubblicazione: (2025)
di: Yu, Junjie, et al.
Pubblicazione: (2025)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
di: Karine, Karine, et al.
Pubblicazione: (2025)
di: Karine, Karine, et al.
Pubblicazione: (2025)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
di: Muslimani, Calarina, et al.
Pubblicazione: (2025)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
Knowledge Transfer in Deep Reinforcement Learning via an RL-Specific GAN-Based Correspondence Function
di: Ruman, Marko, et al.
Pubblicazione: (2022)
di: Ruman, Marko, et al.
Pubblicazione: (2022)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
di: Hou, Hongru, et al.
Pubblicazione: (2026)
di: Hou, Hongru, et al.
Pubblicazione: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
di: Li, Haozhan, et al.
Pubblicazione: (2025)
di: Li, Haozhan, et al.
Pubblicazione: (2025)
Assuring the Safety of Reinforcement Learning Components: AMLAS-RL
di: Imrie, Calum Corrie, et al.
Pubblicazione: (2025)
di: Imrie, Calum Corrie, et al.
Pubblicazione: (2025)
MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning
di: Zhu, Sicheng, et al.
Pubblicazione: (2026)
di: Zhu, Sicheng, et al.
Pubblicazione: (2026)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
di: Yao, Zhiyuan, et al.
Pubblicazione: (2026)
di: Yao, Zhiyuan, et al.
Pubblicazione: (2026)
SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies
di: Samadi, Amir, et al.
Pubblicazione: (2024)
di: Samadi, Amir, et al.
Pubblicazione: (2024)
RL-ACRGNet: Reinforcement Learning-Based Chest Radiology Report Generation Network
di: Meena, Yogesh Kumar, et al.
Pubblicazione: (2026)
di: Meena, Yogesh Kumar, et al.
Pubblicazione: (2026)
CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
di: Zhang, Rui, et al.
Pubblicazione: (2026)
di: Zhang, Rui, et al.
Pubblicazione: (2026)
SOAP-RL: Sequential Option Advantage Propagation for Reinforcement Learning in POMDP Environments
di: Ishida, Shu, et al.
Pubblicazione: (2024)
di: Ishida, Shu, et al.
Pubblicazione: (2024)
LPPG-RL: Lexicographically Projected Policy Gradient Reinforcement Learning with Subproblem Exploration
di: Qiu, Ruiyu, et al.
Pubblicazione: (2025)
di: Qiu, Ruiyu, et al.
Pubblicazione: (2025)
NurseSchedRL: Attention-Guided Reinforcement Learning for Nurse-Patient Assignment
di: Koduri, Harsha
Pubblicazione: (2025)
di: Koduri, Harsha
Pubblicazione: (2025)
Counteractive RL: Rethinking Core Principles for Efficient and Scalable Deep Reinforcement Learning
di: Korkmaz, Ezgi
Pubblicazione: (2026)
di: Korkmaz, Ezgi
Pubblicazione: (2026)
Documenti analoghi
-
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026) -
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024) -
RL-GPT: Integrating Reinforcement Learning and Code-as-policy
di: Liu, Shaoteng, et al.
Pubblicazione: (2024) -
Meta-World+: An Improved, Standardized, RL Benchmark
di: McLean, Reginald, et al.
Pubblicazione: (2025) -
Meta-RL Induces Exploration in Language Agents
di: Jiang, Yulun, et al.
Pubblicazione: (2025)