RL-GPT: Integrating Reinforcement Learning and Code-as-policy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Shaoteng, Yuan, Haoqi, Hu, Minda, Li, Yanwei, Chen, Yukang, Liu, Shu, Lu, Zongqing, Jia, Jiaya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Creative Agents: Empowering Agents with Imagination for Creative Tasks
par: Cai, Penglin, et autres
Publié: (2023)
par: Cai, Penglin, et autres
Publié: (2023)
Mildly Conservative Q-Learning for Offline Reinforcement Learning
par: Lyu, Jiafei, et autres
Publié: (2022)
par: Lyu, Jiafei, et autres
Publié: (2022)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
par: Chen, Yukang, et autres
Publié: (2023)
par: Chen, Yukang, et autres
Publié: (2023)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
par: Lai, Xin, et autres
Publié: (2024)
par: Lai, Xin, et autres
Publié: (2024)
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
par: Lyu, Jiafei, et autres
Publié: (2024)
par: Lyu, Jiafei, et autres
Publié: (2024)
Fully Decentralized Cooperative Multi-Agent Reinforcement Learning: A Survey
par: Jiang, Jiechuan, et autres
Publié: (2024)
par: Jiang, Jiechuan, et autres
Publié: (2024)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
par: Wu, Xiefeng, et autres
Publié: (2025)
par: Wu, Xiefeng, et autres
Publié: (2025)
TCR-GPT: Integrating Autoregressive Model and Reinforcement Learning for T-Cell Receptor Repertoires Generation
par: Lin, Yicheng, et autres
Publié: (2024)
par: Lin, Yicheng, et autres
Publié: (2024)
Cross-Embodiment Dexterous Grasping with Reinforcement Learning
par: Yuan, Haoqi, et autres
Publié: (2024)
par: Yuan, Haoqi, et autres
Publié: (2024)
SOAP-RL: Sequential Option Advantage Propagation for Reinforcement Learning in POMDP Environments
par: Ishida, Shu, et autres
Publié: (2024)
par: Ishida, Shu, et autres
Publié: (2024)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
par: Zhang, Xikai, et autres
Publié: (2026)
par: Zhang, Xikai, et autres
Publié: (2026)
RL-MSA: a Reinforcement Learning-based Multi-line bus Scheduling Approach
par: Liu, Yingzhuo
Publié: (2024)
par: Liu, Yingzhuo
Publié: (2024)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Integrating Unstructured Text into Causal Inference: Empirical Evidence from Real Data
par: Zhou, Boning, et autres
Publié: (2026)
par: Zhou, Boning, et autres
Publié: (2026)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
par: Xu, Yifan, et autres
Publié: (2025)
par: Xu, Yifan, et autres
Publié: (2025)
SEABO: A Simple Search-Based Method for Offline Imitation Learning
par: Lyu, Jiafei, et autres
Publié: (2024)
par: Lyu, Jiafei, et autres
Publié: (2024)
MetaVIM: Meta Variationally Intrinsic Motivated Reinforcement Learning for Decentralized Traffic Signal Control
par: Zhu, Liwen, et autres
Publié: (2021)
par: Zhu, Liwen, et autres
Publié: (2021)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
par: Bhatia, Abhinav, et autres
Publié: (2023)
par: Bhatia, Abhinav, et autres
Publié: (2023)
ODRL: A Benchmark for Off-Dynamics Reinforcement Learning
par: Lyu, Jiafei, et autres
Publié: (2024)
par: Lyu, Jiafei, et autres
Publié: (2024)
CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts
par: Zhang, Rui, et autres
Publié: (2026)
par: Zhang, Rui, et autres
Publié: (2026)
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
par: Hu, Ruike, et autres
Publié: (2025)
par: Hu, Ruike, et autres
Publié: (2025)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
par: Yao, Zhiyuan, et autres
Publié: (2026)
par: Yao, Zhiyuan, et autres
Publié: (2026)
When Continue Learning Meets Multimodal Large Language Model: A Survey
par: Huo, Yukang, et autres
Publié: (2025)
par: Huo, Yukang, et autres
Publié: (2025)
TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
par: Tan, Zhewen, et autres
Publié: (2026)
par: Tan, Zhewen, et autres
Publié: (2026)
RL4CO: an Extensive Reinforcement Learning for Combinatorial Optimization Benchmark
par: Berto, Federico, et autres
Publié: (2023)
par: Berto, Federico, et autres
Publié: (2023)
Guided Policy Optimization under Partial Observability
par: Li, Yueheng, et autres
Publié: (2025)
par: Li, Yueheng, et autres
Publié: (2025)
COSMO-RL: Towards Trustworthy LMRMs via Joint Safety and Stability
par: Ding, Yizhuo, et autres
Publié: (2025)
par: Ding, Yizhuo, et autres
Publié: (2025)
TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
par: Yang, Saisai, et autres
Publié: (2025)
par: Yang, Saisai, et autres
Publié: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
par: Liu, Bingshuai, et autres
Publié: (2025)
par: Liu, Bingshuai, et autres
Publié: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
par: Bi, Jinhe, et autres
Publié: (2026)
par: Bi, Jinhe, et autres
Publié: (2026)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
par: Yang, Senqiao, et autres
Publié: (2024)
par: Yang, Senqiao, et autres
Publié: (2024)
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
par: Chang, Fu-Chieh, et autres
Publié: (2024)
par: Chang, Fu-Chieh, et autres
Publié: (2024)
Introducing PetriRL: An Innovative Framework for JSSP Resolution Integrating Petri nets and Event-based Reinforcement Learning
par: Lassoued, Sofiene, et autres
Publié: (2024)
par: Lassoued, Sofiene, et autres
Publié: (2024)
Integrating Domain Knowledge for handling Limited Data in Offline RL
par: Gangopadhyay, Briti, et autres
Publié: (2024)
par: Gangopadhyay, Briti, et autres
Publié: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
par: Wu, Bo, et autres
Publié: (2025)
par: Wu, Bo, et autres
Publié: (2025)
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
par: Wang, Jichao, et autres
Publié: (2026)
par: Wang, Jichao, et autres
Publié: (2026)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
par: Karine, Karine, et autres
Publié: (2025)
par: Karine, Karine, et autres
Publié: (2025)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
q-Learning in Continuous Time
par: Jia, Yanwei, et autres
Publié: (2022)
par: Jia, Yanwei, et autres
Publié: (2022)
Documents similaires
-
Creative Agents: Empowering Agents with Imagination for Creative Tasks
par: Cai, Penglin, et autres
Publié: (2023) -
Mildly Conservative Q-Learning for Offline Reinforcement Learning
par: Lyu, Jiafei, et autres
Publié: (2022) -
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
par: Chen, Yukang, et autres
Publié: (2023) -
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
par: Lai, Xin, et autres
Publié: (2024) -
Understanding What Affects the Generalization Gap in Visual Reinforcement Learning: Theory and Empirical Evidence
par: Lyu, Jiafei, et autres
Publié: (2024)