Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Haoran, Tang, Zeshen, Yang, Leya, Sun, Yaoru, Wang, Fang, Zhang, Siyu, Chen, Yeming |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023)
par: Zhang, Siyu, et autres
Publié: (2023)
EchoRL: Reinforcement Learning via Rollout Echoing
par: Bi, Jinhe, et autres
Publié: (2026)
par: Bi, Jinhe, et autres
Publié: (2026)
HG2P: Hippocampus-inspired High-reward Graph and Model-Free Q-Gradient Penalty for Path Planning and Motion Control
par: Wang, Haoran, et autres
Publié: (2024)
par: Wang, Haoran, et autres
Publié: (2024)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
par: Xu, Yixuan Even, et autres
Publié: (2025)
par: Xu, Yixuan Even, et autres
Publié: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)
par: Lu, Xiaodong, et autres
Publié: (2026)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
par: Pang, Jing-Cheng, et autres
Publié: (2024)
par: Pang, Jing-Cheng, et autres
Publié: (2024)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
par: Zheng, Haizhong, et autres
Publié: (2025)
par: Zheng, Haizhong, et autres
Publié: (2025)
ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
par: Zhou, Yuzhen, et autres
Publié: (2025)
par: Zhou, Yuzhen, et autres
Publié: (2025)
CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling
par: Qu, Zekai, et autres
Publié: (2025)
par: Qu, Zekai, et autres
Publié: (2025)
DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
par: Wang, Yujie, et autres
Publié: (2026)
par: Wang, Yujie, et autres
Publié: (2026)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
par: Luo, Sijia, et autres
Publié: (2026)
par: Luo, Sijia, et autres
Publié: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
par: Liu, Bingshuai, et autres
Publié: (2025)
par: Liu, Bingshuai, et autres
Publié: (2025)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
par: Zhang, Zhi, et autres
Publié: (2026)
par: Zhang, Zhi, et autres
Publié: (2026)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
par: Huang, Sili, et autres
Publié: (2024)
par: Huang, Sili, et autres
Publié: (2024)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
par: Xu, Yuhang, et autres
Publié: (2026)
par: Xu, Yuhang, et autres
Publié: (2026)
SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning
par: Wan, Xu, et autres
Publié: (2025)
par: Wan, Xu, et autres
Publié: (2025)
Synthesize, Partition, then Adapt: Eliciting Diverse Samples from Foundation Models
par: Wen, Yeming, et autres
Publié: (2024)
par: Wen, Yeming, et autres
Publié: (2024)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
par: Ding, Zihan, et autres
Publié: (2024)
par: Ding, Zihan, et autres
Publié: (2024)
GOPlan: Goal-conditioned Offline Reinforcement Learning by Planning with Learned Models
par: Wang, Mianchu, et autres
Publié: (2023)
par: Wang, Mianchu, et autres
Publié: (2023)
Superior Computer Chess with Model Predictive Control, Reinforcement Learning, and Rollout
par: Gundawar, Atharva, et autres
Publié: (2024)
par: Gundawar, Atharva, et autres
Publié: (2024)
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
par: Li, Yitong, et autres
Publié: (2026)
par: Li, Yitong, et autres
Publié: (2026)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
par: Heuillet, Maxime, et autres
Publié: (2025)
par: Heuillet, Maxime, et autres
Publié: (2025)
RTMC: Step-Level Credit Assignment via Rollout Trees
par: Wang, Tao, et autres
Publié: (2026)
par: Wang, Tao, et autres
Publié: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
Batched Low-Rank Adaptation of Foundation Models
par: Wen, Yeming, et autres
Publié: (2023)
par: Wen, Yeming, et autres
Publié: (2023)
Hierarchical Meta-Reinforcement Learning via Automated Macro-Action Discovery
par: Cho, Minjae, et autres
Publié: (2024)
par: Cho, Minjae, et autres
Publié: (2024)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
par: Sun, Yifan, et autres
Publié: (2025)
par: Sun, Yifan, et autres
Publié: (2025)
Heterogeneous Multi-Agent Reinforcement Learning with Attention for Cooperative and Scalable Feature Transformation
par: Zhe, Tao, et autres
Publié: (2025)
par: Zhe, Tao, et autres
Publié: (2025)
Hierarchical Reinforcement Learning for Optimal Agent Grouping in Cooperative Systems
par: Hu, Liyuan
Publié: (2025)
par: Hu, Liyuan
Publié: (2025)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
par: Hao, Ce, et autres
Publié: (2023)
par: Hao, Ce, et autres
Publié: (2023)
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
par: Xu, Jiawei, et autres
Publié: (2024)
par: Xu, Jiawei, et autres
Publié: (2024)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
par: Kim, Youngeun
Publié: (2026)
par: Kim, Youngeun
Publié: (2026)
Affordance-Guided Reinforcement Learning via Visual Prompting
par: Lee, Olivia Y., et autres
Publié: (2024)
par: Lee, Olivia Y., et autres
Publié: (2024)
Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE
par: Zeng, Anxiang, et autres
Publié: (2025)
par: Zeng, Anxiang, et autres
Publié: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2024)
par: Gao, Chen-Xiao, et autres
Publié: (2024)
LLM-Guided Communication for Cooperative Multi-Agent Reinforcement Learning
par: Bae, Sangjun, et autres
Publié: (2026)
par: Bae, Sangjun, et autres
Publié: (2026)
Reinforcement Learning via Value Gradient Flow
par: Xu, Haoran, et autres
Publié: (2026)
par: Xu, Haoran, et autres
Publié: (2026)
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models
par: Huang, Shiting, et autres
Publié: (2026)
par: Huang, Shiting, et autres
Publié: (2026)
Innate-Values-driven Reinforcement Learning based Cooperative Multi-Agent Cognitive Modeling
par: Yang, Qin
Publié: (2024)
par: Yang, Qin
Publié: (2024)
Documents similaires
-
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023) -
EchoRL: Reinforcement Learning via Rollout Echoing
par: Bi, Jinhe, et autres
Publié: (2026) -
HG2P: Hippocampus-inspired High-reward Graph and Model-Free Q-Gradient Penalty for Path Planning and Motion Control
par: Wang, Haoran, et autres
Publié: (2024) -
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
par: Xu, Yixuan Even, et autres
Publié: (2025) -
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
par: Lu, Xiaodong, et autres
Publié: (2026)