In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Sili, Hu, Jifeng, Chen, Hechang, Sun, Lichao, Yang, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
par: Hu, Jifeng, et autres
Publié: (2024)
par: Hu, Jifeng, et autres
Publié: (2024)
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
par: Guo, Siyuan, et autres
Publié: (2023)
par: Guo, Siyuan, et autres
Publié: (2023)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Decision Flow Policy Optimization
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
par: Huang, Sili, et autres
Publié: (2024)
par: Huang, Sili, et autres
Publié: (2024)
AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
par: Lou, Chenwei, et autres
Publié: (2025)
par: Lou, Chenwei, et autres
Publié: (2025)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
par: Chen, Rufeng, et autres
Publié: (2026)
par: Chen, Rufeng, et autres
Publié: (2026)
Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought
par: Huang, Jianhao, et autres
Publié: (2025)
par: Huang, Jianhao, et autres
Publié: (2025)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Solving Continual Offline Reinforcement Learning with Decision Transformer
par: Huang, Kaixin, et autres
Publié: (2024)
par: Huang, Kaixin, et autres
Publié: (2024)
Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought
par: Ildiz, Muhammed Emrullah, et autres
Publié: (2026)
par: Ildiz, Muhammed Emrullah, et autres
Publié: (2026)
The Kinetics of Reasoning: How Chain-of-Thought Shapes Learning in Transformers?
par: Pengmei, Zihan, et autres
Publié: (2025)
par: Pengmei, Zihan, et autres
Publié: (2025)
Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
par: Wang, Haoran, et autres
Publié: (2023)
par: Wang, Haoran, et autres
Publié: (2023)
RIPPLECOT: Amplifying Ripple Effect of Knowledge Editing in Language Models via Chain-of-Thought In-Context Learning
par: Zhao, Zihao, et autres
Publié: (2024)
par: Zhao, Zihao, et autres
Publié: (2024)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
par: Sheng, Leheng, et autres
Publié: (2026)
par: Sheng, Leheng, et autres
Publié: (2026)
Flow marching for a generative PDE foundation model
par: Chen, Zituo, et autres
Publié: (2025)
par: Chen, Zituo, et autres
Publié: (2025)
Latent Generative Solvers for Generalizable Long-Term Physics Simulation
par: Chen, Zituo, et autres
Publié: (2026)
par: Chen, Zituo, et autres
Publié: (2026)
Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining
par: Lin, Licong, et autres
Publié: (2023)
par: Lin, Licong, et autres
Publié: (2023)
Chain-of-Thought Predictive Control
par: Jia, Zhiwei, et autres
Publié: (2023)
par: Jia, Zhiwei, et autres
Publié: (2023)
Hierarchical Meta-Reinforcement Learning via Automated Macro-Action Discovery
par: Cho, Minjae, et autres
Publié: (2024)
par: Cho, Minjae, et autres
Publié: (2024)
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces
par: Hu, Jifeng, et autres
Publié: (2024)
par: Hu, Jifeng, et autres
Publié: (2024)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
par: Fan, Ziqing, et autres
Publié: (2024)
par: Fan, Ziqing, et autres
Publié: (2024)
Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
par: Lu, Wenquan, et autres
Publié: (2025)
par: Lu, Wenquan, et autres
Publié: (2025)
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
par: Kong, Yilun, et autres
Publié: (2025)
par: Kong, Yilun, et autres
Publié: (2025)
Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning
par: Wang, Ruhan, et autres
Publié: (2024)
par: Wang, Ruhan, et autres
Publié: (2024)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
par: Li, Hanyu, et autres
Publié: (2025)
par: Li, Hanyu, et autres
Publié: (2025)
PA3: Policy-Aware Agent Alignment through Chain-of-Thought
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning
par: Dippel, Oliver, et autres
Publié: (2025)
par: Dippel, Oliver, et autres
Publié: (2025)
Globally Optimal Hierarchical Reinforcement Learning for Linearly-Solvable Markov Decision Processes
par: Infante, Guillermo, et autres
Publié: (2021)
par: Infante, Guillermo, et autres
Publié: (2021)
Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation
par: Silvestri, Gianluigi, et autres
Publié: (2026)
par: Silvestri, Gianluigi, et autres
Publié: (2026)
Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers
par: Yan, Kai, et autres
Publié: (2024)
par: Yan, Kai, et autres
Publié: (2024)
Compositional Reasoning with Transformers, RNNs, and Chain of Thought
par: Yehudai, Gilad, et autres
Publié: (2025)
par: Yehudai, Gilad, et autres
Publié: (2025)
In-Context Reinforcement Learning via Communicative World Models
par: Martinez-Lopez, Fernando, et autres
Publié: (2025)
par: Martinez-Lopez, Fernando, et autres
Publié: (2025)
Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
par: Dong, Juncheng, et autres
Publié: (2026)
par: Dong, Juncheng, et autres
Publié: (2026)
In-Context Curiosity: Distilling Exploration for Decision-Pretrained Transformers on Bandit Tasks
par: Yang, Huitao, et autres
Publié: (2025)
par: Yang, Huitao, et autres
Publié: (2025)
Scenario-Based Hierarchical Reinforcement Learning for Automated Driving Decision Making
par: Abdelhamid, M. Youssef, et autres
Publié: (2025)
par: Abdelhamid, M. Youssef, et autres
Publié: (2025)
Mixture-of-Experts Meets In-Context Reinforcement Learning
par: Wu, Wenhao, et autres
Publié: (2025)
par: Wu, Wenhao, et autres
Publié: (2025)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
par: Liang, Haodong, et autres
Publié: (2026)
par: Liang, Haodong, et autres
Publié: (2026)
Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner
par: Polubarov, Andrei, et autres
Publié: (2026)
par: Polubarov, Andrei, et autres
Publié: (2026)
Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO
par: Yu, Bowen, et autres
Publié: (2026)
par: Yu, Bowen, et autres
Publié: (2026)
Documents similaires
-
Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
par: Hu, Jifeng, et autres
Publié: (2024) -
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
par: Guo, Siyuan, et autres
Publié: (2023) -
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025) -
Decision Flow Policy Optimization
par: Hu, Jifeng, et autres
Publié: (2025) -
Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling
par: Huang, Sili, et autres
Publié: (2024)