Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dong, Juncheng, He, Bowen, Guo, Moyang, Fang, Ethan X., Yang, Zhuoran, Tarokh, Vahid |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
In-Context Reinforcement Learning From Suboptimal Historical Data
von: Dong, Juncheng, et al.
Veröffentlicht: (2026)
von: Dong, Juncheng, et al.
Veröffentlicht: (2026)
Neuro-Logic Lifelong Learning
von: He, Bowen, et al.
Veröffentlicht: (2025)
von: He, Bowen, et al.
Veröffentlicht: (2025)
Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning
von: Gundem, Korel, et al.
Veröffentlicht: (2025)
von: Gundem, Korel, et al.
Veröffentlicht: (2025)
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
von: He, Bowen, et al.
Veröffentlicht: (2026)
von: He, Bowen, et al.
Veröffentlicht: (2026)
CARE: Turning LLMs Into Causal Reasoning Expert
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
Parabolic Continual Learning
von: Yang, Haoming, et al.
Veröffentlicht: (2025)
von: Yang, Haoming, et al.
Veröffentlicht: (2025)
Decoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization
von: Liao, Junyi, et al.
Veröffentlicht: (2026)
von: Liao, Junyi, et al.
Veröffentlicht: (2026)
PASTA: A Unified Framework for Offline Assortment Learning
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
Neural McKean-Vlasov Processes: Distributional Dependence in Diffusion Processes
von: Yang, Haoming, et al.
Veröffentlicht: (2024)
von: Yang, Haoming, et al.
Veröffentlicht: (2024)
Elliptic Loss Regularization
von: Hasan, Ali, et al.
Veröffentlicht: (2025)
von: Hasan, Ali, et al.
Veröffentlicht: (2025)
A Survey on Applications of Reinforcement Learning in Spatial Resource Allocation
von: Zhang, Di, et al.
Veröffentlicht: (2024)
von: Zhang, Di, et al.
Veröffentlicht: (2024)
On the Role of Information Structure in Reinforcement Learning for Partially-Observable Sequential Teams and Games
von: Altabaa, Awni, et al.
Veröffentlicht: (2024)
von: Altabaa, Awni, et al.
Veröffentlicht: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
von: Rocamonde, Juan, et al.
Veröffentlicht: (2023)
ColA: Collaborative Adaptation with Gradient Learning
von: Diao, Enmao, et al.
Veröffentlicht: (2024)
von: Diao, Enmao, et al.
Veröffentlicht: (2024)
S2TX: Cross-Attention Multi-Scale State-Space Transformer for Time Series Forecasting
von: Wu, Zihao, et al.
Veröffentlicht: (2025)
von: Wu, Zihao, et al.
Veröffentlicht: (2025)
The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
von: Li, Long, et al.
Veröffentlicht: (2025)
von: Li, Long, et al.
Veröffentlicht: (2025)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
von: Rahman, Salman, et al.
Veröffentlicht: (2025)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
von: Zhang, Feng, et al.
Veröffentlicht: (2026)
Reinforcement Learning-Guided Semi-Supervised Learning
von: Heidari, Marzi, et al.
Veröffentlicht: (2024)
von: Heidari, Marzi, et al.
Veröffentlicht: (2024)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
von: Huang, Sili, et al.
Veröffentlicht: (2024)
von: Huang, Sili, et al.
Veröffentlicht: (2024)
Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning
von: Dippel, Oliver, et al.
Veröffentlicht: (2025)
von: Dippel, Oliver, et al.
Veröffentlicht: (2025)
A PDE-Informed Latent Diffusion Model for 2-m Temperature Downscaling
von: Rosu, Paul, et al.
Veröffentlicht: (2025)
von: Rosu, Paul, et al.
Veröffentlicht: (2025)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
von: McKee-Reid, Leo, et al.
Veröffentlicht: (2024)
von: McKee-Reid, Leo, et al.
Veröffentlicht: (2024)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
von: Liang, Haodong, et al.
Veröffentlicht: (2026)
von: Liang, Haodong, et al.
Veröffentlicht: (2026)
Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards
von: Dave, Rudray, et al.
Veröffentlicht: (2026)
von: Dave, Rudray, et al.
Veröffentlicht: (2026)
STARK: Strategic Team of Agents for Refining Kernels
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Exogenous States and Rewards
von: Trimponias, George, et al.
Veröffentlicht: (2023)
von: Trimponias, George, et al.
Veröffentlicht: (2023)
Reinforcement Learning with Symbolic Reward Machines
von: Krug, Thomas, et al.
Veröffentlicht: (2026)
von: Krug, Thomas, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Stochastic Reward Machines
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
von: Corazza, Jan, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning with Imputed Rewards
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination
von: Hao, Xin, et al.
Veröffentlicht: (2024)
von: Hao, Xin, et al.
Veröffentlicht: (2024)
Perceiver-based CDF Modeling for Time Series Forecasting
von: Le, Cat P., et al.
Veröffentlicht: (2023)
von: Le, Cat P., et al.
Veröffentlicht: (2023)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
von: Fei, Wu, et al.
Veröffentlicht: (2025)
von: Fei, Wu, et al.
Veröffentlicht: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
von: Xu, Yang, et al.
Veröffentlicht: (2025)
von: Xu, Yang, et al.
Veröffentlicht: (2025)
Mixture-of-Experts Meets In-Context Reinforcement Learning
von: Wu, Wenhao, et al.
Veröffentlicht: (2025)
von: Wu, Wenhao, et al.
Veröffentlicht: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
von: Park, Jungsoo, et al.
Veröffentlicht: (2026)
von: Park, Jungsoo, et al.
Veröffentlicht: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
von: Li, Yuxuan, et al.
Veröffentlicht: (2025)
von: Li, Yuxuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
In-Context Reinforcement Learning From Suboptimal Historical Data
von: Dong, Juncheng, et al.
Veröffentlicht: (2026) -
Neuro-Logic Lifelong Learning
von: He, Bowen, et al.
Veröffentlicht: (2025) -
Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning
von: Gundem, Korel, et al.
Veröffentlicht: (2025) -
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
von: He, Bowen, et al.
Veröffentlicht: (2026) -
CARE: Turning LLMs Into Causal Reasoning Expert
von: Dong, Juncheng, et al.
Veröffentlicht: (2025)