Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Juncheng, He, Bowen, Guo, Moyang, Fang, Ethan X., Yang, Zhuoran, Tarokh, Vahid |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
In-Context Reinforcement Learning From Suboptimal Historical Data
di: Dong, Juncheng, et al.
Pubblicazione: (2026)
di: Dong, Juncheng, et al.
Pubblicazione: (2026)
Neuro-Logic Lifelong Learning
di: He, Bowen, et al.
Pubblicazione: (2025)
di: He, Bowen, et al.
Pubblicazione: (2025)
Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning
di: Gundem, Korel, et al.
Pubblicazione: (2025)
di: Gundem, Korel, et al.
Pubblicazione: (2025)
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
di: He, Bowen, et al.
Pubblicazione: (2026)
di: He, Bowen, et al.
Pubblicazione: (2026)
CARE: Turning LLMs Into Causal Reasoning Expert
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
Parabolic Continual Learning
di: Yang, Haoming, et al.
Pubblicazione: (2025)
di: Yang, Haoming, et al.
Pubblicazione: (2025)
Decoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization
di: Liao, Junyi, et al.
Pubblicazione: (2026)
di: Liao, Junyi, et al.
Pubblicazione: (2026)
PASTA: A Unified Framework for Offline Assortment Learning
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
Neural McKean-Vlasov Processes: Distributional Dependence in Diffusion Processes
di: Yang, Haoming, et al.
Pubblicazione: (2024)
di: Yang, Haoming, et al.
Pubblicazione: (2024)
Elliptic Loss Regularization
di: Hasan, Ali, et al.
Pubblicazione: (2025)
di: Hasan, Ali, et al.
Pubblicazione: (2025)
A Survey on Applications of Reinforcement Learning in Spatial Resource Allocation
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
On the Role of Information Structure in Reinforcement Learning for Partially-Observable Sequential Teams and Games
di: Altabaa, Awni, et al.
Pubblicazione: (2024)
di: Altabaa, Awni, et al.
Pubblicazione: (2024)
Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning
di: Rocamonde, Juan, et al.
Pubblicazione: (2023)
di: Rocamonde, Juan, et al.
Pubblicazione: (2023)
ColA: Collaborative Adaptation with Gradient Learning
di: Diao, Enmao, et al.
Pubblicazione: (2024)
di: Diao, Enmao, et al.
Pubblicazione: (2024)
S2TX: Cross-Attention Multi-Scale State-Space Transformer for Time Series Forecasting
di: Wu, Zihao, et al.
Pubblicazione: (2025)
di: Wu, Zihao, et al.
Pubblicazione: (2025)
The Choice of Divergence: A Neglected Key to Mitigating Diversity Collapse in Reinforcement Learning with Verifiable Reward
di: Li, Long, et al.
Pubblicazione: (2025)
di: Li, Long, et al.
Pubblicazione: (2025)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
di: Rahman, Salman, et al.
Pubblicazione: (2025)
di: Rahman, Salman, et al.
Pubblicazione: (2025)
Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective
di: Zhang, Feng, et al.
Pubblicazione: (2026)
di: Zhang, Feng, et al.
Pubblicazione: (2026)
Reinforcement Learning-Guided Semi-Supervised Learning
di: Heidari, Marzi, et al.
Pubblicazione: (2024)
di: Heidari, Marzi, et al.
Pubblicazione: (2024)
In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought
di: Huang, Sili, et al.
Pubblicazione: (2024)
di: Huang, Sili, et al.
Pubblicazione: (2024)
Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning
di: Dippel, Oliver, et al.
Pubblicazione: (2025)
di: Dippel, Oliver, et al.
Pubblicazione: (2025)
A PDE-Informed Latent Diffusion Model for 2-m Temperature Downscaling
di: Rosu, Paul, et al.
Pubblicazione: (2025)
di: Rosu, Paul, et al.
Pubblicazione: (2025)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
di: McKee-Reid, Leo, et al.
Pubblicazione: (2024)
di: McKee-Reid, Leo, et al.
Pubblicazione: (2024)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
Transformers Provably Implement In-Context Reinforcement Learning with Policy Improvement
di: Liang, Haodong, et al.
Pubblicazione: (2026)
di: Liang, Haodong, et al.
Pubblicazione: (2026)
Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards
di: Dave, Rudray, et al.
Pubblicazione: (2026)
di: Dave, Rudray, et al.
Pubblicazione: (2026)
STARK: Strategic Team of Agents for Refining Kernels
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
Reinforcement Learning with Exogenous States and Rewards
di: Trimponias, George, et al.
Pubblicazione: (2023)
di: Trimponias, George, et al.
Pubblicazione: (2023)
Reinforcement Learning with Symbolic Reward Machines
di: Krug, Thomas, et al.
Pubblicazione: (2026)
di: Krug, Thomas, et al.
Pubblicazione: (2026)
Reinforcement Learning with Stochastic Reward Machines
di: Corazza, Jan, et al.
Pubblicazione: (2025)
di: Corazza, Jan, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning with Imputed Rewards
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
di: Romeo, Carlo, et al.
Pubblicazione: (2024)
Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
di: Zhang, Hanping, et al.
Pubblicazione: (2025)
BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination
di: Hao, Xin, et al.
Pubblicazione: (2024)
di: Hao, Xin, et al.
Pubblicazione: (2024)
Perceiver-based CDF Modeling for Time Series Forecasting
di: Le, Cat P., et al.
Pubblicazione: (2023)
di: Le, Cat P., et al.
Pubblicazione: (2023)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
di: Fei, Wu, et al.
Pubblicazione: (2025)
di: Fei, Wu, et al.
Pubblicazione: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Mixture-of-Experts Meets In-Context Reinforcement Learning
di: Wu, Wenhao, et al.
Pubblicazione: (2025)
di: Wu, Wenhao, et al.
Pubblicazione: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
TW-CRL: Time-Weighted Contrastive Reward Learning for Efficient Inverse Reinforcement Learning
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
In-Context Reinforcement Learning From Suboptimal Historical Data
di: Dong, Juncheng, et al.
Pubblicazione: (2026) -
Neuro-Logic Lifelong Learning
di: He, Bowen, et al.
Pubblicazione: (2025) -
Boosting In-Context Learning in LLMs Through the Lens of Classical Supervised Learning
di: Gundem, Korel, et al.
Pubblicazione: (2025) -
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
di: He, Bowen, et al.
Pubblicazione: (2026) -
CARE: Turning LLMs Into Causal Reasoning Expert
di: Dong, Juncheng, et al.
Pubblicazione: (2025)