Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Xiaofeng, Zhu, Sirou, Chen, Yilei, Chen, Mingyu, Sang, Hejian, Paschalidis, Ioannis, Wang, Zhipeng, Pacchiano, Aldo, Zhang, Xuezhou |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multiple-policy Evaluation via Density Estimation
by: Chen, Yilei, et al.
Published: (2024)
by: Chen, Yilei, et al.
Published: (2024)
State-free Reinforcement Learning
by: Chen, Mingyu, et al.
Published: (2024)
by: Chen, Mingyu, et al.
Published: (2024)
Debunk the Myth of SFT Generalization
by: Lin, Xiaofeng, et al.
Published: (2025)
by: Lin, Xiaofeng, et al.
Published: (2025)
When Less is Enough: Efficient Inference via Collaborative Reasoning
by: Chen, Yilei, et al.
Published: (2026)
by: Chen, Yilei, et al.
Published: (2026)
Post-training Large Language Models for Diverse High-Quality Responses
by: Chen, Yilei, et al.
Published: (2025)
by: Chen, Yilei, et al.
Published: (2025)
Scale-free Adversarial Reinforcement Learning
by: Chen, Mingyu, et al.
Published: (2024)
by: Chen, Mingyu, et al.
Published: (2024)
Improved Training Mechanism for Reinforcement Learning via Online Model Selection
by: Afshar, Aida, et al.
Published: (2025)
by: Afshar, Aida, et al.
Published: (2025)
Second Order Bounds for Contextual Bandits with Function Approximation
by: Pacchiano, Aldo
Published: (2024)
by: Pacchiano, Aldo
Published: (2024)
Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees
by: Chen, Yilei, et al.
Published: (2024)
by: Chen, Yilei, et al.
Published: (2024)
Efficient Reinforcement Learning in Probabilistic Reward Machines
by: Lin, Xiaofeng, et al.
Published: (2024)
by: Lin, Xiaofeng, et al.
Published: (2024)
Bayesian Online Model Selection
by: Afshar, Aida, et al.
Published: (2026)
by: Afshar, Aida, et al.
Published: (2026)
Improving Offline RL by Blending Heuristics
by: Geng, Sinong, et al.
Published: (2023)
by: Geng, Sinong, et al.
Published: (2023)
In-Context Learning for Pure Exploration
by: Russo, Alessio, et al.
Published: (2025)
by: Russo, Alessio, et al.
Published: (2025)
Aligning Diffusion Language Models via Unpaired Preference Optimization
by: Jindal, Vaibhav, et al.
Published: (2025)
by: Jindal, Vaibhav, et al.
Published: (2025)
Data-Driven Online Model Selection With Regret Guarantees
by: Pacchiano, Aldo, et al.
Published: (2023)
by: Pacchiano, Aldo, et al.
Published: (2023)
ORSO: Accelerating Reward Design via Online Reward Selection and Policy Optimization
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
by: Zhang, Chen Bo Calvin, et al.
Published: (2024)
The Good, the Bad, and the Sampled: a No-Regret Approach to Safe Online Classification
by: Baharav, Tavor Z., et al.
Published: (2025)
by: Baharav, Tavor Z., et al.
Published: (2025)
Meet Me at the Arm: The Cooperative Multi-Armed Bandits Problem with Shareable Arms
by: Hu, Xinyi, et al.
Published: (2025)
by: Hu, Xinyi, et al.
Published: (2025)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
by: Russo, Alessio, et al.
Published: (2025)
by: Russo, Alessio, et al.
Published: (2025)
Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
by: Afshar, Aida, et al.
Published: (2024)
by: Afshar, Aida, et al.
Published: (2024)
Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration
by: Chen, Mingyu, et al.
Published: (2025)
by: Chen, Mingyu, et al.
Published: (2025)
Scaling Down, Serving Fast: Compressing and Deploying Efficient LLMs for Recommendation Systems
by: Behdin, Kayhan, et al.
Published: (2025)
by: Behdin, Kayhan, et al.
Published: (2025)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
by: Brantley, Kianté, et al.
Published: (2025)
by: Brantley, Kianté, et al.
Published: (2025)
In-Context Learning for Pure Exploration in Continuous Spaces
by: Russo, Alessio, et al.
Published: (2026)
by: Russo, Alessio, et al.
Published: (2026)
CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
by: Sang, Hejian, et al.
Published: (2026)
by: Sang, Hejian, et al.
Published: (2026)
Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
Not all tokens are needed(NAT): token efficient reinforcement learning
by: Sang, Hejian, et al.
Published: (2026)
by: Sang, Hejian, et al.
Published: (2026)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
by: Misra, Dipendra, et al.
Published: (2026)
by: Misra, Dipendra, et al.
Published: (2026)
Language Model Personalization via Reward Factorization
by: Shenfeld, Idan, et al.
Published: (2025)
by: Shenfeld, Idan, et al.
Published: (2025)
Improving Adaptive Online Learning Using Refined Discretization
by: Zhang, Zhiyu, et al.
Published: (2023)
by: Zhang, Zhiyu, et al.
Published: (2023)
Pure Exploration with Feedback Graphs
by: Russo, Alessio, et al.
Published: (2025)
by: Russo, Alessio, et al.
Published: (2025)
Contextual Bandits with Stage-wise Constraints
by: Pacchiano, Aldo, et al.
Published: (2024)
by: Pacchiano, Aldo, et al.
Published: (2024)
Role-RL: Online Long-Context Processing with Role Reinforcement Learning for Distinct LLMs in Their Optimal Roles
by: He, Lewei, et al.
Published: (2024)
by: He, Lewei, et al.
Published: (2024)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
TIP: Token Importance in On-Policy Distillation
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation
by: Chen, Wei-Rui, et al.
Published: (2025)
by: Chen, Wei-Rui, et al.
Published: (2025)
The new science of COVID-19: A Bibliographic and Network Analysis
by: Fan, Xuezhou
Published: (2024)
by: Fan, Xuezhou
Published: (2024)
Provable Interactive Learning with Hindsight Instruction Feedback
by: Misra, Dipendra, et al.
Published: (2024)
by: Misra, Dipendra, et al.
Published: (2024)
Similar Items
-
Multiple-policy Evaluation via Density Estimation
by: Chen, Yilei, et al.
Published: (2024) -
State-free Reinforcement Learning
by: Chen, Mingyu, et al.
Published: (2024) -
Debunk the Myth of SFT Generalization
by: Lin, Xiaofeng, et al.
Published: (2025) -
When Less is Enough: Efficient Inference via Collaborative Reasoning
by: Chen, Yilei, et al.
Published: (2026) -
Post-training Large Language Models for Diverse High-Quality Responses
by: Chen, Yilei, et al.
Published: (2025)