Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Hong, Hu, Xiao, Tan, Tao, Gu, Haoran, Li, Xin, Han, Jianyu, Lian, Defu, Chen, Enhong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective
by: Hu, Xiao, et al.
Published: (2026)
by: Hu, Xiao, et al.
Published: (2026)
Multiple-play Stochastic Bandits with Prioritized Arm Capacity Sharing
by: Xie, Hong, et al.
Published: (2025)
by: Xie, Hong, et al.
Published: (2025)
LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference
by: Yang, Hantao, et al.
Published: (2025)
by: Yang, Hantao, et al.
Published: (2025)
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
by: Yang, Hantao, et al.
Published: (2024)
by: Yang, Hantao, et al.
Published: (2024)
Scaling Federated Linear Contextual Bandits via Sketching
by: Yang, Hantao, et al.
Published: (2026)
by: Yang, Hantao, et al.
Published: (2026)
Multi-agent Multi-armed Bandits with Stochastic Sharable Arm Capacities
by: Xie, Hong, et al.
Published: (2024)
by: Xie, Hong, et al.
Published: (2024)
Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance
by: Yang, Wei, et al.
Published: (2026)
by: Yang, Wei, et al.
Published: (2026)
Batched Nonparametric Contextual Bandits
by: Jiang, Rong, et al.
Published: (2024)
by: Jiang, Rong, et al.
Published: (2024)
AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature
by: Yang, Wei, et al.
Published: (2026)
by: Yang, Wei, et al.
Published: (2026)
Analytical and Empirical Study of Herding Effects in Recommendation Systems
by: Xie, Hong, et al.
Published: (2024)
by: Xie, Hong, et al.
Published: (2024)
Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss
by: Pu, Yuanhao, et al.
Published: (2026)
by: Pu, Yuanhao, et al.
Published: (2026)
Beyond Surrogates: A Quantitative Analysis for Inter-Metric Relationships
by: Pu, Yuanhao, et al.
Published: (2026)
by: Pu, Yuanhao, et al.
Published: (2026)
Refine Large Language Model Fine-tuning via Instruction Vector
by: Jiang, Gangwei, et al.
Published: (2024)
by: Jiang, Gangwei, et al.
Published: (2024)
IBCB: Efficient Inverse Batched Contextual Bandit for Behavioral Evolution History
by: Xu, Yi, et al.
Published: (2024)
by: Xu, Yi, et al.
Published: (2024)
Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving
by: Lian, Zhexi, et al.
Published: (2026)
by: Lian, Zhexi, et al.
Published: (2026)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
by: Wang, Renxi, et al.
Published: (2023)
by: Wang, Renxi, et al.
Published: (2023)
Batch Augmentation with Unimodal Fine-tuning for Multimodal Learning
by: Kabir, H M Dipu, et al.
Published: (2025)
by: Kabir, H M Dipu, et al.
Published: (2025)
Efficient Machine Unlearning via Influence Approximation
by: Liu, Jiawei, et al.
Published: (2025)
by: Liu, Jiawei, et al.
Published: (2025)
Securing Recommender System via Cooperative Training
by: Wang, Qingyang, et al.
Published: (2024)
by: Wang, Qingyang, et al.
Published: (2024)
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features
by: Swiers, Rowan, et al.
Published: (2024)
by: Swiers, Rowan, et al.
Published: (2024)
Fine-tuning with Very Large Dropout
by: Zhang, Jianyu, et al.
Published: (2024)
by: Zhang, Jianyu, et al.
Published: (2024)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)
by: Lu, Xiaodong, et al.
Published: (2026)
Breaking Determinism: Fuzzy Modeling of Sequential Recommendation Using Discrete State Space Diffusion Model
by: Xie, Wenjia, et al.
Published: (2024)
by: Xie, Wenjia, et al.
Published: (2024)
Learning to Substitute Components for Compositional Generalization
by: Li, Zhaoyi, et al.
Published: (2025)
by: Li, Zhaoyi, et al.
Published: (2025)
Multi-Level Contextual Token Relation Modeling for Machine-Generated Text Detection
by: Wu, Chenwang, et al.
Published: (2026)
by: Wu, Chenwang, et al.
Published: (2026)
Learning Deep Tree-based Retriever for Efficient Recommendation: Theory and Method
by: Liu, Ze, et al.
Published: (2024)
by: Liu, Ze, et al.
Published: (2024)
Contextual Bandit with Herding Effects: Algorithms and Recommendation Applications
by: Xu, Luyue, et al.
Published: (2024)
by: Xu, Luyue, et al.
Published: (2024)
MDAP: A Multi-view Disentangled and Adaptive Preference Learning Framework for Cross-Domain Recommendation
by: Tong, Junxiong, et al.
Published: (2024)
by: Tong, Junxiong, et al.
Published: (2024)
Graph Contextual Reinforcement Learning for Efficient Directed Controller Synthesis
by: Ubukata, Toshihide, et al.
Published: (2025)
by: Ubukata, Toshihide, et al.
Published: (2025)
Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration
by: Lv, Hang, et al.
Published: (2026)
by: Lv, Hang, et al.
Published: (2026)
Designing an Interpretable Interface for Contextual Bandits
by: Maher, Andrew, et al.
Published: (2024)
by: Maher, Andrew, et al.
Published: (2024)
Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models
by: Li, Zhaoyi, et al.
Published: (2026)
by: Li, Zhaoyi, et al.
Published: (2026)
CeProAgents: A Hierarchical Agents System for Automated Chemical Process Development
by: Yang, Yuhang, et al.
Published: (2026)
by: Yang, Yuhang, et al.
Published: (2026)
Robust Batched Bandits
by: Guo, Yunwen, et al.
Published: (2025)
by: Guo, Yunwen, et al.
Published: (2025)
Contextual Restless Multi-Armed Bandits with Application to Demand Response Decision-Making
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
Foundations and Frontiers of Graph Learning Theory
by: Huang, Yu, et al.
Published: (2024)
by: Huang, Yu, et al.
Published: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
by: Di, Qiwei, et al.
Published: (2023)
by: Di, Qiwei, et al.
Published: (2023)
On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training
by: Niu, Xueyan, et al.
Published: (2026)
by: Niu, Xueyan, et al.
Published: (2026)
A Unified Framework for Adaptive Representation Enhancement and Inversed Learning in Cross-Domain Recommendation
by: Zhang, Luankang, et al.
Published: (2024)
by: Zhang, Luankang, et al.
Published: (2024)
Semantic-preserved Augmentation with Confidence-weighted Fine-tuning for Aspect Category Sentiment Analysis
by: Chai, Yaping, et al.
Published: (2025)
by: Chai, Yaping, et al.
Published: (2025)
Similar Items
-
Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective
by: Hu, Xiao, et al.
Published: (2026) -
Multiple-play Stochastic Bandits with Prioritized Arm Capacity Sharing
by: Xie, Hong, et al.
Published: (2025) -
LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference
by: Yang, Hantao, et al.
Published: (2025) -
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
by: Yang, Hantao, et al.
Published: (2024) -
Scaling Federated Linear Contextual Bandits via Sketching
by: Yang, Hantao, et al.
Published: (2026)