Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Xiao, Xie, Hong, Tan, Tao, Lian, Defu, Han, Jianyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective
by: Xie, Hong, et al.
Published: (2026)
by: Xie, Hong, et al.
Published: (2026)
LIFT: Interpretable truck driving risk prediction with literature-informed fine-tuned LLMs
by: Hu, Xiao, et al.
Published: (2025)
by: Hu, Xiao, et al.
Published: (2025)
Multi-agent Multi-armed Bandits with Stochastic Sharable Arm Capacities
by: Xie, Hong, et al.
Published: (2024)
by: Xie, Hong, et al.
Published: (2024)
Learning from models beyond fine-tuning
by: Zheng, Hongling, et al.
Published: (2023)
by: Zheng, Hongling, et al.
Published: (2023)
Deceptive Exploration in Multi-armed Bandits
by: Vurankaya, I. Arda, et al.
Published: (2025)
by: Vurankaya, I. Arda, et al.
Published: (2025)
Causally Abstracted Multi-armed Bandits
by: Zennaro, Fabio Massimo, et al.
Published: (2024)
by: Zennaro, Fabio Massimo, et al.
Published: (2024)
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
by: Yang, Hantao, et al.
Published: (2024)
by: Yang, Hantao, et al.
Published: (2024)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
by: Kim, Minseon, et al.
Published: (2025)
by: Kim, Minseon, et al.
Published: (2025)
Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization
by: Zhao, Yunfan, et al.
Published: (2023)
by: Zhao, Yunfan, et al.
Published: (2023)
Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits
by: Jeong, Woojin, et al.
Published: (2024)
by: Jeong, Woojin, et al.
Published: (2024)
Rethinking harmless refusals when fine-tuning foundation models
by: Pop, Florin, et al.
Published: (2024)
by: Pop, Florin, et al.
Published: (2024)
Multiple-play Stochastic Bandits with Prioritized Arm Capacity Sharing
by: Xie, Hong, et al.
Published: (2025)
by: Xie, Hong, et al.
Published: (2025)
Networked Restless Multi-Arm Bandits with Reinforcement Learning
by: Zhang, Hanmo, et al.
Published: (2025)
by: Zhang, Hanmo, et al.
Published: (2025)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
by: Chen, Jack, et al.
Published: (2025)
by: Chen, Jack, et al.
Published: (2025)
Combinatorial Multi-armed Bandits: Arm Selection via Group Testing
by: Mukherjee, Arpan, et al.
Published: (2024)
by: Mukherjee, Arpan, et al.
Published: (2024)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
by: Xiong, Guojun, et al.
Published: (2024)
by: Xiong, Guojun, et al.
Published: (2024)
LLMs Are In-Context Bandit Reinforcement Learners
by: Monea, Giovanni, et al.
Published: (2024)
by: Monea, Giovanni, et al.
Published: (2024)
Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
by: Duan, Tianyang, et al.
Published: (2025)
by: Duan, Tianyang, et al.
Published: (2025)
Meritocratic Fairness in Budgeted Combinatorial Multi-armed Bandits via Shapley Values
by: Sharma, Shradha, et al.
Published: (2026)
by: Sharma, Shradha, et al.
Published: (2026)
M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
by: Chen, Jianlv, et al.
Published: (2024)
by: Chen, Jianlv, et al.
Published: (2024)
Adaptive Multi-Agent Deep Reinforcement Learning for Timely Healthcare Interventions
by: Shaik, Thanveer, et al.
Published: (2023)
by: Shaik, Thanveer, et al.
Published: (2023)
Uncertainty quantification in fine-tuned LLMs using LoRA ensembles
by: Balabanov, Oleksandr, et al.
Published: (2024)
by: Balabanov, Oleksandr, et al.
Published: (2024)
Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments
by: Zhang, Ziyuan, et al.
Published: (2025)
by: Zhang, Ziyuan, et al.
Published: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)
by: Lu, Xiaodong, et al.
Published: (2026)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
by: Kong, Deyang, et al.
Published: (2025)
by: Kong, Deyang, et al.
Published: (2025)
Foundations and Frontiers of Graph Learning Theory
by: Huang, Yu, et al.
Published: (2024)
by: Huang, Yu, et al.
Published: (2024)
Rethinking Plasticity in Deep Reinforcement Learning
by: He, Zhiqiang
Published: (2026)
by: He, Zhiqiang
Published: (2026)
Rethinking the Foundations for Continual Reinforcement Learning
by: Elelimy, Esraa, et al.
Published: (2025)
by: Elelimy, Esraa, et al.
Published: (2025)
An Electrocardiogram Multi-task Benchmark with Comprehensive Evaluations and Insightful Findings
by: Xu, Yuhao, et al.
Published: (2025)
by: Xu, Yuhao, et al.
Published: (2025)
Rethinking Dimensional Rationale in Graph Contrastive Learning from Causal Perspective
by: Ji, Qirui, et al.
Published: (2023)
by: Ji, Qirui, et al.
Published: (2023)
KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
by: Ran, Dezhi, et al.
Published: (2025)
by: Ran, Dezhi, et al.
Published: (2025)
Empirical influence functions to understand the logic of fine-tuning
by: Matelsky, Jordan K., et al.
Published: (2024)
by: Matelsky, Jordan K., et al.
Published: (2024)
Efficient Machine Unlearning via Influence Approximation
by: Liu, Jiawei, et al.
Published: (2025)
by: Liu, Jiawei, et al.
Published: (2025)
FLoRA: Fused forward-backward adapters for parameter efficient fine-tuning and reducing inference-time latencies of LLMs
by: Gowda, Dhananjaya, et al.
Published: (2025)
by: Gowda, Dhananjaya, et al.
Published: (2025)
When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
by: Ye, Wen, et al.
Published: (2025)
by: Ye, Wen, et al.
Published: (2025)
Protein-Conditioned Multi-Objective Reinforcement Learning for Full-Length mRNA Design
by: Shao, Zixi, et al.
Published: (2026)
by: Shao, Zixi, et al.
Published: (2026)
Fine-tuning Timeseries Predictors Using Reinforcement Learning
by: Cazaux, Hugo, et al.
Published: (2026)
by: Cazaux, Hugo, et al.
Published: (2026)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
by: Li, Yuanpeng, et al.
Published: (2026)
by: Li, Yuanpeng, et al.
Published: (2026)
EnECG: Efficient Ensemble Learning for Electrocardiogram Multi-task Foundation Model
by: Xu, Yuhao, et al.
Published: (2025)
by: Xu, Yuhao, et al.
Published: (2025)
Mitigate Negative Transfer with Similarity Heuristic Lifelong Prompt Tuning
by: Wu, Chenyuan, et al.
Published: (2024)
by: Wu, Chenyuan, et al.
Published: (2024)
Similar Items
-
Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective
by: Xie, Hong, et al.
Published: (2026) -
LIFT: Interpretable truck driving risk prediction with literature-informed fine-tuned LLMs
by: Hu, Xiao, et al.
Published: (2025) -
Multi-agent Multi-armed Bandits with Stochastic Sharable Arm Capacities
by: Xie, Hong, et al.
Published: (2024) -
Learning from models beyond fine-tuning
by: Zheng, Hongling, et al.
Published: (2023) -
Deceptive Exploration in Multi-armed Bandits
by: Vurankaya, I. Arda, et al.
Published: (2025)