Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Hao, Pu, Zhiqiang, Liu, Yang, Ai, Xiaolin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
di: Ma, Lu, et al.
Pubblicazione: (2025)
di: Ma, Lu, et al.
Pubblicazione: (2025)
Coevolving with the Other You: Fine-Tuning LLM with Sequential Cooperative Multi-Agent Reinforcement Learning
di: Ma, Hao, et al.
Pubblicazione: (2024)
di: Ma, Hao, et al.
Pubblicazione: (2024)
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
di: Zhang, Honglin, et al.
Pubblicazione: (2025)
di: Zhang, Honglin, et al.
Pubblicazione: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
di: Sun, Hao
Pubblicazione: (2024)
di: Sun, Hao
Pubblicazione: (2024)
Refine-POI: Reinforcement Fine-Tuned Large Language Models for Next Point-of-Interest Recommendation
di: Li, Peibo, et al.
Pubblicazione: (2025)
di: Li, Peibo, et al.
Pubblicazione: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
di: Bozkurt, Alper Kamil, et al.
Pubblicazione: (2026)
Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
di: Liu, Yuhang, et al.
Pubblicazione: (2025)
Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
di: Zheng, Han, et al.
Pubblicazione: (2026)
di: Zheng, Han, et al.
Pubblicazione: (2026)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
di: Qin, Chongli, et al.
Pubblicazione: (2025)
di: Qin, Chongli, et al.
Pubblicazione: (2025)
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
Rethinking Plasticity in Deep Reinforcement Learning
di: He, Zhiqiang
Pubblicazione: (2026)
di: He, Zhiqiang
Pubblicazione: (2026)
Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning
di: Hao, Ce, et al.
Pubblicazione: (2023)
di: Hao, Ce, et al.
Pubblicazione: (2023)
ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles
di: Zhao, Kai, et al.
Pubblicazione: (2023)
di: Zhao, Kai, et al.
Pubblicazione: (2023)
RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting
di: Li, Yuduo, et al.
Pubblicazione: (2026)
di: Li, Yuduo, et al.
Pubblicazione: (2026)
Reinforcement Learning Fine-Tunes a Sparse Subnetwork in Large Language Models
di: Balashov, Andrii
Pubblicazione: (2025)
di: Balashov, Andrii
Pubblicazione: (2025)
TuneComp: Joint Fine-tuning and Compression for Large Foundation Models
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
FL-TAC: Enhanced Fine-Tuning in Federated Learning via Low-Rank, Task-Specific Adapter Clustering
di: Ping, Siqi, et al.
Pubblicazione: (2024)
di: Ping, Siqi, et al.
Pubblicazione: (2024)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
di: Nakamoto, Mitsuhiko, et al.
Pubblicazione: (2023)
Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction
di: Feng, Jinyuan, et al.
Pubblicazione: (2024)
di: Feng, Jinyuan, et al.
Pubblicazione: (2024)
Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach
di: Fan, Junchao, et al.
Pubblicazione: (2025)
di: Fan, Junchao, et al.
Pubblicazione: (2025)
Silent Neuron Theory and Plasticity Preservation for Deep Reinforcement Learning in Adaptive Video Streaming
di: He, Zhiqiang, et al.
Pubblicazione: (2025)
di: He, Zhiqiang, et al.
Pubblicazione: (2025)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
di: Lin, Guang, et al.
Pubblicazione: (2026)
di: Lin, Guang, et al.
Pubblicazione: (2026)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
Iterative Refinement Neural Operators are Learned Fixed-Point Solvers: A Principled Approach to Spectral Bias Mitigation
di: Liu, Xiaotian, et al.
Pubblicazione: (2026)
di: Liu, Xiaotian, et al.
Pubblicazione: (2026)
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
di: Zhao, Yanxiao, et al.
Pubblicazione: (2025)
di: Zhao, Yanxiao, et al.
Pubblicazione: (2025)
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
di: Zhang, Jiawen, et al.
Pubblicazione: (2026)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
di: Wang, Shumin, et al.
Pubblicazione: (2026)
di: Wang, Shumin, et al.
Pubblicazione: (2026)
Enhancing In-Context Learning Performance with just SVD-Based Weight Pruning: A Theoretical Perspective
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
di: Yao, Xinhao, et al.
Pubblicazione: (2024)
Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
di: Sun, Xiaolin, et al.
Pubblicazione: (2025)
di: Sun, Xiaolin, et al.
Pubblicazione: (2025)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
di: Lai, Song, et al.
Pubblicazione: (2025)
di: Lai, Song, et al.
Pubblicazione: (2025)
Fine-Tuning Language Models with Differential Privacy through Adaptive Noise Allocation
di: Li, Xianzhi, et al.
Pubblicazione: (2024)
di: Li, Xianzhi, et al.
Pubblicazione: (2024)
Flow-Based Policy for Online Reinforcement Learning
di: Lv, Lei, et al.
Pubblicazione: (2025)
di: Lv, Lei, et al.
Pubblicazione: (2025)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
di: Xiao, Wei, et al.
Pubblicazione: (2025)
di: Xiao, Wei, et al.
Pubblicazione: (2025)
Enhancing Federated Domain Adaptation with Multi-Domain Prototype-Based Federated Fine-Tuning
di: Zhang, Jingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2024)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
di: Cai, Ruichu, et al.
Pubblicazione: (2024)
di: Cai, Ruichu, et al.
Pubblicazione: (2024)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
di: Chen, Jie, et al.
Pubblicazione: (2024)
di: Chen, Jie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vision-Based Generic Potential Function for Policy Alignment in Multi-Agent Reinforcement Learning
di: Ma, Hao, et al.
Pubblicazione: (2025) -
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
di: Ma, Lu, et al.
Pubblicazione: (2025) -
Coevolving with the Other You: Fine-Tuning LLM with Sequential Cooperative Multi-Agent Reinforcement Learning
di: Ma, Hao, et al.
Pubblicazione: (2024) -
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
di: Zhang, Honglin, et al.
Pubblicazione: (2025) -
Supervised Fine-Tuning as Inverse Reinforcement Learning
di: Sun, Hao
Pubblicazione: (2024)