RL-Guided Data Selection for Language Model Finetuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jha, Animesh, Gupta, Harshit, Nandi, Ananjan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DynaSemble: Dynamic Ensembling of Textual and Structure-Based Models for Knowledge Graph Completion
von: Nandi, Ananjan, et al.
Veröffentlicht: (2023)
von: Nandi, Ananjan, et al.
Veröffentlicht: (2023)
Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
von: Nguyen, Manh, et al.
Veröffentlicht: (2025)
von: Nguyen, Manh, et al.
Veröffentlicht: (2025)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
von: Bartelds, Martijn, et al.
Veröffentlicht: (2025)
von: Bartelds, Martijn, et al.
Veröffentlicht: (2025)
Dissecting Language Models: Machine Unlearning via Selective Pruning
von: Pochinkov, Nicholas, et al.
Veröffentlicht: (2024)
von: Pochinkov, Nicholas, et al.
Veröffentlicht: (2024)
Internalizing World Models via Self-Play Finetuning for Agentic RL
von: Chen, Shiqi, et al.
Veröffentlicht: (2025)
von: Chen, Shiqi, et al.
Veröffentlicht: (2025)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
Online Finetuning Decision Transformers with Pure RL Gradients
von: Luo, Junkai, et al.
Veröffentlicht: (2026)
von: Luo, Junkai, et al.
Veröffentlicht: (2026)
Residual Off-Policy RL for Finetuning Behavior Cloning Policies
von: Ankile, Lars, et al.
Veröffentlicht: (2025)
von: Ankile, Lars, et al.
Veröffentlicht: (2025)
The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data
von: Baek, Christina, et al.
Veröffentlicht: (2026)
von: Baek, Christina, et al.
Veröffentlicht: (2026)
RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors?
von: Gupta, Rohan, et al.
Veröffentlicht: (2025)
von: Gupta, Rohan, et al.
Veröffentlicht: (2025)
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
von: Qu, Yun, et al.
Veröffentlicht: (2025)
von: Qu, Yun, et al.
Veröffentlicht: (2025)
Towards Active Synthetic Data Generation for Finetuning Language Models
von: Kessler, Samuel, et al.
Veröffentlicht: (2025)
von: Kessler, Samuel, et al.
Veröffentlicht: (2025)
In2Core: Leveraging Influence Functions for Coreset Selection in Instruction Finetuning of Large Language Models
von: Joaquin, Ayrton San, et al.
Veröffentlicht: (2024)
von: Joaquin, Ayrton San, et al.
Veröffentlicht: (2024)
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
von: Zhao, Rosie, et al.
Veröffentlicht: (2026)
von: Zhao, Rosie, et al.
Veröffentlicht: (2026)
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
von: Zhang, Biao, et al.
Veröffentlicht: (2024)
von: Zhang, Biao, et al.
Veröffentlicht: (2024)
RL-Finetuned LLMs for Privacy-Preserving Synthetic Rewriting
von: Shi, Zhan, et al.
Veröffentlicht: (2025)
von: Shi, Zhan, et al.
Veröffentlicht: (2025)
Proto Successor Measure: Representing the Behavior Space of an RL Agent
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
Transfer Learning of Tabular Data by Finetuning Large Language Models
von: Rabbani, Shourav B., et al.
Veröffentlicht: (2025)
von: Rabbani, Shourav B., et al.
Veröffentlicht: (2025)
Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning
von: Gupta, Prakhar, et al.
Veröffentlicht: (2026)
von: Gupta, Prakhar, et al.
Veröffentlicht: (2026)
Sketchy Moment Matching: Toward Fast and Provable Data Selection for Finetuning
von: Dong, Yijun, et al.
Veröffentlicht: (2024)
von: Dong, Yijun, et al.
Veröffentlicht: (2024)
RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment
von: Yang, Suorong, et al.
Veröffentlicht: (2025)
von: Yang, Suorong, et al.
Veröffentlicht: (2025)
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
Dual RL: Unification and New Methods for Reinforcement and Imitation Learning
von: Sikchi, Harshit, et al.
Veröffentlicht: (2023)
von: Sikchi, Harshit, et al.
Veröffentlicht: (2023)
Improving Sparse Memory Finetuning
von: Goyal, Satyam, et al.
Veröffentlicht: (2026)
von: Goyal, Satyam, et al.
Veröffentlicht: (2026)
Exact Unlearning of Finetuning Data via Model Merging at Scale
von: Kuo, Kevin, et al.
Veröffentlicht: (2025)
von: Kuo, Kevin, et al.
Veröffentlicht: (2025)
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
von: Wagenmaker, Andrew, et al.
Veröffentlicht: (2025)
von: Wagenmaker, Andrew, et al.
Veröffentlicht: (2025)
Ensembling Finetuned Language Models for Text Classification
von: Arango, Sebastian Pineda, et al.
Veröffentlicht: (2024)
von: Arango, Sebastian Pineda, et al.
Veröffentlicht: (2024)
Transfer Learning for Finetuning Large Language Models
von: Strangmann, Tobias, et al.
Veröffentlicht: (2024)
von: Strangmann, Tobias, et al.
Veröffentlicht: (2024)
From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning
von: Sun, Zhanyi, et al.
Veröffentlicht: (2026)
von: Sun, Zhanyi, et al.
Veröffentlicht: (2026)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
von: Mukherjee, Sagnik, et al.
Veröffentlicht: (2025)
von: Mukherjee, Sagnik, et al.
Veröffentlicht: (2025)
Thinking Forward: Memory-Efficient Federated Finetuning of Language Models
von: Panchal, Kunjal, et al.
Veröffentlicht: (2024)
von: Panchal, Kunjal, et al.
Veröffentlicht: (2024)
Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning
von: Zhang, Ling, et al.
Veröffentlicht: (2025)
von: Zhang, Ling, et al.
Veröffentlicht: (2025)
CLIMB: Language-Guided Continual Learning for Task Planning with Iterative Model Building
von: Byrnes, Walker, et al.
Veröffentlicht: (2024)
von: Byrnes, Walker, et al.
Veröffentlicht: (2024)
QuRating: Selecting High-Quality Data for Training Language Models
von: Wettig, Alexander, et al.
Veröffentlicht: (2024)
von: Wettig, Alexander, et al.
Veröffentlicht: (2024)
Large Language Models to Diffusion Finetuning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
von: Cetin, Edoardo, et al.
Veröffentlicht: (2025)
On Finetuning Tabular Foundation Models
von: Rubachev, Ivan, et al.
Veröffentlicht: (2025)
von: Rubachev, Ivan, et al.
Veröffentlicht: (2025)
GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL
von: Wang, Haoyu, et al.
Veröffentlicht: (2026)
von: Wang, Haoyu, et al.
Veröffentlicht: (2026)
Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL Finetuning
von: Xie, Desai, et al.
Veröffentlicht: (2023)
von: Xie, Desai, et al.
Veröffentlicht: (2023)
Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models
von: Peng, ShengYun, et al.
Veröffentlicht: (2024)
von: Peng, ShengYun, et al.
Veröffentlicht: (2024)
Small or Large? Zero-Shot or Finetuned? Guiding Language Model Choice for Specialized Applications in Healthcare
von: Gondara, Lovedeep, et al.
Veröffentlicht: (2025)
von: Gondara, Lovedeep, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DynaSemble: Dynamic Ensembling of Textual and Structure-Based Models for Knowledge Graph Completion
von: Nandi, Ananjan, et al.
Veröffentlicht: (2023) -
Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
von: Nguyen, Manh, et al.
Veröffentlicht: (2025) -
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
von: Bartelds, Martijn, et al.
Veröffentlicht: (2025) -
Dissecting Language Models: Machine Unlearning via Selective Pruning
von: Pochinkov, Nicholas, et al.
Veröffentlicht: (2024) -
Internalizing World Models via Self-Play Finetuning for Agentic RL
von: Chen, Shiqi, et al.
Veröffentlicht: (2025)