Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Han, Ma, Yining, Gunasekaran, Karthick, Balaji, Bharathan, Du, Zheng, Vitaladevuni, Shiv, Wu, Cathy |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
di: Zhang, Honglin, et al.
Pubblicazione: (2025)
di: Zhang, Honglin, et al.
Pubblicazione: (2025)
Learning to Segment for Vehicle Routing Problems
di: Ouyang, Wenbin, et al.
Pubblicazione: (2025)
di: Ouyang, Wenbin, et al.
Pubblicazione: (2025)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
Learning-Guided Rolling Horizon Optimization for Long-Horizon Flexible Job-Shop Scheduling
di: Li, Sirui, et al.
Pubblicazione: (2025)
di: Li, Sirui, et al.
Pubblicazione: (2025)
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
di: Zeng, Xinyue, et al.
Pubblicazione: (2025)
di: Zeng, Xinyue, et al.
Pubblicazione: (2025)
Alignment Dynamics in LLM Fine-Tuning
di: Huang, Yuhan, et al.
Pubblicazione: (2026)
di: Huang, Yuhan, et al.
Pubblicazione: (2026)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
di: Huang, Jiawei, et al.
Pubblicazione: (2026)
Expert System for Bitcoin Forecasting: Integrating Global Liquidity via TimeXer Transformers
di: T, Sravan Karthick
Pubblicazione: (2025)
di: T, Sravan Karthick
Pubblicazione: (2025)
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
di: Yi, Hongzhu, et al.
Pubblicazione: (2026)
Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
di: Ma, Lu, et al.
Pubblicazione: (2025)
di: Ma, Lu, et al.
Pubblicazione: (2025)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
di: Xu, Kaixuan, et al.
Pubblicazione: (2025)
di: Xu, Kaixuan, et al.
Pubblicazione: (2025)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
di: Ju, Yiming, et al.
Pubblicazione: (2024)
di: Ju, Yiming, et al.
Pubblicazione: (2024)
Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies
di: Schweighofer, Kajetan, et al.
Pubblicazione: (2026)
di: Schweighofer, Kajetan, et al.
Pubblicazione: (2026)
Goal-Conditioned Supervised Learning for LLM Fine-Tuning
di: Li, Shijun, et al.
Pubblicazione: (2026)
di: Li, Shijun, et al.
Pubblicazione: (2026)
Fine-Tuning without Performance Degradation
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
di: Wang, Shumin, et al.
Pubblicazione: (2026)
di: Wang, Shumin, et al.
Pubblicazione: (2026)
Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning
di: Qiu, Xin, et al.
Pubblicazione: (2025)
di: Qiu, Xin, et al.
Pubblicazione: (2025)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
di: Chen, Jie, et al.
Pubblicazione: (2024)
di: Chen, Jie, et al.
Pubblicazione: (2024)
Diversity Optimization for Travelling Salesman Problem via Deep Reinforcement Learning
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
di: Hossain, Saad, et al.
Pubblicazione: (2025)
di: Hossain, Saad, et al.
Pubblicazione: (2025)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
di: Zhang, Zheng, et al.
Pubblicazione: (2024)
di: Zhang, Zheng, et al.
Pubblicazione: (2024)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
di: Kong, Lingxiao, et al.
Pubblicazione: (2025)
Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
di: Chen, Haoxian, et al.
Pubblicazione: (2024)
di: Chen, Haoxian, et al.
Pubblicazione: (2024)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
di: Qin, Chongli, et al.
Pubblicazione: (2025)
di: Qin, Chongli, et al.
Pubblicazione: (2025)
FedPFT: Federated Proxy Fine-Tuning of Foundation Models
di: Peng, Zhaopeng, et al.
Pubblicazione: (2024)
di: Peng, Zhaopeng, et al.
Pubblicazione: (2024)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
di: He, Zhongyu, et al.
Pubblicazione: (2026)
di: He, Zhongyu, et al.
Pubblicazione: (2026)
Origin Tracer: A Method for Detecting LoRA Fine-Tuning Origins in LLMs
di: Liang, Hongyu, et al.
Pubblicazione: (2025)
di: Liang, Hongyu, et al.
Pubblicazione: (2025)
Automated Federated Pipeline for Parameter-Efficient Fine-Tuning of Large Language Models
di: Fang, Zihan, et al.
Pubblicazione: (2024)
di: Fang, Zihan, et al.
Pubblicazione: (2024)
PERFT: Parameter-Efficient Routed Fine-Tuning for Mixture-of-Expert Model
di: Liu, Yilun, et al.
Pubblicazione: (2024)
di: Liu, Yilun, et al.
Pubblicazione: (2024)
Curriculum Negative Mining For Temporal Networks
di: Chen, Ziyue, et al.
Pubblicazione: (2024)
di: Chen, Ziyue, et al.
Pubblicazione: (2024)
Supervised Fine-Tuning as Inverse Reinforcement Learning
di: Sun, Hao
Pubblicazione: (2024)
di: Sun, Hao
Pubblicazione: (2024)
Representation Without Reward: A JEPA Audit for LLM Fine-Tuning
di: Sengupta, Biswa
Pubblicazione: (2026)
di: Sengupta, Biswa
Pubblicazione: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
di: Li, Qizheng, et al.
Pubblicazione: (2026)
di: Li, Qizheng, et al.
Pubblicazione: (2026)
Adaptive Ensembles of Fine-Tuned Transformers for LLM-Generated Text Detection
di: Lai, Zhixin, et al.
Pubblicazione: (2024)
di: Lai, Zhixin, et al.
Pubblicazione: (2024)
Implicit Federated In-context Learning For Task-Specific LLM Fine-Tuning
di: Li, Dongcheng, et al.
Pubblicazione: (2025)
di: Li, Dongcheng, et al.
Pubblicazione: (2025)
Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models
di: Zhang, Longteng, et al.
Pubblicazione: (2026)
di: Zhang, Longteng, et al.
Pubblicazione: (2026)
Rating Quality of Diverse Time Series Data by Meta-learning from LLM Judgment
di: Wu, Shunyu, et al.
Pubblicazione: (2025)
di: Wu, Shunyu, et al.
Pubblicazione: (2025)
Reinforcement Learning Fine-Tunes a Sparse Subnetwork in Large Language Models
di: Balashov, Andrii
Pubblicazione: (2025)
di: Balashov, Andrii
Pubblicazione: (2025)
Documenti analoghi
-
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
di: Zhang, Honglin, et al.
Pubblicazione: (2025) -
Learning to Segment for Vehicle Routing Problems
di: Ouyang, Wenbin, et al.
Pubblicazione: (2025) -
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
di: Ma, Hao, et al.
Pubblicazione: (2026) -
Learning-Guided Rolling Horizon Optimization for Long-Horizon Flexible Job-Shop Scheduling
di: Li, Sirui, et al.
Pubblicazione: (2025) -
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
di: Zeng, Xinyue, et al.
Pubblicazione: (2025)