Goal-Conditioned Supervised Learning for LLM Fine-Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Shijun, Dong, Kaiwen, Gao, Xiang, Ghosh, Joydeep |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Goal-Conditioned Supervised Learning for Multi-Objective Recommendation
par: Li, Shijun, et autres
Publié: (2024)
par: Li, Shijun, et autres
Publié: (2024)
OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration
par: Li, Shijun, et autres
Publié: (2025)
par: Li, Shijun, et autres
Publié: (2025)
RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation
par: Li, Shijun, et autres
Publié: (2026)
par: Li, Shijun, et autres
Publié: (2026)
Alignment Dynamics in LLM Fine-Tuning
par: Huang, Yuhan, et autres
Publié: (2026)
par: Huang, Yuhan, et autres
Publié: (2026)
Rotation-Preserving Supervised Fine-Tuning
par: Jin, Hangzhan, et autres
Publié: (2026)
par: Jin, Hangzhan, et autres
Publié: (2026)
Autonomous Learning From Success and Failure: Goal-Conditioned Supervised Learning with Negative Feedback
par: Zhang, Zeqiang, et autres
Publié: (2025)
par: Zhang, Zeqiang, et autres
Publié: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
par: Zhao, Qinghua, et autres
Publié: (2026)
par: Zhao, Qinghua, et autres
Publié: (2026)
Implicit Federated In-context Learning For Task-Specific LLM Fine-Tuning
par: Li, Dongcheng, et autres
Publié: (2025)
par: Li, Dongcheng, et autres
Publié: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)
par: Qin, Chongli, et autres
Publié: (2025)
par: Qin, Chongli, et autres
Publié: (2025)
SVFT: Parameter-Efficient Fine-Tuning with Singular Vectors
par: Lingam, Vijay, et autres
Publié: (2024)
par: Lingam, Vijay, et autres
Publié: (2024)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024)
par: Li, Ziniu, et autres
Publié: (2024)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Backward Learning for Goal-Conditioned Policies
par: Höftmann, Marc, et autres
Publié: (2023)
par: Höftmann, Marc, et autres
Publié: (2023)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025)
par: Xu, Kaixuan, et autres
Publié: (2025)
Unlock the Correlation between Supervised Fine-Tuning and Reinforcement Learning in Training Code Large Language Models
par: Chen, Jie, et autres
Publié: (2024)
par: Chen, Jie, et autres
Publié: (2024)
ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
HIQL: Offline Goal-Conditioned RL with Latent States as Actions
par: Park, Seohong, et autres
Publié: (2023)
par: Park, Seohong, et autres
Publié: (2023)
Goal Exploration via Adaptive Skill Distribution for Goal-Conditioned Reinforcement Learning
par: Wu, Lisheng, et autres
Publié: (2024)
par: Wu, Lisheng, et autres
Publié: (2024)
Proposing Hierarchical Goal-Conditioned Policy Planning in Multi-Goal Reinforcement Learning
par: Rens, Gavin B.
Publié: (2025)
par: Rens, Gavin B.
Publié: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
par: Li, Xiaomin, et autres
Publié: (2024)
par: Li, Xiaomin, et autres
Publié: (2024)
SVL: Goal-Conditioned Reinforcement Learning as Survival Learning
par: Tiofack, Franki Nguimatsia, et autres
Publié: (2026)
par: Tiofack, Franki Nguimatsia, et autres
Publié: (2026)
Abstraction for Offline Goal-Conditioned Reinforcement Learning
par: Wibault, Clarisse, et autres
Publié: (2026)
par: Wibault, Clarisse, et autres
Publié: (2026)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning
par: Liu, Siyuan, et autres
Publié: (2026)
par: Liu, Siyuan, et autres
Publié: (2026)
Goal-Conditioned Agents that Learn Everything All at Once
par: Matthews, Michael, et autres
Publié: (2026)
par: Matthews, Michael, et autres
Publié: (2026)
Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning
par: Zhang, Minmin, et autres
Publié: (2026)
par: Zhang, Minmin, et autres
Publié: (2026)
Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning
par: Zheng, Han, et autres
Publié: (2026)
par: Zheng, Han, et autres
Publié: (2026)
Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies
par: Schweighofer, Kajetan, et autres
Publié: (2026)
par: Schweighofer, Kajetan, et autres
Publié: (2026)
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
par: Zeng, Xinyue, et autres
Publié: (2025)
par: Zeng, Xinyue, et autres
Publié: (2025)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
par: Zhang, Wenhao, et autres
Publié: (2025)
par: Zhang, Wenhao, et autres
Publié: (2025)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
par: Li, Qizheng, et autres
Publié: (2026)
par: Li, Qizheng, et autres
Publié: (2026)
Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective
par: Fernando, Heshan, et autres
Publié: (2024)
par: Fernando, Heshan, et autres
Publié: (2024)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
par: Kim, Gyuhak, et autres
Publié: (2025)
par: Kim, Gyuhak, et autres
Publié: (2025)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
par: Hossain, Saad, et autres
Publié: (2025)
par: Hossain, Saad, et autres
Publié: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Null Counterfactual Factor Interactions for Goal-Conditioned Reinforcement Learning
par: Chuck, Caleb, et autres
Publié: (2025)
par: Chuck, Caleb, et autres
Publié: (2025)
Goal-Conditioned Reinforcement Learning for Data-Driven Maritime Navigation
par: Vaidheeswaran, Vaishnav, et autres
Publié: (2025)
par: Vaidheeswaran, Vaishnav, et autres
Publié: (2025)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
par: Chen, Haoxian, et autres
Publié: (2024)
par: Chen, Haoxian, et autres
Publié: (2024)
Documents similaires
-
Goal-Conditioned Supervised Learning for Multi-Objective Recommendation
par: Li, Shijun, et autres
Publié: (2024) -
OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration
par: Li, Shijun, et autres
Publié: (2025) -
RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation
par: Li, Shijun, et autres
Publié: (2026) -
Alignment Dynamics in LLM Fine-Tuning
par: Huang, Yuhan, et autres
Publié: (2026) -
Rotation-Preserving Supervised Fine-Tuning
par: Jin, Hangzhan, et autres
Publié: (2026)