Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Zixiang, Deng, Yihe, Yuan, Huizhuo, Ji, Kaixuan, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
RSPO: Regularized Self-Play Alignment of Large Language Models
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025)
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
Group Representational Position Encoding
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback with Active Queries
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time
von: Chen, Zixiang, et al.
Veröffentlicht: (2023)
von: Chen, Zixiang, et al.
Veröffentlicht: (2023)
Understanding Transferable Representation Learning and Zero-shot Transfer in CLIP
von: Chen, Zixiang, et al.
Veröffentlicht: (2023)
von: Chen, Zixiang, et al.
Veröffentlicht: (2023)
Tensor Product Attention Is All You Need
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
Improving Large Language Models with Concept-Aware Fine-Tuning
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
Large Language Models can be Strong Self-Detoxifiers
von: Ko, Ching-Yun, et al.
Veröffentlicht: (2024)
von: Ko, Ching-Yun, et al.
Veröffentlicht: (2024)
Boosting Large Language Models with Mask Fine-Tuning
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Mingyuan, et al.
Veröffentlicht: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
Fine-Tuning Improves Information Conveyance in Language Models
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
von: Gupta, Sonam, et al.
Veröffentlicht: (2024)
von: Gupta, Sonam, et al.
Veröffentlicht: (2024)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
Unintended Memorization of Sensitive Information in Fine-Tuned Language Models
von: Szep, Marton, et al.
Veröffentlicht: (2026)
von: Szep, Marton, et al.
Veröffentlicht: (2026)
G-Loss: Graph-Guided Fine-Tuning of Language Models
von: Sharma, Aditya, et al.
Veröffentlicht: (2026)
von: Sharma, Aditya, et al.
Veröffentlicht: (2026)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
von: Cheng, Jiale, et al.
Veröffentlicht: (2024)
Hyperbolic Fine-Tuning for Large Language Models
von: Yang, Menglin, et al.
Veröffentlicht: (2024)
von: Yang, Menglin, et al.
Veröffentlicht: (2024)
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
Causal Attention with Lookahead Keys
von: Song, Zhuoqing, et al.
Veröffentlicht: (2025)
von: Song, Zhuoqing, et al.
Veröffentlicht: (2025)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
von: Hong, Joey, et al.
Veröffentlicht: (2024)
von: Hong, Joey, et al.
Veröffentlicht: (2024)
Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning
von: Krishnan, Ranganath, et al.
Veröffentlicht: (2024)
von: Krishnan, Ranganath, et al.
Veröffentlicht: (2024)
BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes
von: Huang, Baichuan, et al.
Veröffentlicht: (2025)
von: Huang, Baichuan, et al.
Veröffentlicht: (2025)
Show Me How It's Done: The Role of Explanations in Fine-Tuning Language Models
von: Ballout, Mohamad, et al.
Veröffentlicht: (2024)
von: Ballout, Mohamad, et al.
Veröffentlicht: (2024)
Federated Data-Efficient Instruction Tuning for Large Language Models
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
von: Qin, Zhen, et al.
Veröffentlicht: (2024)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
von: Deng, Wei
Veröffentlicht: (2026)
von: Deng, Wei
Veröffentlicht: (2026)
DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models
von: Deng, Wenlong, et al.
Veröffentlicht: (2024)
von: Deng, Wenlong, et al.
Veröffentlicht: (2024)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
von: Agiza, Ahmed, et al.
Veröffentlicht: (2024)
von: Agiza, Ahmed, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024) -
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024) -
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023) -
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024) -
RSPO: Regularized Self-Play Alignment of Large Language Models
von: Tang, Xiaohang, et al.
Veröffentlicht: (2025)