Self-Evolution Fine-Tuning for Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Ruijun, Liang, Jiehao, Gao, Shiping, Wan, Fanqi, Quan, Xiaojun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BlockPruner: Fine-grained Pruning for Large Language Models
di: Zhong, Longguang, et al.
Pubblicazione: (2024)
di: Zhong, Longguang, et al.
Pubblicazione: (2024)
Discriminative Policy Optimization for Token-Level Reward Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
di: Gao, Shiping, et al.
Pubblicazione: (2025)
di: Gao, Shiping, et al.
Pubblicazione: (2025)
FuseChat: Knowledge Fusion of Chat Models
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
Stabilizing Policy Optimization via Logits Convexity
di: Chen, Hongzhan, et al.
Pubblicazione: (2026)
di: Chen, Hongzhan, et al.
Pubblicazione: (2026)
FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
di: Zhong, Longguang, et al.
Pubblicazione: (2025)
di: Zhong, Longguang, et al.
Pubblicazione: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
di: Yang, Ziyi, et al.
Pubblicazione: (2024)
di: Yang, Ziyi, et al.
Pubblicazione: (2024)
FuseChat-3.0: Preference Optimization Meets Heterogeneous Model Fusion
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
di: Yang, Ziyi, et al.
Pubblicazione: (2025)
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
di: Gao, Shiping, et al.
Pubblicazione: (2026)
di: Gao, Shiping, et al.
Pubblicazione: (2026)
ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
di: Liu, Tianjian, et al.
Pubblicazione: (2025)
di: Liu, Tianjian, et al.
Pubblicazione: (2025)
Knowledge Fusion of Chat LLMs: A Preliminary Technical Report
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
Knowledge Fusion of Large Language Models
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
Knowledge Verification to Nip Hallucination in the Bud
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
di: Wan, Fanqi, et al.
Pubblicazione: (2024)
Lookahead Routing for Large Language Models
di: Huang, Canbin, et al.
Pubblicazione: (2025)
di: Huang, Canbin, et al.
Pubblicazione: (2025)
Knowledge Distillation of Black-Box Large Language Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
di: Zhou, Han, et al.
Pubblicazione: (2025)
di: Zhou, Han, et al.
Pubblicazione: (2025)
ProFuser: Progressive Fusion of Large Language Models
di: Shi, Tianyuan, et al.
Pubblicazione: (2024)
di: Shi, Tianyuan, et al.
Pubblicazione: (2024)
DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization
di: Liu, Xuefeng, et al.
Pubblicazione: (2025)
di: Liu, Xuefeng, et al.
Pubblicazione: (2025)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
di: Zhang, Xu, et al.
Pubblicazione: (2024)
di: Zhang, Xu, et al.
Pubblicazione: (2024)
Evaluating, Understanding, and Improving Constrained Text Generation for Large Language Models
di: Chen, Xiang, et al.
Pubblicazione: (2023)
di: Chen, Xiang, et al.
Pubblicazione: (2023)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning
di: Yang, Zhaorui, et al.
Pubblicazione: (2024)
di: Yang, Zhaorui, et al.
Pubblicazione: (2024)
Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
di: Alhazmi, Elaf, et al.
Pubblicazione: (2026)
di: Alhazmi, Elaf, et al.
Pubblicazione: (2026)
Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models
di: Li, Bozhou, et al.
Pubblicazione: (2024)
di: Li, Bozhou, et al.
Pubblicazione: (2024)
Zero-Shot Cross-Domain Code Search without Fine-Tuning
di: Liang, Keyu, et al.
Pubblicazione: (2025)
di: Liang, Keyu, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning
di: Shi, Wenhang, et al.
Pubblicazione: (2026)
di: Shi, Wenhang, et al.
Pubblicazione: (2026)
Optimizing Soft Prompt Tuning via Structural Evolution
di: Huang, Zhenzhen, et al.
Pubblicazione: (2026)
di: Huang, Zhenzhen, et al.
Pubblicazione: (2026)
ThinkSwitcher: When to Think Hard, When to Think Fast
di: Liang, Guosheng, et al.
Pubblicazione: (2025)
di: Liang, Guosheng, et al.
Pubblicazione: (2025)
TPP-LLM: Modeling Temporal Point Processes by Efficiently Fine-Tuning Large Language Models
di: Liu, Zefang, et al.
Pubblicazione: (2024)
di: Liu, Zefang, et al.
Pubblicazione: (2024)
One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
di: Ming, Rui, et al.
Pubblicazione: (2025)
di: Ming, Rui, et al.
Pubblicazione: (2025)
Evaluating Self-Generated Documents for Enhancing Retrieval-Augmented Generation with Large Language Models
di: Li, Jiatao, et al.
Pubblicazione: (2024)
di: Li, Jiatao, et al.
Pubblicazione: (2024)
DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment
di: Zhu, Liang, et al.
Pubblicazione: (2026)
di: Zhu, Liang, et al.
Pubblicazione: (2026)
Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models
di: Gupta, Sonam, et al.
Pubblicazione: (2025)
di: Gupta, Sonam, et al.
Pubblicazione: (2025)
Using LLMs for Automated Privacy Policy Analysis: Prompt Engineering, Fine-Tuning and Explainability
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
di: Chen, Yuxin, et al.
Pubblicazione: (2025)
Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Who Writes What: Unveiling the Impact of Author Roles on AI-generated Text Detection
di: Li, Jiatao, et al.
Pubblicazione: (2025)
di: Li, Jiatao, et al.
Pubblicazione: (2025)
HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
di: Wang, Weixuan, et al.
Pubblicazione: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024)
di: Lang, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
BlockPruner: Fine-grained Pruning for Large Language Models
di: Zhong, Longguang, et al.
Pubblicazione: (2024) -
Discriminative Policy Optimization for Token-Level Reward Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2025) -
Advantage-Guided Distillation for Preference Alignment in Small Language Models
di: Gao, Shiping, et al.
Pubblicazione: (2025) -
FuseChat: Knowledge Fusion of Chat Models
di: Wan, Fanqi, et al.
Pubblicazione: (2024) -
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
di: Yang, Ziyi, et al.
Pubblicazione: (2025)