Co-Evolving Policy Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gu, Naibin, Yang, Chenxu, Si, Qingyi, Qin, Chuanyu, Yao, Dingyu, Fu, Peng, Lin, Zheng, Wang, Weiping, Duan, Nan, Wang, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Near-Future Policy Optimization
par: Qin, Chuanyu, et autres
Publié: (2026)
par: Qin, Chuanyu, et autres
Publié: (2026)
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026)
par: Yang, Chenxu, et autres
Publié: (2026)
EasyVideoR1: Easier RL for Video Understanding
par: Qin, Chuanyu, et autres
Publié: (2026)
par: Qin, Chuanyu, et autres
Publié: (2026)
System 1&2 Synergy via Dynamic Model Interpolation
par: Yang, Chenxu, et autres
Publié: (2026)
par: Yang, Chenxu, et autres
Publié: (2026)
Are Large Language Models Table-based Fact-Checkers?
par: Zhang, Hanwen, et autres
Publié: (2024)
par: Zhang, Hanwen, et autres
Publié: (2024)
S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Orthogonal Finetuning for Direct Preference Optimization
par: Yang, Chenxu, et autres
Publié: (2024)
par: Yang, Chenxu, et autres
Publié: (2024)
Test-time Prompt Intervention
par: Yang, Chenxu, et autres
Publié: (2025)
par: Yang, Chenxu, et autres
Publié: (2025)
Online Self-Calibration Against Hallucination in Vision-Language Models
par: Chen, Minghui, et autres
Publié: (2026)
par: Chen, Minghui, et autres
Publié: (2026)
Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models
par: Liu, Xiyu, et autres
Publié: (2026)
par: Liu, Xiyu, et autres
Publié: (2026)
Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base Models
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
EvolveSignal: A Large Language Model Powered Coding Agent for Discovering Traffic Signal Control Strategies
par: Wang, Leizhen, et autres
Publié: (2025)
par: Wang, Leizhen, et autres
Publié: (2025)
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
par: Yang, Chenxu, et autres
Publié: (2025)
par: Yang, Chenxu, et autres
Publié: (2025)
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
par: Xia, Peng, et autres
Publié: (2026)
par: Xia, Peng, et autres
Publié: (2026)
Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?
par: Wang, Yatong, et autres
Publié: (2026)
par: Wang, Yatong, et autres
Publié: (2026)
Co-Evolving Latent Action World Models
par: Wang, Yucen, et autres
Publié: (2025)
par: Wang, Yucen, et autres
Publié: (2025)
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
par: Hou, Wenjin, et autres
Publié: (2026)
par: Hou, Wenjin, et autres
Publié: (2026)
CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization
par: Kwon, Soo Min, et autres
Publié: (2026)
par: Kwon, Soo Min, et autres
Publié: (2026)
Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning
par: Gu, Naibin, et autres
Publié: (2024)
par: Gu, Naibin, et autres
Publié: (2024)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
par: Li, Yibo, et autres
Publié: (2026)
par: Li, Yibo, et autres
Publié: (2026)
Stable Reinforcement Learning for Efficient Reasoning
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
par: Xia, Peng, et autres
Publié: (2026)
par: Xia, Peng, et autres
Publié: (2026)
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
par: Huang, Chenyu, et autres
Publié: (2026)
par: Huang, Chenyu, et autres
Publié: (2026)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
par: Zhao, Hanyang, et autres
Publié: (2026)
par: Zhao, Hanyang, et autres
Publié: (2026)
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
par: Yang, Xuewei, et autres
Publié: (2026)
par: Yang, Xuewei, et autres
Publié: (2026)
Contrastive Sequential Interaction Network Learning on Co-Evolving Riemannian Spaces
par: Sun, Li, et autres
Publié: (2024)
par: Sun, Li, et autres
Publié: (2024)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
par: Wu, Wenbo, et autres
Publié: (2025)
par: Wu, Wenbo, et autres
Publié: (2025)
Extreme Region Policy Distillation
par: Chen, Changyu, et autres
Publié: (2026)
par: Chen, Changyu, et autres
Publié: (2026)
A Closer Look into LLMs for Table Understanding
par: Wang, Jia, et autres
Publié: (2026)
par: Wang, Jia, et autres
Publié: (2026)
One-Way Policy Optimization for Self-Evolving LLMs
par: Yang, Shuo, et autres
Publié: (2026)
par: Yang, Shuo, et autres
Publié: (2026)
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
par: Yao, Dingyu, et autres
Publié: (2025)
par: Yao, Dingyu, et autres
Publié: (2025)
TTAQ: Towards Stable Post-training Quantization in Continuous Domain Adaptation
par: Xiao, Junrui, et autres
Publié: (2024)
par: Xiao, Junrui, et autres
Publié: (2024)
Trust Region On-Policy Distillation
par: Xing, Xingrun, et autres
Publié: (2026)
par: Xing, Xingrun, et autres
Publié: (2026)
Evolving Diffusion and Flow Matching Policies for Online Reinforcement Learning
par: Zhang, Chubin, et autres
Publié: (2025)
par: Zhang, Chubin, et autres
Publié: (2025)
A Multi-Task Role-Playing Agent Capable of Imitating Character Linguistic Styles
par: Chen, Siyuan, et autres
Publié: (2024)
par: Chen, Siyuan, et autres
Publié: (2024)
Documents similaires
-
Near-Future Policy Optimization
par: Qin, Chuanyu, et autres
Publié: (2026) -
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026) -
EasyVideoR1: Easier RL for Video Understanding
par: Qin, Chuanyu, et autres
Publié: (2026) -
System 1&2 Synergy via Dynamic Model Interpolation
par: Yang, Chenxu, et autres
Publié: (2026) -
Are Large Language Models Table-based Fact-Checkers?
par: Zhang, Hanwen, et autres
Publié: (2024)