Training-Free Group Relative Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Cai, Yuzheng, Cai, Siqi, Shi, Yuchen, Xu, Zihan, Chen, Lichao, Qin, Yulei, Tan, Xiaoyu, Li, Gang, Li, Zongyi, Lin, Haojia, Mao, Yong, Li, Ke, Sun, Xing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
di: Shi, Yuchen, et al.
Pubblicazione: (2025)
di: Shi, Yuchen, et al.
Pubblicazione: (2025)
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
di: Lin, Haojia, et al.
Pubblicazione: (2025)
di: Lin, Haojia, et al.
Pubblicazione: (2025)
Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
di: Qin, Yulei, et al.
Pubblicazione: (2025)
di: Qin, Yulei, et al.
Pubblicazione: (2025)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
di: Qin, Yulei, et al.
Pubblicazione: (2025)
di: Qin, Yulei, et al.
Pubblicazione: (2025)
RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
FlowAgent: Achieving Compliance and Flexibility for Workflow Agents
di: Shi, Yuchen, et al.
Pubblicazione: (2025)
di: Shi, Yuchen, et al.
Pubblicazione: (2025)
Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models
di: Qin, Yulei, et al.
Pubblicazione: (2024)
di: Qin, Yulei, et al.
Pubblicazione: (2024)
LTD-Bench: Evaluating Large Language Models by Letting Them Draw
di: Lin, Liuhao, et al.
Pubblicazione: (2025)
di: Lin, Liuhao, et al.
Pubblicazione: (2025)
Leveraging Open Knowledge for Advancing Task Expertise in Large Language Models
di: Yang, Yuncheng, et al.
Pubblicazione: (2024)
di: Yang, Yuncheng, et al.
Pubblicazione: (2024)
Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
Filtered Approximate Nearest Neighbor Search: A Unified Benchmark and Systematic Experimental Study [Experiment, Analysis & Benchmark]
di: Shi, Jiayang, et al.
Pubblicazione: (2025)
di: Shi, Jiayang, et al.
Pubblicazione: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
di: Mroueh, Youssef, et al.
Pubblicazione: (2025)
EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference
di: Qian, Yulei, et al.
Pubblicazione: (2024)
di: Qian, Yulei, et al.
Pubblicazione: (2024)
Improving DAPO from a Mixed-Policy Perspective
di: Tan, Hongze, et al.
Pubblicazione: (2025)
di: Tan, Hongze, et al.
Pubblicazione: (2025)
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
di: Li, Jiacheng, et al.
Pubblicazione: (2026)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
di: Deng, Wenlong, et al.
Pubblicazione: (2025)
di: Deng, Wenlong, et al.
Pubblicazione: (2025)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
di: Han, Kevin, et al.
Pubblicazione: (2026)
di: Han, Kevin, et al.
Pubblicazione: (2026)
Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
di: Cui, Xiao, et al.
Pubblicazione: (2025)
di: Cui, Xiao, et al.
Pubblicazione: (2025)
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
di: Li, Shaolong, et al.
Pubblicazione: (2026)
di: Li, Shaolong, et al.
Pubblicazione: (2026)
Sinkhorn Distance Minimization for Knowledge Distillation
di: Cui, Xiao, et al.
Pubblicazione: (2024)
di: Cui, Xiao, et al.
Pubblicazione: (2024)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
NGRPO: Negative-enhanced Group Relative Policy Optimization
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
di: Nan, Gongrui, et al.
Pubblicazione: (2025)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation
di: He, Xixiang, et al.
Pubblicazione: (2026)
di: He, Xixiang, et al.
Pubblicazione: (2026)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
di: Lin, Zhihang, et al.
Pubblicazione: (2025)
di: Lin, Zhihang, et al.
Pubblicazione: (2025)
Constrained Group Relative Policy Optimization
di: Girgis, Roger, et al.
Pubblicazione: (2026)
di: Girgis, Roger, et al.
Pubblicazione: (2026)
Group-in-Group Policy Optimization for LLM Agent Training
di: Feng, Lang, et al.
Pubblicazione: (2025)
di: Feng, Lang, et al.
Pubblicazione: (2025)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
di: Nie, Ming, et al.
Pubblicazione: (2026)
di: Nie, Ming, et al.
Pubblicazione: (2026)
Multi-Agentic AI for Conflict-Aware rApp Policy Orchestration in Open RAN
di: Li, Haiyuan, et al.
Pubblicazione: (2026)
di: Li, Haiyuan, et al.
Pubblicazione: (2026)
Chalcogen‐Bonding‐Enabled, Light‐Driven Decarboxylative Oxygenation of Amino Acid Derivatives and Short Peptides Using O 2
di: Yuzheng Li, et al.
Pubblicazione: (2025)
di: Yuzheng Li, et al.
Pubblicazione: (2025)
Spatiotemporal analysis of global grain trade multilayer networks considering topological clustering
di: Youjun Tu, et al.
Pubblicazione: (2024)
di: Youjun Tu, et al.
Pubblicazione: (2024)
Improving the prediction of the 3 July 2019 Kaiyuan tornadic supercell and embedded tornado with radar and surface data assimilation
di: Haojia Li, et al.
Pubblicazione: (2026)
di: Haojia Li, et al.
Pubblicazione: (2026)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Decoding Listeners Identity: Person Identification from EEG Signals Using a Lightweight Spiking Transformer
di: Lin, Zheyuan, et al.
Pubblicazione: (2025)
di: Lin, Zheyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
di: Shi, Yuchen, et al.
Pubblicazione: (2025) -
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2025) -
CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent
di: Lin, Haojia, et al.
Pubblicazione: (2025) -
Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
di: Qin, Yulei, et al.
Pubblicazione: (2025) -
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
di: Qin, Yulei, et al.
Pubblicazione: (2025)