AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Yuzhu, Liu, Zexi, Zhu, Xinyu, Wang, Cheng, Wang, Yanfeng, Chen, Siheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering
par: Zhu, Xinyu, et autres
Publié: (2026)
par: Zhu, Xinyu, et autres
Publié: (2026)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
par: Liu, Zexi, et autres
Publié: (2025)
par: Liu, Zexi, et autres
Publié: (2025)
ML-Master: Towards AI-for-AI via Integration of Exploration and Reasoning
par: Liu, Zexi, et autres
Publié: (2025)
par: Liu, Zexi, et autres
Publié: (2025)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
par: Zhou, Renping, et autres
Publié: (2025)
par: Zhou, Renping, et autres
Publié: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
par: Wang, Jingyi, et autres
Publié: (2026)
par: Wang, Jingyi, et autres
Publié: (2026)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
par: Chen, Minghan, et autres
Publié: (2025)
par: Chen, Minghan, et autres
Publié: (2025)
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
par: Deng, Jingcheng, et autres
Publié: (2026)
par: Deng, Jingcheng, et autres
Publié: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
par: Dechtiar, Moriya, et autres
Publié: (2025)
par: Dechtiar, Moriya, et autres
Publié: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
par: Cang, Yueyang, et autres
Publié: (2026)
par: Cang, Yueyang, et autres
Publié: (2026)
DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
par: Xie, Xuan, et autres
Publié: (2025)
par: Xie, Xuan, et autres
Publié: (2025)
DataMaster: Data-Centric Autonomous AI Research
par: Du, Yaxin, et autres
Publié: (2026)
par: Du, Yaxin, et autres
Publié: (2026)
Hypergraph Transformer for Semi-Supervised Classification
par: Liu, Zexi, et autres
Publié: (2023)
par: Liu, Zexi, et autres
Publié: (2023)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
par: Kim, Youngeun
Publié: (2026)
par: Kim, Youngeun
Publié: (2026)
Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
par: Jia, Xu
Publié: (2025)
par: Jia, Xu
Publié: (2025)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
par: Mundada, Gagan, et autres
Publié: (2026)
par: Mundada, Gagan, et autres
Publié: (2026)
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
par: Surana, Rohan, et autres
Publié: (2026)
par: Surana, Rohan, et autres
Publié: (2026)
GRPO-GCC: Enhancing Cooperation in Spatial Public Goods Games via Group Relative Policy Optimization with Global Cooperation Constraint
par: Yang, Zhaoqilin, et autres
Publié: (2025)
par: Yang, Zhaoqilin, et autres
Publié: (2025)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
par: Du, Yaxin, et autres
Publié: (2025)
par: Du, Yaxin, et autres
Publié: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
par: Zhong, Haitian, et autres
Publié: (2026)
par: Zhong, Haitian, et autres
Publié: (2026)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems
par: Ichihara, Yuki, et autres
Publié: (2025)
par: Ichihara, Yuki, et autres
Publié: (2025)
B-GRPO: Unsupervised Speech Emotion Recognition based on Batched-Group Relative Policy Optimization
par: Gao, Yingying, et autres
Publié: (2026)
par: Gao, Yingying, et autres
Publié: (2026)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
par: Yu, Song, et autres
Publié: (2026)
par: Yu, Song, et autres
Publié: (2026)
CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization
par: Kwon, Soo Min, et autres
Publié: (2026)
par: Kwon, Soo Min, et autres
Publié: (2026)
Decentralized and Lifelong-Adaptive Multi-Agent Collaborative Learning
par: Tang, Shuo, et autres
Publié: (2024)
par: Tang, Shuo, et autres
Publié: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
par: Du, Yuwen, et autres
Publié: (2026)
par: Du, Yuwen, et autres
Publié: (2026)
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
par: Du, Yuwen, et autres
Publié: (2026)
par: Du, Yuwen, et autres
Publié: (2026)
VoiceGRPO: Modern MoE Transformers with Group Relative Policy Optimization GRPO for AI Voice Health Care Applications on Voice Pathology Detection
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2025)
par: Togootogtokh, Enkhtogtokh, et autres
Publié: (2025)
OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning
par: Ye, Rui, et autres
Publié: (2024)
par: Ye, Rui, et autres
Publié: (2024)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
par: Ye, Rui, et autres
Publié: (2024)
par: Ye, Rui, et autres
Publié: (2024)
Training-Free Message Passing for Learning on Hypergraphs
par: Tang, Bohan, et autres
Publié: (2024)
par: Tang, Bohan, et autres
Publié: (2024)
Ethical-Lens: Curbing Malicious Usages of Open-Source Text-to-Image Models
par: Cai, Yuzhu, et autres
Publié: (2024)
par: Cai, Yuzhu, et autres
Publié: (2024)
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
par: Li, Baoteng, et autres
Publié: (2026)
par: Li, Baoteng, et autres
Publié: (2026)
FedGRPO: Privately Optimizing Foundation Models with Group-Relative Rewards from Domain Client
par: Zhu, Gongxi, et autres
Publié: (2026)
par: Zhu, Gongxi, et autres
Publié: (2026)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
par: Wang, Zhichao
Publié: (2025)
par: Wang, Zhichao
Publié: (2025)
Reasoning Models Ace the CFA Exams
par: Patel, Jaisal, et autres
Publié: (2025)
par: Patel, Jaisal, et autres
Publié: (2025)
Training-Free Group Relative Policy Optimization
par: Cai, Yuzheng, et autres
Publié: (2025)
par: Cai, Yuzheng, et autres
Publié: (2025)
ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning
par: Wang, Yunhao, et autres
Publié: (2025)
par: Wang, Yunhao, et autres
Publié: (2025)
Documents similaires
-
Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering
par: Zhu, Xinyu, et autres
Publié: (2026) -
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
par: Liu, Zexi, et autres
Publié: (2025) -
ML-Master: Towards AI-for-AI via Integration of Exploration and Reasoning
par: Liu, Zexi, et autres
Publié: (2025) -
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
par: Zhou, Renping, et autres
Publié: (2025) -
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)