AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
Fuente:
arXiv
Salvato in:
| Autori principali: | Cai, Yuzhu, Liu, Zexi, Zhu, Xinyu, Wang, Cheng, Wang, Yanfeng, Chen, Siheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
di: Liu, Zexi, et al.
Pubblicazione: (2025)
di: Liu, Zexi, et al.
Pubblicazione: (2025)
ML-Master: Towards AI-for-AI via Integration of Exploration and Reasoning
di: Liu, Zexi, et al.
Pubblicazione: (2025)
di: Liu, Zexi, et al.
Pubblicazione: (2025)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025)
di: Zhou, Renping, et al.
Pubblicazione: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
di: Chen, Minghan, et al.
Pubblicazione: (2025)
di: Chen, Minghan, et al.
Pubblicazione: (2025)
UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
di: Wang, Jiaqi, et al.
Pubblicazione: (2026)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
di: Xie, Xuan, et al.
Pubblicazione: (2025)
di: Xie, Xuan, et al.
Pubblicazione: (2025)
DataMaster: Data-Centric Autonomous AI Research
di: Du, Yaxin, et al.
Pubblicazione: (2026)
di: Du, Yaxin, et al.
Pubblicazione: (2026)
Hypergraph Transformer for Semi-Supervised Classification
di: Liu, Zexi, et al.
Pubblicazione: (2023)
di: Liu, Zexi, et al.
Pubblicazione: (2023)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
di: Jia, Xu
Pubblicazione: (2025)
di: Jia, Xu
Pubblicazione: (2025)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
di: Mundada, Gagan, et al.
Pubblicazione: (2026)
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
GRPO-GCC: Enhancing Cooperation in Spatial Public Goods Games via Group Relative Policy Optimization with Global Cooperation Constraint
di: Yang, Zhaoqilin, et al.
Pubblicazione: (2025)
di: Yang, Zhaoqilin, et al.
Pubblicazione: (2025)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
di: Du, Yaxin, et al.
Pubblicazione: (2025)
di: Du, Yaxin, et al.
Pubblicazione: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
di: Wang, Shuai, et al.
Pubblicazione: (2026)
di: Wang, Shuai, et al.
Pubblicazione: (2026)
MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
B-GRPO: Unsupervised Speech Emotion Recognition based on Batched-Group Relative Policy Optimization
di: Gao, Yingying, et al.
Pubblicazione: (2026)
di: Gao, Yingying, et al.
Pubblicazione: (2026)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization
di: Kwon, Soo Min, et al.
Pubblicazione: (2026)
di: Kwon, Soo Min, et al.
Pubblicazione: (2026)
Decentralized and Lifelong-Adaptive Multi-Agent Collaborative Learning
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
di: Du, Yuwen, et al.
Pubblicazione: (2026)
di: Du, Yuwen, et al.
Pubblicazione: (2026)
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
di: Du, Yuwen, et al.
Pubblicazione: (2026)
di: Du, Yuwen, et al.
Pubblicazione: (2026)
VoiceGRPO: Modern MoE Transformers with Group Relative Policy Optimization GRPO for AI Voice Health Care Applications on Voice Pathology Detection
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2025)
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2025)
OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
Training-Free Message Passing for Learning on Hypergraphs
di: Tang, Bohan, et al.
Pubblicazione: (2024)
di: Tang, Bohan, et al.
Pubblicazione: (2024)
Ethical-Lens: Curbing Malicious Usages of Open-Source Text-to-Image Models
di: Cai, Yuzhu, et al.
Pubblicazione: (2024)
di: Cai, Yuzhu, et al.
Pubblicazione: (2024)
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
di: Li, Baoteng, et al.
Pubblicazione: (2026)
di: Li, Baoteng, et al.
Pubblicazione: (2026)
FedGRPO: Privately Optimizing Foundation Models with Group-Relative Rewards from Domain Client
di: Zhu, Gongxi, et al.
Pubblicazione: (2026)
di: Zhu, Gongxi, et al.
Pubblicazione: (2026)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
di: Wang, Zhichao
Pubblicazione: (2025)
di: Wang, Zhichao
Pubblicazione: (2025)
Reasoning Models Ace the CFA Exams
di: Patel, Jaisal, et al.
Pubblicazione: (2025)
di: Patel, Jaisal, et al.
Pubblicazione: (2025)
Training-Free Group Relative Policy Optimization
di: Cai, Yuzheng, et al.
Pubblicazione: (2025)
di: Cai, Yuzheng, et al.
Pubblicazione: (2025)
ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning
di: Wang, Yunhao, et al.
Pubblicazione: (2025)
di: Wang, Yunhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering
di: Zhu, Xinyu, et al.
Pubblicazione: (2026) -
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
di: Liu, Zexi, et al.
Pubblicazione: (2025) -
ML-Master: Towards AI-for-AI via Integration of Exploration and Reasoning
di: Liu, Zexi, et al.
Pubblicazione: (2025) -
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025) -
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)