IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shuai, Yang, Yaoming, Li, Bingdong, Hao, Hao, Zhou, Aimin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Relation Reasoning with LLMs in Expensive Optimization
di: Lu, Ye, et al.
Pubblicazione: (2026)
di: Lu, Ye, et al.
Pubblicazione: (2026)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
Expensive Multi-Objective Bayesian Optimization Based on Diffusion Models
di: Li, Bingdong, et al.
Pubblicazione: (2024)
di: Li, Bingdong, et al.
Pubblicazione: (2024)
DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
di: Xie, Xuan, et al.
Pubblicazione: (2025)
di: Xie, Xuan, et al.
Pubblicazione: (2025)
A Decoupled Basis-Vector-Driven Generative Framework for Dynamic Multi-Objective Optimization
di: Yang, Yaoming, et al.
Pubblicazione: (2026)
di: Yang, Yaoming, et al.
Pubblicazione: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
di: Zhang, Xichen, et al.
Pubblicazione: (2025)
SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
di: Jiang, Mei, et al.
Pubblicazione: (2025)
di: Jiang, Mei, et al.
Pubblicazione: (2025)
Context-aware Diversity Enhancement for Neural Multi-Objective Combinatorial Optimization
di: Lu, Yongfan, et al.
Pubblicazione: (2024)
di: Lu, Yongfan, et al.
Pubblicazione: (2024)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025)
di: Zhou, Renping, et al.
Pubblicazione: (2025)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research
di: Yue, Houping, et al.
Pubblicazione: (2026)
di: Yue, Houping, et al.
Pubblicazione: (2026)
EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms
di: Liu, WenTao, et al.
Pubblicazione: (2025)
di: Liu, WenTao, et al.
Pubblicazione: (2025)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network
di: Li, Bingdong, et al.
Pubblicazione: (2025)
di: Li, Bingdong, et al.
Pubblicazione: (2025)
ORCDF: An Oversmoothing-Resistant Cognitive Diagnosis Framework for Student Learning in Online Education Systems
di: Qian, Hong, et al.
Pubblicazione: (2024)
di: Qian, Hong, et al.
Pubblicazione: (2024)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
di: Cai, Yuzhu, et al.
Pubblicazione: (2026)
GRAPH-GRPO-LEX: Contract Graph Modeling and Reinforcement Learning with Group Relative Policy Optimization
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
di: Dechtiar, Moriya, et al.
Pubblicazione: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
di: Wang, Jingyi, et al.
Pubblicazione: (2026)
M$^{2}$GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit
di: Feng, Yukai, et al.
Pubblicazione: (2026)
di: Feng, Yukai, et al.
Pubblicazione: (2026)
A First Look at Kolmogorov-Arnold Networks in Surrogate-assisted Evolutionary Algorithms
di: Hao, Hao, et al.
Pubblicazione: (2024)
di: Hao, Hao, et al.
Pubblicazione: (2024)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
di: Chen, Minghan, et al.
Pubblicazione: (2025)
di: Chen, Minghan, et al.
Pubblicazione: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
AlignGroup: Learning and Aligning Group Consensus with Member Preferences for Group Recommendation
di: Xu, Jinfeng, et al.
Pubblicazione: (2024)
di: Xu, Jinfeng, et al.
Pubblicazione: (2024)
Evolutionary Reinforcement Learning based AI tutor for Socratic Interdisciplinary Instruction
di: Jiang, Mei, et al.
Pubblicazione: (2025)
di: Jiang, Mei, et al.
Pubblicazione: (2025)
LLM-Aligned Geographic Item Tokenization for Local-Life Recommendation
di: Jiang, Hao, et al.
Pubblicazione: (2025)
di: Jiang, Hao, et al.
Pubblicazione: (2025)
Dialogue Model Optimization via Agent Game and Adaptive Tree-based GRPO
di: Peng, Kun, et al.
Pubblicazione: (2026)
di: Peng, Kun, et al.
Pubblicazione: (2026)
VoiceGRPO: Modern MoE Transformers with Group Relative Policy Optimization GRPO for AI Voice Health Care Applications on Voice Pathology Detection
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2025)
di: Togootogtokh, Enkhtogtokh, et al.
Pubblicazione: (2025)
SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation
di: Zheng, Zaiyi, et al.
Pubblicazione: (2026)
di: Zheng, Zaiyi, et al.
Pubblicazione: (2026)
It's Morphing Time: Unleashing the Potential of Multiple LLMs via Multi-objective Optimization
di: Li, Bingdong, et al.
Pubblicazione: (2024)
di: Li, Bingdong, et al.
Pubblicazione: (2024)
MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
di: Ichihara, Yuki, et al.
Pubblicazione: (2025)
What is the Alignment Objective of GRPO?
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
di: Vojnovic, Milan, et al.
Pubblicazione: (2025)
SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
di: Zheng, Zhi, et al.
Pubblicazione: (2025)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Information-Consistent Language Model Recommendations through Group Relative Policy Optimization
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
di: Prabhune, Sonal, et al.
Pubblicazione: (2025)
Advancing LLM-Based Security Automation with Customized Group Relative Policy Optimization for Zero-Touch Networks
di: Cao, Xinye, et al.
Pubblicazione: (2025)
di: Cao, Xinye, et al.
Pubblicazione: (2025)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
Symbolic Cognitive Diagnosis via Hybrid Optimization for Intelligent Education Systems
di: Shen, Junhao, et al.
Pubblicazione: (2023)
di: Shen, Junhao, et al.
Pubblicazione: (2023)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
di: Bu, Yunhan, et al.
Pubblicazione: (2026)
di: Bu, Yunhan, et al.
Pubblicazione: (2026)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
di: Cang, Yueyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Relation Reasoning with LLMs in Expensive Optimization
di: Lu, Ye, et al.
Pubblicazione: (2026) -
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026) -
Expensive Multi-Objective Bayesian Optimization Based on Diffusion Models
di: Li, Bingdong, et al.
Pubblicazione: (2024) -
DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization
di: Xie, Xuan, et al.
Pubblicazione: (2025) -
A Decoupled Basis-Vector-Driven Generative Framework for Dynamic Multi-Objective Optimization
di: Yang, Yaoming, et al.
Pubblicazione: (2026)