Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Xiaoying, Zhang, Yipeng, Sun, Hao, Feng, Kaituo, Lu, Chaochao, Yang, Chao, Meng, Helen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
von: Zhang, Kaituo, et al.
Veröffentlicht: (2026)
von: Zhang, Kaituo, et al.
Veröffentlicht: (2026)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
von: Chen, Hao-Yuan
Veröffentlicht: (2026)
von: Chen, Hao-Yuan
Veröffentlicht: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025)
iGRPO: Self-Feedback-Driven LLM Reasoning
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)
Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization
von: Wei, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wei, Jiaqi, et al.
Veröffentlicht: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
von: Ke, Pei, et al.
Veröffentlicht: (2023)
von: Ke, Pei, et al.
Veröffentlicht: (2023)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
von: Zhang, Xichen, et al.
Veröffentlicht: (2025)
Adapting LLM Agents with Universal Feedback in Communication
von: Wang, Kuan, et al.
Veröffentlicht: (2023)
von: Wang, Kuan, et al.
Veröffentlicht: (2023)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2026)
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2026)
The Critique of Critique
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
Text2Grad: Reinforcement Learning from Natural Language Feedback
von: Wang, Hanyang, et al.
Veröffentlicht: (2025)
von: Wang, Hanyang, et al.
Veröffentlicht: (2025)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
von: Chen, Sirui, et al.
Veröffentlicht: (2026)
von: Chen, Sirui, et al.
Veröffentlicht: (2026)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
von: Pennino, Federico, et al.
Veröffentlicht: (2025)
von: Pennino, Federico, et al.
Veröffentlicht: (2025)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
von: Dai, Yanqi, et al.
Veröffentlicht: (2026)
von: Dai, Yanqi, et al.
Veröffentlicht: (2026)
Advancing Sequential Numerical Prediction in Autoregressive Models
von: Fei, Xiang, et al.
Veröffentlicht: (2025)
von: Fei, Xiang, et al.
Veröffentlicht: (2025)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
Language-Guided Tuning: Enhancing Numeric Optimization with Textual Feedback
von: Lu, Yuxing, et al.
Veröffentlicht: (2025)
von: Lu, Yuxing, et al.
Veröffentlicht: (2025)
Can Post-Training Transform LLMs into Causal Reasoners?
von: Chen, Junqi, et al.
Veröffentlicht: (2026)
von: Chen, Junqi, et al.
Veröffentlicht: (2026)
GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO
von: Dipta, Shubhashis Roy, et al.
Veröffentlicht: (2026)
von: Dipta, Shubhashis Roy, et al.
Veröffentlicht: (2026)
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
von: Lv, Qitan, et al.
Veröffentlicht: (2026)
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
von: Huang, Lei, et al.
Veröffentlicht: (2026)
von: Huang, Lei, et al.
Veröffentlicht: (2026)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2023)
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2023)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
von: Shen, Wei, et al.
Veröffentlicht: (2024)
von: Shen, Wei, et al.
Veröffentlicht: (2024)
System-Level Natural Language Feedback
von: Yuan, Weizhe, et al.
Veröffentlicht: (2023)
von: Yuan, Weizhe, et al.
Veröffentlicht: (2023)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
von: Wang, Ruida, et al.
Veröffentlicht: (2025)
ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
von: Zhang, Yize, et al.
Veröffentlicht: (2025)
von: Zhang, Yize, et al.
Veröffentlicht: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
von: Cao, Meng, et al.
Veröffentlicht: (2024)
von: Cao, Meng, et al.
Veröffentlicht: (2024)
ExGRPO: Learning to Reason from Experience
von: Zhan, Runzhe, et al.
Veröffentlicht: (2025)
von: Zhan, Runzhe, et al.
Veröffentlicht: (2025)
Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents
von: Li, Zelong, et al.
Veröffentlicht: (2024)
von: Li, Zelong, et al.
Veröffentlicht: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
von: Yu, Yue, et al.
Veröffentlicht: (2024)
von: Yu, Yue, et al.
Veröffentlicht: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
von: Wang, Jun, et al.
Veröffentlicht: (2024)
von: Wang, Jun, et al.
Veröffentlicht: (2024)
MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison Feedback
von: Yao, Zonghai, et al.
Veröffentlicht: (2024)
von: Yao, Zonghai, et al.
Veröffentlicht: (2024)
CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning
von: Zhu, Xinyu, et al.
Veröffentlicht: (2026)
von: Zhu, Xinyu, et al.
Veröffentlicht: (2026)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
von: Zhu, Fengbin, et al.
Veröffentlicht: (2024)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
von: Lin, Zicheng, et al.
Veröffentlicht: (2024)
von: Lin, Zicheng, et al.
Veröffentlicht: (2024)
Advancing LLM Reasoning Generalists with Preference Trees
von: Yuan, Lifan, et al.
Veröffentlicht: (2024)
von: Yuan, Lifan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
von: Zhang, Kaituo, et al.
Veröffentlicht: (2026) -
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
von: Yang, Ruihan, et al.
Veröffentlicht: (2025) -
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
von: Chen, Hao-Yuan
Veröffentlicht: (2026) -
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025) -
iGRPO: Self-Feedback-Driven LLM Reasoning
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2026)