Enregistré dans:
| Auteurs principaux: | Zhang, Xiaoying, Zhang, Yipeng, Sun, Hao, Feng, Kaituo, Lu, Chaochao, Yang, Chao, Meng, Helen |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2506.03106 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
par: Zhang, Kaituo, et autres
Publié: (2026)
par: Zhang, Kaituo, et autres
Publié: (2026)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026)
par: Chen, Hao-Yuan
Publié: (2026)
Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization
par: Wei, Jiaqi, et autres
Publié: (2025)
par: Wei, Jiaqi, et autres
Publié: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
par: Ke, Pei, et autres
Publié: (2023)
par: Ke, Pei, et autres
Publié: (2023)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
par: Zhang, Ziyin, et autres
Publié: (2025)
par: Zhang, Ziyin, et autres
Publié: (2025)
iGRPO: Self-Feedback-Driven LLM Reasoning
par: Hatamizadeh, Ali, et autres
Publié: (2026)
par: Hatamizadeh, Ali, et autres
Publié: (2026)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
par: Zhang, Xichen, et autres
Publié: (2025)
par: Zhang, Xichen, et autres
Publié: (2025)
Adapting LLM Agents with Universal Feedback in Communication
par: Wang, Kuan, et autres
Publié: (2023)
par: Wang, Kuan, et autres
Publié: (2023)
The Critique of Critique
par: Sun, Shichao, et autres
Publié: (2024)
par: Sun, Shichao, et autres
Publié: (2024)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
par: Chen, Sirui, et autres
Publié: (2026)
par: Chen, Sirui, et autres
Publié: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
From Reasoning to Code: GRPO Optimization for Underrepresented Languages
par: Pennino, Federico, et autres
Publié: (2025)
par: Pennino, Federico, et autres
Publié: (2025)
Text2Grad: Reinforcement Learning from Natural Language Feedback
par: Wang, Hanyang, et autres
Publié: (2025)
par: Wang, Hanyang, et autres
Publié: (2025)
Can Post-Training Transform LLMs into Causal Reasoners?
par: Chen, Junqi, et autres
Publié: (2026)
par: Chen, Junqi, et autres
Publié: (2026)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
par: Dai, Yanqi, et autres
Publié: (2026)
par: Dai, Yanqi, et autres
Publié: (2026)
Advancing Sequential Numerical Prediction in Autoregressive Models
par: Fei, Xiang, et autres
Publié: (2025)
par: Fei, Xiang, et autres
Publié: (2025)
Language-Guided Tuning: Enhancing Numeric Optimization with Textual Feedback
par: Lu, Yuxing, et autres
Publié: (2025)
par: Lu, Yuxing, et autres
Publié: (2025)
Exploring Reasoning Reward Model for Agents
par: Fan, Kaixuan, et autres
Publié: (2026)
par: Fan, Kaixuan, et autres
Publié: (2026)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning
par: Lv, Qitan, et autres
Publié: (2026)
par: Lv, Qitan, et autres
Publié: (2026)
GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
par: Dipta, Shubhashis Roy, et autres
Publié: (2026)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
par: Zhang, Yize, et autres
Publié: (2025)
par: Zhang, Yize, et autres
Publié: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
par: Shen, Wei, et autres
Publié: (2024)
par: Shen, Wei, et autres
Publié: (2024)
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
par: Huang, Lei, et autres
Publié: (2026)
par: Huang, Lei, et autres
Publié: (2026)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
par: Yang, Chao, et autres
Publié: (2024)
par: Yang, Chao, et autres
Publié: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
par: Yu, Yue, et autres
Publié: (2024)
par: Yu, Yue, et autres
Publié: (2024)
Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents
par: Li, Zelong, et autres
Publié: (2024)
par: Li, Zelong, et autres
Publié: (2024)
ExGRPO: Learning to Reason from Experience
par: Zhan, Runzhe, et autres
Publié: (2025)
par: Zhan, Runzhe, et autres
Publié: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
System-Level Natural Language Feedback
par: Yuan, Weizhe, et autres
Publié: (2023)
par: Yuan, Weizhe, et autres
Publié: (2023)
RePO: Replay-Enhanced Policy Optimization
par: Li, Siheng, et autres
Publié: (2025)
par: Li, Siheng, et autres
Publié: (2025)
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
par: Zhang, Wanpeng, et autres
Publié: (2023)
par: Zhang, Wanpeng, et autres
Publié: (2023)
Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
par: Wang, Ruida, et autres
Publié: (2025)
par: Wang, Ruida, et autres
Publié: (2025)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
par: Chen, Sirui, et autres
Publié: (2025)
par: Chen, Sirui, et autres
Publié: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
par: Wang, Siyin, et autres
Publié: (2025)
par: Wang, Siyin, et autres
Publié: (2025)
REGEN: A Dataset and Benchmarks with Natural Language Critiques and Narratives
par: Su, Kun, et autres
Publié: (2025)
par: Su, Kun, et autres
Publié: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025)
par: Xiao, Wenyi, et autres
Publié: (2025)
Documents similaires
-
Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models
par: Zhang, Kaituo, et autres
Publié: (2026) -
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
par: Yang, Ruihan, et autres
Publié: (2025) -
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026) -
Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization
par: Wei, Jiaqi, et autres
Publié: (2025) -
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
par: Ke, Pei, et autres
Publié: (2023)