Teaching Language Models to Critique via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Zhihui, Chen, Jie, Chen, Liyu, Mao, Weichao, Xu, Jingjing, Kong, Lingpeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
par: Zhang, Yufeng, et autres
Publié: (2024)
par: Zhang, Yufeng, et autres
Publié: (2024)
DeepCritic: Deliberate Critique with Large Language Models
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Scaling Reasoning without Attention
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
par: Li, Junsong, et autres
Publié: (2025)
par: Li, Junsong, et autres
Publié: (2025)
Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models
par: Sim, Shamus, et autres
Publié: (2024)
par: Sim, Shamus, et autres
Publié: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
par: Yu, Yue, et autres
Publié: (2024)
par: Yu, Yue, et autres
Publié: (2024)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
par: Guo, Yiran, et autres
Publié: (2026)
par: Guo, Yiran, et autres
Publié: (2026)
Scaling Multimodal Search and Recommendation with Small Language Models via Upside-Down Reinforcement Learning
par: Lin, Yu-Chen, et autres
Publié: (2025)
par: Lin, Yu-Chen, et autres
Publié: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
par: Heuillet, Maxime, et autres
Publié: (2025)
par: Heuillet, Maxime, et autres
Publié: (2025)
RAVEN: In-Context Learning with Retrieval-Augmented Encoder-Decoder Language Models
par: Huang, Jie, et autres
Publié: (2023)
par: Huang, Jie, et autres
Publié: (2023)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
par: Chen, Haozhe, et autres
Publié: (2024)
par: Chen, Haozhe, et autres
Publié: (2024)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
par: Zhang, Haozhen, et autres
Publié: (2025)
par: Zhang, Haozhen, et autres
Publié: (2025)
AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
par: Lin, Xuan, et autres
Publié: (2025)
par: Lin, Xuan, et autres
Publié: (2025)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
par: Luo, Haipeng, et autres
Publié: (2023)
par: Luo, Haipeng, et autres
Publié: (2023)
SambaLingo: Teaching Large Language Models New Languages
par: Csaki, Zoltan, et autres
Publié: (2024)
par: Csaki, Zoltan, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
par: Wang, Siwei, et autres
Publié: (2025)
par: Wang, Siwei, et autres
Publié: (2025)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
par: Pang, Jing-Cheng, et autres
Publié: (2024)
par: Pang, Jing-Cheng, et autres
Publié: (2024)
SubgoalXL: Subgoal-based Expert Learning for Theorem Proving
par: Zhao, Xueliang, et autres
Publié: (2024)
par: Zhao, Xueliang, et autres
Publié: (2024)
Imitating Language via Scalable Inverse Reinforcement Learning
par: Wulfmeier, Markus, et autres
Publié: (2024)
par: Wulfmeier, Markus, et autres
Publié: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
par: Rosset, Corby, et autres
Publié: (2024)
par: Rosset, Corby, et autres
Publié: (2024)
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
par: Wang, Yiping, et autres
Publié: (2025)
par: Wang, Yiping, et autres
Publié: (2025)
Learn To be Efficient: Build Structured Sparsity in Large Language Models
par: Zheng, Haizhong, et autres
Publié: (2024)
par: Zheng, Haizhong, et autres
Publié: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
par: Alsadat, Shayan Meshkat, et autres
Publié: (2024)
par: Alsadat, Shayan Meshkat, et autres
Publié: (2024)
Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective
par: Kong, Lingxiao, et autres
Publié: (2025)
par: Kong, Lingxiao, et autres
Publié: (2025)
Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning
par: Ding, Zifeng, et autres
Publié: (2025)
par: Ding, Zifeng, et autres
Publié: (2025)
Documents similaires
-
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026) -
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
par: Zhao, Xueliang, et autres
Publié: (2025) -
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
par: Zhang, Yufeng, et autres
Publié: (2024) -
DeepCritic: Deliberate Critique with Large Language Models
par: Yang, Wenkai, et autres
Publié: (2025) -
Scaling Reasoning without Attention
par: Zhao, Xueliang, et autres
Publié: (2025)