Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xi, Zhiheng, Huang, Jixuan, Guo, Xin, Hong, Boyang, Yang, Dingwen, Fan, Xiaoran, Li, Shuo, Chen, Zehui, Ye, Junjie, Yuan, Siyu, Du, Zhengyin, Yao, Xuesong, Xu, Yufei, Chen, Jiecao, Zheng, Rui, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training
von: Yuan, Siyu, et al.
Veröffentlicht: (2025)
von: Yuan, Siyu, et al.
Veröffentlicht: (2025)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Recitation over Reasoning: How Cutting-Edge Language Models Can Fail on Elementary School-Level Reasoning Problems?
von: Yan, Kai, et al.
Veröffentlicht: (2025)
von: Yan, Kai, et al.
Veröffentlicht: (2025)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
von: Huang, Shiting, et al.
Veröffentlicht: (2025)
von: Huang, Shiting, et al.
Veröffentlicht: (2025)
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
von: Ye, Junjie, et al.
Veröffentlicht: (2024)
von: Ye, Junjie, et al.
Veröffentlicht: (2024)
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
von: Ruan, Chi, et al.
Veröffentlicht: (2025)
von: Ruan, Chi, et al.
Veröffentlicht: (2025)
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
von: Yang, Zhicheng, et al.
Veröffentlicht: (2025)
von: Yang, Zhicheng, et al.
Veröffentlicht: (2025)
The Critique of Critique
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
von: Sun, Shichao, et al.
Veröffentlicht: (2024)
Training Language Models to Critique With Multi-agent Feedback
von: Lan, Tian, et al.
Veröffentlicht: (2024)
von: Lan, Tian, et al.
Veröffentlicht: (2024)
ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing
von: Li, Shuo, et al.
Veröffentlicht: (2026)
von: Li, Shuo, et al.
Veröffentlicht: (2026)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
von: Zhang, Shaojie, et al.
Veröffentlicht: (2025)
CritiqueCrew: Orchestrating Multi-Perspective Conversational Design Critique
von: Chen, Xiaojiao, et al.
Veröffentlicht: (2026)
von: Chen, Xiaojiao, et al.
Veröffentlicht: (2026)
Teaching Language Models to Critique via Reinforcement Learning
von: Xie, Zhihui, et al.
Veröffentlicht: (2025)
von: Xie, Zhihui, et al.
Veröffentlicht: (2025)
Training Language Model to Critique for Better Refinement
von: Yu, Tianshu, et al.
Veröffentlicht: (2025)
von: Yu, Tianshu, et al.
Veröffentlicht: (2025)
Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
von: Du, Weihua, et al.
Veröffentlicht: (2025)
von: Du, Weihua, et al.
Veröffentlicht: (2025)
Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management
von: Lu, Miao, et al.
Veröffentlicht: (2025)
von: Lu, Miao, et al.
Veröffentlicht: (2025)
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
von: Wang, Yubo, et al.
Veröffentlicht: (2025)
Critique as Coloniality: The Decolonial Challenge to Immanent Critique
von: Shivani Radhakrishnan
Veröffentlicht: (2025)
von: Shivani Radhakrishnan
Veröffentlicht: (2025)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
von: Zhou, Yuhao, et al.
Veröffentlicht: (2025)
von: Zhou, Yuhao, et al.
Veröffentlicht: (2025)
CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis
von: Feng, Ruixiang, et al.
Veröffentlicht: (2025)
von: Feng, Ruixiang, et al.
Veröffentlicht: (2025)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
von: Li, Yansi, et al.
Veröffentlicht: (2025)
von: Li, Yansi, et al.
Veröffentlicht: (2025)
Sillages Critiques
Veröffentlicht: (2016)
Veröffentlicht: (2016)
Genealogy+Critique
Veröffentlicht: (2022)
Veröffentlicht: (2022)
Tourism Critiques
Veröffentlicht: (2021)
Veröffentlicht: (2021)
Neuroscience and Critique
Veröffentlicht: (2021)
Veröffentlicht: (2021)
Poetic Critique
Veröffentlicht: (2021)
Veröffentlicht: (2021)
Still Critique?
von: Lynn Mario T. Menezes de Souza
Veröffentlicht: (2018)
von: Lynn Mario T. Menezes de Souza
Veröffentlicht: (2018)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
von: Zhang, Zhehan, et al.
Veröffentlicht: (2026)
von: Zhang, Zhehan, et al.
Veröffentlicht: (2026)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
von: He, Wei, et al.
Veröffentlicht: (2024)
von: He, Wei, et al.
Veröffentlicht: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
von: Zheng, Rui, et al.
Veröffentlicht: (2024)
von: Zheng, Rui, et al.
Veröffentlicht: (2024)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
von: Ke, Pei, et al.
Veröffentlicht: (2023)
von: Ke, Pei, et al.
Veröffentlicht: (2023)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Toward Virtuous Reinforcement Learning: A Critique and Roadmap
von: Ghasemi, Majid, et al.
Veröffentlicht: (2025)
von: Ghasemi, Majid, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training
von: Yuan, Siyu, et al.
Veröffentlicht: (2025) -
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
von: Ye, Junjie, et al.
Veröffentlicht: (2025) -
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025) -
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
von: Ye, Junjie, et al.
Veröffentlicht: (2025) -
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)