Self-Evolving Critique Abilities in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tang, Zhengyang, Li, Ziniu, Xiao, Zhenyang, Ding, Tian, Sun, Ruoyu, Wang, Benyou, Liu, Dayiheng, Huang, Fei, Liu, Tianyu, Yu, Bowen, Lin, Junyang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
Teaching Language Models to Reason with Tools
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
CoRT: Code-integrated Reasoning within Thinking
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
von: Huang, Chenyu, et al.
Veröffentlicht: (2026)
von: Huang, Chenyu, et al.
Veröffentlicht: (2026)
Language Models can Self-Lengthen to Generate Long Texts
von: Quan, Shanghaoran, et al.
Veröffentlicht: (2024)
von: Quan, Shanghaoran, et al.
Veröffentlicht: (2024)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
von: Chen, Nuo, et al.
Veröffentlicht: (2025)
von: Chen, Nuo, et al.
Veröffentlicht: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
Bridging Formal Language with Chain-of-Thought Reasoning to Geometry Problem Solving
von: Yang, Tianyun, et al.
Veröffentlicht: (2025)
von: Yang, Tianyun, et al.
Veröffentlicht: (2025)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
von: Li, Chenxin, et al.
Veröffentlicht: (2026)
von: Li, Chenxin, et al.
Veröffentlicht: (2026)
DataMan: Data Manager for Pre-training Large Language Models
von: Peng, Ru, et al.
Veröffentlicht: (2025)
von: Peng, Ru, et al.
Veröffentlicht: (2025)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
START: Self-taught Reasoner with Tools
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
von: Li, Chengpeng, et al.
Veröffentlicht: (2025)
Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation
von: Zhang, Collin, et al.
Veröffentlicht: (2025)
von: Zhang, Collin, et al.
Veröffentlicht: (2025)
Parallel Scaling Law for Language Models
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
Self-Evolving Visual Concept Library using Vision-Language Critics
von: Sehgal, Atharva, et al.
Veröffentlicht: (2025)
von: Sehgal, Atharva, et al.
Veröffentlicht: (2025)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
von: Qiu, Zihan, et al.
Veröffentlicht: (2025)
von: Qiu, Zihan, et al.
Veröffentlicht: (2025)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
von: Li, Yansi, et al.
Veröffentlicht: (2025)
von: Li, Yansi, et al.
Veröffentlicht: (2025)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
von: Xiang, Hao, et al.
Veröffentlicht: (2024)
von: Xiang, Hao, et al.
Veröffentlicht: (2024)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
von: Ke, Pei, et al.
Veröffentlicht: (2023)
von: Ke, Pei, et al.
Veröffentlicht: (2023)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
von: Zheng, Chujie, et al.
Veröffentlicht: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
von: Zhang, Zhenru, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenru, et al.
Veröffentlicht: (2025)
Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch
von: Yu, Le, et al.
Veröffentlicht: (2023)
von: Yu, Le, et al.
Veröffentlicht: (2023)
Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs
von: Yang, Zhe, et al.
Veröffentlicht: (2024)
von: Yang, Zhe, et al.
Veröffentlicht: (2024)
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
von: Yang, An, et al.
Veröffentlicht: (2024)
von: Yang, An, et al.
Veröffentlicht: (2024)
Why Transformers Need Adam: A Hessian Perspective
von: Zhang, Yushun, et al.
Veröffentlicht: (2024)
von: Zhang, Yushun, et al.
Veröffentlicht: (2024)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
von: Tang, Zhengyang, et al.
Veröffentlicht: (2024)
von: Tang, Zhengyang, et al.
Veröffentlicht: (2024)
CALM Before the STORM: Unlocking Native Reasoning for Optimization Modeling
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025)
ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline
von: Xu, Yifan, et al.
Veröffentlicht: (2024)
von: Xu, Yifan, et al.
Veröffentlicht: (2024)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
von: Dong, Guanting, et al.
Veröffentlicht: (2023)
von: Dong, Guanting, et al.
Veröffentlicht: (2023)
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
von: Li, Jinzhe, et al.
Veröffentlicht: (2025)
von: Li, Jinzhe, et al.
Veröffentlicht: (2025)
WebWorld: A Large-Scale World Model for Web Agent Training
von: Xiao, Zikai, et al.
Veröffentlicht: (2026)
von: Xiao, Zikai, et al.
Veröffentlicht: (2026)
Robust Search with Uncertainty-Aware Value Models for Language Model Reasoning
von: Yu, Fei, et al.
Veröffentlicht: (2025)
von: Yu, Fei, et al.
Veröffentlicht: (2025)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
von: Huang, Shiting, et al.
Veröffentlicht: (2025)
von: Huang, Shiting, et al.
Veröffentlicht: (2025)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
SALMONN: Towards Generic Hearing Abilities for Large Language Models
von: Tang, Changli, et al.
Veröffentlicht: (2023)
von: Tang, Changli, et al.
Veröffentlicht: (2023)
Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models
von: Zhang, Che, et al.
Veröffentlicht: (2024)
von: Zhang, Che, et al.
Veröffentlicht: (2024)
AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
von: Ma, Bo, et al.
Veröffentlicht: (2025)
von: Ma, Bo, et al.
Veröffentlicht: (2025)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
RealCritic: Towards Effectiveness-Driven Evaluation of Language Model Critiques
von: Tang, Zhengyang, et al.
Veröffentlicht: (2025) -
Teaching Language Models to Reason with Tools
von: Li, Chengpeng, et al.
Veröffentlicht: (2025) -
CoRT: Code-integrated Reasoning within Thinking
von: Li, Chengpeng, et al.
Veröffentlicht: (2025) -
InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
von: Huang, Chenyu, et al.
Veröffentlicht: (2026) -
Language Models can Self-Lengthen to Generate Long Texts
von: Quan, Shanghaoran, et al.
Veröffentlicht: (2024)