RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Qiaoyu, Xiang, Hao, Yu, Le, Yu, Bowen, Lin, Hongyu, Lu, Yaojie, Han, Xianpei, Sun, Le, Lin, Junyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window
par: Tang, Qiaoyu, et autres
Publié: (2025)
par: Tang, Qiaoyu, et autres
Publié: (2025)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
par: Xiang, Hao, et autres
Publié: (2024)
par: Xiang, Hao, et autres
Publié: (2024)
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
par: Zheng, Xin, et autres
Publié: (2024)
par: Zheng, Xin, et autres
Publié: (2024)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
par: Li, Zhuoqun, et autres
Publié: (2024)
par: Li, Zhuoqun, et autres
Publié: (2024)
SoFA: Shielded On-the-fly Alignment via Priority Rule Following
par: Lu, Xinyu, et autres
Publié: (2024)
par: Lu, Xinyu, et autres
Publié: (2024)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
par: Xiang, Hao, et autres
Publié: (2025)
par: Xiang, Hao, et autres
Publié: (2025)
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
par: Bian, Ning, et autres
Publié: (2024)
par: Bian, Ning, et autres
Publié: (2024)
REInstruct: Building Instruction Data from Unlabeled Corpus
par: Chen, Shu, et autres
Publié: (2024)
par: Chen, Shu, et autres
Publié: (2024)
Open Grounded Planning: Challenges and Benchmark Construction
par: Guo, Shiguang, et autres
Publié: (2024)
par: Guo, Shiguang, et autres
Publié: (2024)
StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information Structurization
par: Li, Zhuoqun, et autres
Publié: (2024)
par: Li, Zhuoqun, et autres
Publié: (2024)
Transferable Post-training via Inverse Value Learning
par: Lu, Xinyu, et autres
Publié: (2024)
par: Lu, Xinyu, et autres
Publié: (2024)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
par: Zheng, Xin, et autres
Publié: (2024)
par: Zheng, Xin, et autres
Publié: (2024)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
par: Peng, Xiaoxuan, et autres
Publié: (2026)
par: Peng, Xiaoxuan, et autres
Publié: (2026)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
par: Guan, Xinyan, et autres
Publié: (2024)
par: Guan, Xinyan, et autres
Publié: (2024)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
par: Yuan, Qianhao, et autres
Publié: (2026)
par: Yuan, Qianhao, et autres
Publié: (2026)
Few-shot Named Entity Recognition via Superposition Concept Discrimination
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
The Life Cycle of Knowledge in Big Language Models: A Survey
par: Cao, Boxi, et autres
Publié: (2023)
par: Cao, Boxi, et autres
Publié: (2023)
On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
par: Wen, Xueru, et autres
Publié: (2024)
par: Wen, Xueru, et autres
Publié: (2024)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
par: Ren, Mengjie, et autres
Publié: (2026)
par: Ren, Mengjie, et autres
Publié: (2026)
ChatGPT is a Knowledgeable but Inexperienced Solver: An Investigation of Commonsense Problem in Large Language Models
par: Bian, Ning, et autres
Publié: (2023)
par: Bian, Ning, et autres
Publié: (2023)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
par: Zheng, Jiasheng, et autres
Publié: (2026)
par: Zheng, Jiasheng, et autres
Publié: (2026)
DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point Thinking
par: Li, Zhuoqun, et autres
Publié: (2025)
par: Li, Zhuoqun, et autres
Publié: (2025)
PaperRegister: Boosting Flexible-grained Paper Search via Hierarchical Register Indexing
par: Li, Zhuoqun, et autres
Publié: (2025)
par: Li, Zhuoqun, et autres
Publié: (2025)
Towards Scalable Automated Alignment of LLMs: A Survey
par: Cao, Boxi, et autres
Publié: (2024)
par: Cao, Boxi, et autres
Publié: (2024)
Seg2Act: Global Context-aware Action Generation for Document Logical Structuring
par: Li, Zichao, et autres
Publié: (2024)
par: Li, Zichao, et autres
Publié: (2024)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
par: Zheng, Jiasheng, et autres
Publié: (2024)
par: Zheng, Jiasheng, et autres
Publié: (2024)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
par: Li, Zichao, et autres
Publié: (2024)
par: Li, Zichao, et autres
Publié: (2024)
Academically intelligent LLMs are not necessarily socially intelligent
par: Xu, Ruoxi, et autres
Publié: (2024)
par: Xu, Ruoxi, et autres
Publié: (2024)
The Rise and Down of Babel Tower: Investigating the Evolution Process of Multilingual Code Large Language Model
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
Retentive or Forgetful? Diving into the Knowledge Memorizing Mechanism of Language Models
par: Cao, Boxi, et autres
Publié: (2023)
par: Cao, Boxi, et autres
Publié: (2023)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
par: Wen, Xueru, et autres
Publié: (2024)
par: Wen, Xueru, et autres
Publié: (2024)
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
par: Liu, Yanjiang, et autres
Publié: (2026)
par: Liu, Yanjiang, et autres
Publié: (2026)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
par: Mao, Yingzhi, et autres
Publié: (2025)
par: Mao, Yingzhi, et autres
Publié: (2025)
Documents similaires
-
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
par: Tang, Qiaoyu, et autres
Publié: (2024) -
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window
par: Tang, Qiaoyu, et autres
Publié: (2025) -
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
par: Xiang, Hao, et autres
Publié: (2024) -
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
par: Zheng, Xin, et autres
Publié: (2024) -
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
par: Li, Zhuoqun, et autres
Publié: (2024)