Training Language Models to Critique With Multi-agent Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lan, Tian, Zhang, Wenwei, Lyu, Chengqi, Li, Shuaibin, Xu, Chen, Huang, Heyan, Lin, Dahua, Mao, Xian-Ling, Chen, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
ANAH: Analytical Annotation of Hallucinations in Large Language Models
par: Ji, Ziwei, et autres
Publié: (2024)
par: Ji, Ziwei, et autres
Publié: (2024)
ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models
par: Gu, Yuzhe, et autres
Publié: (2024)
par: Gu, Yuzhe, et autres
Publié: (2024)
Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
Beyond Exact Match: Semantically Reassessing Event Extraction by Large Language Models
par: Lu, Yi-Fan, et autres
Publié: (2024)
par: Lu, Yi-Fan, et autres
Publié: (2024)
The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner
par: Hua, Zhouqi, et autres
Publié: (2025)
par: Hua, Zhouqi, et autres
Publié: (2025)
AlchemistCoder: Harmonizing and Eliciting Code Capability by Hindsight Tuning on Multi-source Data
par: Song, Zifan, et autres
Publié: (2024)
par: Song, Zifan, et autres
Publié: (2024)
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
par: Tu, Rong-Cheng, et autres
Publié: (2024)
par: Tu, Rong-Cheng, et autres
Publié: (2024)
SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event Detection
par: Lu, Yi-Fan, et autres
Publié: (2025)
par: Lu, Yi-Fan, et autres
Publié: (2025)
Mix-Initiative Response Generation with Dynamic Prefix Tuning
par: Nie, Yuxiang, et autres
Publié: (2024)
par: Nie, Yuxiang, et autres
Publié: (2024)
Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement
par: Zhou, Xiaofeng, et autres
Publié: (2025)
par: Zhou, Xiaofeng, et autres
Publié: (2025)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
par: Chen, Zehui, et autres
Publié: (2024)
par: Chen, Zehui, et autres
Publié: (2024)
ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-Training
par: Zhuo, Le, et autres
Publié: (2024)
par: Zhuo, Le, et autres
Publié: (2024)
Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning
par: Lyu, Chengqi, et autres
Publié: (2025)
par: Lyu, Chengqi, et autres
Publié: (2025)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
par: Ma, Zi-Ao, et autres
Publié: (2024)
par: Ma, Zi-Ao, et autres
Publié: (2024)
EXCEEDS: Extracting Complex Events via Nugget-based Grid Modeling in Scientific Domain
par: Lu, Yi-Fan, et autres
Publié: (2024)
par: Lu, Yi-Fan, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation
par: Ma, Zi-Ao, et autres
Publié: (2025)
par: Ma, Zi-Ao, et autres
Publié: (2025)
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
par: Zhang, Guo-Biao, et autres
Publié: (2026)
par: Zhang, Guo-Biao, et autres
Publié: (2026)
Training Language Model to Critique for Better Refinement
par: Yu, Tianshu, et autres
Publié: (2025)
par: Yu, Tianshu, et autres
Publié: (2025)
Teaching Language Models to Critique via Reinforcement Learning
par: Xie, Zhihui, et autres
Publié: (2025)
par: Xie, Zhihui, et autres
Publié: (2025)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
par: Chen, Zehui, et autres
Publié: (2023)
par: Chen, Zehui, et autres
Publié: (2023)
Scaling Behavior for Large Language Models regarding Numeral Systems: An Example using Pythia
par: Zhou, Zhejian, et autres
Publié: (2024)
par: Zhou, Zhejian, et autres
Publié: (2024)
MMWOZ: Building Multimodal Agent for Task-oriented Dialogue
par: Yang, Pu-Hai, et autres
Publié: (2025)
par: Yang, Pu-Hai, et autres
Publié: (2025)
InternLM2.5-StepProver: Advancing Automated Theorem Proving via Critic-Guided Search
par: Wu, Zijian, et autres
Publié: (2024)
par: Wu, Zijian, et autres
Publié: (2024)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
par: Li, Yansi, et autres
Publié: (2025)
par: Li, Yansi, et autres
Publié: (2025)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
par: Huang, Shiting, et autres
Publié: (2025)
par: Huang, Shiting, et autres
Publié: (2025)
InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
par: Li, Peiji, et autres
Publié: (2025)
par: Li, Peiji, et autres
Publié: (2025)
InternLM-Law: An Open Source Chinese Legal Large Language Model
par: Fei, Zhiwei, et autres
Publié: (2024)
par: Fei, Zhiwei, et autres
Publié: (2024)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
par: Ying, Huaiyuan, et autres
Publié: (2024)
par: Ying, Huaiyuan, et autres
Publié: (2024)
DeepCritic: Deliberate Critique with Large Language Models
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
par: Zhang, Xiaoying, et autres
Publié: (2025)
par: Zhang, Xiaoying, et autres
Publié: (2025)
Training-free Truthfulness Detection via Value Vectors in LLMs
par: Liu, Runheng, et autres
Publié: (2025)
par: Liu, Runheng, et autres
Publié: (2025)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
par: Ruan, Chi, et autres
Publié: (2025)
par: Ruan, Chi, et autres
Publié: (2025)
Balanced Data Sampling for Language Model Training with Clustering
par: Shao, Yunfan, et autres
Publié: (2024)
par: Shao, Yunfan, et autres
Publié: (2024)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
par: Liu, Hongwei, et autres
Publié: (2024)
par: Liu, Hongwei, et autres
Publié: (2024)
Training Language Models with Language Feedback at Scale
par: Scheurer, Jérémy, et autres
Publié: (2023)
par: Scheurer, Jérémy, et autres
Publié: (2023)
CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
par: Liu, Shudong, et autres
Publié: (2025)
par: Liu, Shudong, et autres
Publié: (2025)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
par: Li, Jinsong, et autres
Publié: (2025)
par: Li, Jinsong, et autres
Publié: (2025)
Documents similaires
-
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024) -
ANAH: Analytical Annotation of Hallucinations in Large Language Models
par: Ji, Ziwei, et autres
Publié: (2024) -
ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models
par: Gu, Yuzhe, et autres
Publié: (2024) -
Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs
par: Gu, Yuzhe, et autres
Publié: (2025) -
Beyond Exact Match: Semantically Reassessing Event Extraction by Large Language Models
par: Lu, Yi-Fan, et autres
Publié: (2024)