Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tie, Guiyao, Yuan, Zenghui, Zhao, Zeli, Hu, Chaoran, Gu, Tianhe, Zhang, Ruihang, Zhang, Sizhe, Wu, Junran, Tu, Xiaoyue, Jin, Ming, Wen, Qingsong, Chen, Lixing, Zhou, Pan, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
A Survey of AI Scientists
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025)
par: Shi, Jiawen, et autres
Publié: (2025)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026)
par: Tie, Guiyao, et autres
Publié: (2026)
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
par: Kamoi, Ryo, et autres
Publié: (2024)
par: Kamoi, Ryo, et autres
Publié: (2024)
Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation
par: Liu, Yinuo, et autres
Publié: (2025)
par: Liu, Yinuo, et autres
Publié: (2025)
Can LLMs Explain Themselves Counterfactually?
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
par: Qraitem, Maan, et autres
Publié: (2024)
par: Qraitem, Maan, et autres
Publié: (2024)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation
par: Xu, Wenda, et autres
Publié: (2025)
par: Xu, Wenda, et autres
Publié: (2025)
LLMs Can Teach Themselves to Better Predict the Future
par: Turtel, Benjamin, et autres
Publié: (2025)
par: Turtel, Benjamin, et autres
Publié: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
par: Wang, Xunguang, et autres
Publié: (2024)
par: Wang, Xunguang, et autres
Publié: (2024)
Self-Correction Makes LLMs Better Parsers
par: Zhang, Ziyan, et autres
Publié: (2025)
par: Zhang, Ziyan, et autres
Publié: (2025)
From Correctness to Comprehension: AI Agents for Personalized Error Diagnosis in Education
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
Understanding the Dark Side of LLMs' Intrinsic Self-Correction
par: Zhang, Qingjie, et autres
Publié: (2024)
par: Zhang, Qingjie, et autres
Publié: (2024)
CKnowEdit: A New Chinese Knowledge Editing Dataset for Linguistics, Facts, and Logic Error Correction in LLMs
par: Fang, Jizhan, et autres
Publié: (2024)
par: Fang, Jizhan, et autres
Publié: (2024)
SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
EmbodiedClaw: Conversational Workflow Execution for Embodied AI Development
par: Zhou, Xueyang, et autres
Publié: (2026)
par: Zhou, Xueyang, et autres
Publié: (2026)
LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
CorrectBench: Automatic Testbench Generation with Functional Self-Correction using LLMs for HDL Design
par: Qiu, Ruidi, et autres
Publié: (2024)
par: Qiu, Ruidi, et autres
Publié: (2024)
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
BaxBench: Can LLMs Generate Correct and Secure Backends?
par: Vero, Mark, et autres
Publié: (2025)
par: Vero, Mark, et autres
Publié: (2025)
Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs
par: Yang, Zhe, et autres
Publié: (2024)
par: Yang, Zhe, et autres
Publié: (2024)
Agentic AutoSurvey: Let LLMs Survey LLMs
par: Liu, Yixin, et autres
Publié: (2025)
par: Liu, Yixin, et autres
Publié: (2025)
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
par: Wu, Daoyuan, et autres
Publié: (2024)
par: Wu, Daoyuan, et autres
Publié: (2024)
QueueEDIT: Structural Self-Correction for Sequential Model Editing in LLMs
par: Zhang, Taolin, et autres
Publié: (2025)
par: Zhang, Taolin, et autres
Publié: (2025)
Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
par: Tong, Yongqi, et autres
Publié: (2024)
par: Tong, Yongqi, et autres
Publié: (2024)
AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
par: Zhang, Ziqian, et autres
Publié: (2026)
par: Zhang, Ziqian, et autres
Publié: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
Enhancing Mathematical Reasoning in LLMs by Stepwise Correction
par: Wu, Zhenyu, et autres
Publié: (2024)
par: Wu, Zhenyu, et autres
Publié: (2024)
NeuroStrike: Neuron-Level Attacks on Aligned LLMs
par: Wu, Lichao
Publié: (2025)
par: Wu, Lichao
Publié: (2025)
Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion
par: Cui, Yu, et autres
Publié: (2025)
par: Cui, Yu, et autres
Publié: (2025)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
par: wang, Jiaming, et autres
Publié: (2025)
par: wang, Jiaming, et autres
Publié: (2025)
Can LLMs Follow Simple Rules?
par: Mu, Norman, et autres
Publié: (2023)
par: Mu, Norman, et autres
Publié: (2023)
Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A
par: Plaut, Benjamin, et autres
Publié: (2024)
par: Plaut, Benjamin, et autres
Publié: (2024)
Can LLMs Faithfully Explain Themselves in Low-Resource Languages? A Case Study on Emotion Detection in Persian
par: Mehrazar, Mobina, et autres
Publié: (2025)
par: Mehrazar, Mobina, et autres
Publié: (2025)
Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
par: Guo, Jiahe, et autres
Publié: (2026)
par: Guo, Jiahe, et autres
Publié: (2026)
Documents similaires
-
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
par: Tie, Guiyao, et autres
Publié: (2025) -
A Survey of AI Scientists
par: Tie, Guiyao, et autres
Publié: (2025) -
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025) -
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026) -
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
par: Kamoi, Ryo, et autres
Publié: (2024)