Synthetic Error Injection Fails to Elicit Self-Correction In Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, David X., Kapur, Shreyas, Sahai, Anant, Russell, Stuart |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evidence of Learned Look-Ahead in a Chess-Playing Neural Network
by: Jenner, Erik, et al.
Published: (2024)
by: Jenner, Erik, et al.
Published: (2024)
Precise Asymptotic Generalization for Multiclass Classification with Overparameterized Linear Models
by: Wu, David X., et al.
Published: (2023)
by: Wu, David X., et al.
Published: (2023)
Diffusion On Syntax Trees For Program Synthesis
by: Kapur, Shreyas, et al.
Published: (2024)
by: Kapur, Shreyas, et al.
Published: (2024)
Provable Weak-to-Strong Generalization via Benign Overfitting
by: Wu, David X., et al.
Published: (2024)
by: Wu, David X., et al.
Published: (2024)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
by: Daheim, Nico, et al.
Published: (2024)
by: Daheim, Nico, et al.
Published: (2024)
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
by: Zhang, Shenao, et al.
Published: (2024)
by: Zhang, Shenao, et al.
Published: (2024)
Self-Training Elicits Concise Reasoning in Large Language Models
by: Munkhbat, Tergel, et al.
Published: (2025)
by: Munkhbat, Tergel, et al.
Published: (2025)
ElicitationGPT: Text Elicitation Mechanisms via Language Models
by: Wu, Yifan, et al.
Published: (2024)
by: Wu, Yifan, et al.
Published: (2024)
Can Custom Models Learn In-Context? An Exploration of Hybrid Architecture Performance on In-Context Learning Tasks
by: Campbell, Ryan, et al.
Published: (2024)
by: Campbell, Ryan, et al.
Published: (2024)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
by: Basavatia, Shreyas, et al.
Published: (2024)
by: Basavatia, Shreyas, et al.
Published: (2024)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
by: Lee, Sanghyun, et al.
Published: (2025)
by: Lee, Sanghyun, et al.
Published: (2025)
Synthesizing and Adapting Error Correction Data for Mobile Large Language Model Applications
by: Zhang, Yanxiang, et al.
Published: (2025)
by: Zhang, Yanxiang, et al.
Published: (2025)
ALMANACS: A Simulatability Benchmark for Language Model Explainability
by: Mills, Edmund, et al.
Published: (2023)
by: Mills, Edmund, et al.
Published: (2023)
Tools Fail: Detecting Silent Errors in Faulty Tools
by: Sun, Jimin, et al.
Published: (2024)
by: Sun, Jimin, et al.
Published: (2024)
The Elicitation Game: Evaluating Capability Elicitation Techniques
by: Hofstätter, Felix, et al.
Published: (2025)
by: Hofstätter, Felix, et al.
Published: (2025)
Eliciting Language Model Behaviors with Investigator Agents
by: Li, Xiang Lisa, et al.
Published: (2025)
by: Li, Xiang Lisa, et al.
Published: (2025)
Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning
by: Sun, Xinhai
Published: (2026)
by: Sun, Xinhai
Published: (2026)
Latent Noise Injection for Private and Statistically Aligned Synthetic Data Generation
by: Shen, Rex, et al.
Published: (2025)
by: Shen, Rex, et al.
Published: (2025)
Chain-of-Specificity: An Iteratively Refining Method for Eliciting Knowledge from Large Language Models
by: Wei, Kaiwen, et al.
Published: (2024)
by: Wei, Kaiwen, et al.
Published: (2024)
On Eliciting Syntax from Language Models via Hashing
by: Wang, Yiran, et al.
Published: (2024)
by: Wang, Yiran, et al.
Published: (2024)
Eliciting Latent Knowledge from Quirky Language Models
by: Mallen, Alex, et al.
Published: (2023)
by: Mallen, Alex, et al.
Published: (2023)
Reasoning Elicitation in Language Models via Counterfactual Feedback
by: Hüyük, Alihan, et al.
Published: (2024)
by: Hüyük, Alihan, et al.
Published: (2024)
Behavior Injection: Preparing Language Models for Reinforcement Learning
by: Cen, Zhepeng, et al.
Published: (2025)
by: Cen, Zhepeng, et al.
Published: (2025)
Self-Improving Diffusion Models with Synthetic Data
by: Alemohammad, Sina, et al.
Published: (2024)
by: Alemohammad, Sina, et al.
Published: (2024)
A Multi-Component AI Framework for Computational Psychology: From Robust Predictive Modeling to Deployed Generative Dialogue
by: Pareek, Anant
Published: (2025)
by: Pareek, Anant
Published: (2025)
When Softmax Fails at the Top: Extreme Value Corrections for InfoNCE
by: Erol, Melihcan, et al.
Published: (2026)
by: Erol, Melihcan, et al.
Published: (2026)
Avoiding Catastrophe in Online Learning by Asking for Help
by: Plaut, Benjamin, et al.
Published: (2024)
by: Plaut, Benjamin, et al.
Published: (2024)
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
by: Lidayan, Aly, et al.
Published: (2024)
by: Lidayan, Aly, et al.
Published: (2024)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
by: Vuddanti, Sri Vatsa, et al.
Published: (2025)
by: Vuddanti, Sri Vatsa, et al.
Published: (2025)
Double Successive Over-Relaxation Q-Learning with an Extension to Deep Reinforcement Learning
by: R, Shreyas S
Published: (2024)
by: R, Shreyas S
Published: (2024)
Rethinking Refinement: Correcting Generative Bias without Noise Injection
by: Peng, Xin, et al.
Published: (2026)
by: Peng, Xin, et al.
Published: (2026)
Causality Elicitation from Large Language Models
by: Kameyama, Takashi, et al.
Published: (2026)
by: Kameyama, Takashi, et al.
Published: (2026)
ProgCo: Program Helps Self-Correction of Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2025)
by: Song, Xiaoshuai, et al.
Published: (2025)
Loop Corrections to the Training Error and Generalization Gap of Random Feature Models
by: Kim, Taeyoung
Published: (2026)
by: Kim, Taeyoung
Published: (2026)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
by: Tsui, Ken
Published: (2025)
by: Tsui, Ken
Published: (2025)
Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
by: Plecko, Drago, et al.
Published: (2025)
by: Plecko, Drago, et al.
Published: (2025)
When Mean CE Fails: Median CE Can Better Track Language Model Quality
by: Guo, Hao, et al.
Published: (2026)
by: Guo, Hao, et al.
Published: (2026)
Learning the Error Patterns of Language Models
by: Kim, Jinwoo, et al.
Published: (2026)
by: Kim, Jinwoo, et al.
Published: (2026)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
by: Shang, Yu, et al.
Published: (2024)
by: Shang, Yu, et al.
Published: (2024)
Synthetic Knowledge Ingestion: Towards Knowledge Refinement and Injection for Enhancing Large Language Models
by: Zhang, Jiaxin, et al.
Published: (2024)
by: Zhang, Jiaxin, et al.
Published: (2024)
Similar Items
-
Evidence of Learned Look-Ahead in a Chess-Playing Neural Network
by: Jenner, Erik, et al.
Published: (2024) -
Precise Asymptotic Generalization for Multiclass Classification with Overparameterized Linear Models
by: Wu, David X., et al.
Published: (2023) -
Diffusion On Syntax Trees For Program Synthesis
by: Kapur, Shreyas, et al.
Published: (2024) -
Provable Weak-to-Strong Generalization via Benign Overfitting
by: Wu, David X., et al.
Published: (2024) -
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
by: Daheim, Nico, et al.
Published: (2024)