On the Convergence of Moral Self-Correction in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Guangliang, Mao, Haitao, Cao, Bochuan, Xue, Zhiyu, Zhang, Xitong, Wang, Rongrong, Johnson, Kristen Marie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Smaller Large Language Models Can Do Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Discourse Heuristics For Paradoxically Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
di: Chen, Bocheng, et al.
Pubblicazione: (2026)
di: Chen, Bocheng, et al.
Pubblicazione: (2026)
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Self-correction is Not An Innate Capability in Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Improving Generalization of Complex Models under Unbounded Loss Using PAC-Bayes Bounds
di: Zhang, Xitong, et al.
Pubblicazione: (2023)
di: Zhang, Xitong, et al.
Pubblicazione: (2023)
Towards Understanding Task-agnostic Debiasing Through the Lenses of Intrinsic Bias and Forgetfulness
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
di: Liu, Guangliang, et al.
Pubblicazione: (2024)
Pragmatic Inference for Moral Reasoning Acquisition: Generalization via Metapragmatic Links
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution
di: Chang, Yurui, et al.
Pubblicazione: (2024)
di: Chang, Yurui, et al.
Pubblicazione: (2024)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
di: Cao, Yuanpu, et al.
Pubblicazione: (2024)
A Survey to Recent Progress Towards Understanding In-Context Learning
di: Mao, Haitao, et al.
Pubblicazione: (2024)
di: Mao, Haitao, et al.
Pubblicazione: (2024)
Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation
di: Chang, Yurui, et al.
Pubblicazione: (2025)
di: Chang, Yurui, et al.
Pubblicazione: (2025)
Communication-Efficient and Tensorized Federated Fine-Tuning of Large Language Models
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
Measuring Moral Inconsistencies in Large Language Models
di: Bonagiri, Vamshi Krishna, et al.
Pubblicazione: (2024)
di: Bonagiri, Vamshi Krishna, et al.
Pubblicazione: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Label-free Node Classification on Graphs with Large Language Models (LLMS)
di: Chen, Zhikai, et al.
Pubblicazione: (2023)
di: Chen, Zhikai, et al.
Pubblicazione: (2023)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
di: Mao, Yu, et al.
Pubblicazione: (2025)
di: Mao, Yu, et al.
Pubblicazione: (2025)
Self-Taught Self-Correction for Small Language Models
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
CoBa: Convergence Balancer for Multitask Finetuning of Large Language Models
di: Gong, Zi, et al.
Pubblicazione: (2024)
di: Gong, Zi, et al.
Pubblicazione: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
On the Convergence of Zeroth-Order Federated Tuning for Large Language Models
di: Ling, Zhenqing, et al.
Pubblicazione: (2024)
di: Ling, Zhenqing, et al.
Pubblicazione: (2024)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
di: Liu, Shuo, et al.
Pubblicazione: (2026)
di: Liu, Shuo, et al.
Pubblicazione: (2026)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
di: Yu, Peiqi, et al.
Pubblicazione: (2026)
di: Yu, Peiqi, et al.
Pubblicazione: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
A Survey of On-Policy Distillation for Large Language Models
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
Dependency-Aware Semi-Structured Sparsity of GLU Variants in Large Language Models
di: Guo, Zhiyu, et al.
Pubblicazione: (2024)
di: Guo, Zhiyu, et al.
Pubblicazione: (2024)
Correcting Large Language Model Behavior via Influence Function
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
Collaborative Performance Prediction for Large Language Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
Structure-Preserving Network Compression Via Low-Rank Induced Training Through Linear Layers Composition
di: Zhang, Xitong, et al.
Pubblicazione: (2024)
di: Zhang, Xitong, et al.
Pubblicazione: (2024)
Self-AMPLIFY: Improving Small Language Models with Self Post Hoc Explanations
di: Bhan, Milan, et al.
Pubblicazione: (2024)
di: Bhan, Milan, et al.
Pubblicazione: (2024)
The Moral Gap of Large Language Models
di: Skorski, Maciej, et al.
Pubblicazione: (2025)
di: Skorski, Maciej, et al.
Pubblicazione: (2025)
Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models
di: Mao, Zhenjiang, et al.
Pubblicazione: (2026)
di: Mao, Zhenjiang, et al.
Pubblicazione: (2026)
On the Thinking-Language Modeling Gap in Large Language Models
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Smaller Large Language Models Can Do Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2024) -
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
di: Liu, Guangliang, et al.
Pubblicazione: (2024) -
Discourse Heuristics For Paradoxically Moral Self-Correction
di: Liu, Guangliang, et al.
Pubblicazione: (2025) -
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
di: Chen, Bocheng, et al.
Pubblicazione: (2026) -
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis
di: Liu, Guangliang, et al.
Pubblicazione: (2024)