Enregistré dans:
| Auteurs principaux: | Liu, Guangliang, Mao, Haitao, Cao, Bochuan, Xue, Zhiyu, Zhang, Xitong, Wang, Rongrong, Johnson, Kristen Marie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.07290 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Smaller Large Language Models Can Do Moral Self-Correction
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
Discourse Heuristics For Paradoxically Moral Self-Correction
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
par: Chen, Bocheng, et autres
Publié: (2026)
par: Chen, Bocheng, et autres
Publié: (2026)
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Self-correction is Not An Innate Capability in Language Models
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
Towards Understanding Task-agnostic Debiasing Through the Lenses of Intrinsic Bias and Forgetfulness
par: Liu, Guangliang, et autres
Publié: (2024)
par: Liu, Guangliang, et autres
Publié: (2024)
Improving Generalization of Complex Models under Unbounded Loss Using PAC-Bayes Bounds
par: Zhang, Xitong, et autres
Publié: (2023)
par: Zhang, Xitong, et autres
Publié: (2023)
Pragmatic Inference for Moral Reasoning Acquisition: Generalization via Metapragmatic Links
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution
par: Chang, Yurui, et autres
Publié: (2024)
par: Chang, Yurui, et autres
Publié: (2024)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
A Survey to Recent Progress Towards Understanding In-Context Learning
par: Mao, Haitao, et autres
Publié: (2024)
par: Mao, Haitao, et autres
Publié: (2024)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
par: Cao, Yuanpu, et autres
Publié: (2024)
par: Cao, Yuanpu, et autres
Publié: (2024)
Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation
par: Chang, Yurui, et autres
Publié: (2025)
par: Chang, Yurui, et autres
Publié: (2025)
Communication-Efficient and Tensorized Federated Fine-Tuning of Large Language Models
par: Ghiasvand, Sajjad, et autres
Publié: (2024)
par: Ghiasvand, Sajjad, et autres
Publié: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
ProgCo: Program Helps Self-Correction of Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2025)
par: Song, Xiaoshuai, et autres
Publié: (2025)
Label-free Node Classification on Graphs with Large Language Models (LLMS)
par: Chen, Zhikai, et autres
Publié: (2023)
par: Chen, Zhikai, et autres
Publié: (2023)
Measuring Moral Inconsistencies in Large Language Models
par: Bonagiri, Vamshi Krishna, et autres
Publié: (2024)
par: Bonagiri, Vamshi Krishna, et autres
Publié: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
par: Chen, Haozhe, et autres
Publié: (2024)
par: Chen, Haozhe, et autres
Publié: (2024)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
par: Mao, Yu, et autres
Publié: (2025)
par: Mao, Yu, et autres
Publié: (2025)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
par: Tsui, Ken
Publié: (2025)
par: Tsui, Ken
Publié: (2025)
Self-Taught Self-Correction for Small Language Models
par: Moskvoretskii, Viktor, et autres
Publié: (2025)
par: Moskvoretskii, Viktor, et autres
Publié: (2025)
CoBa: Convergence Balancer for Multitask Finetuning of Large Language Models
par: Gong, Zi, et autres
Publié: (2024)
par: Gong, Zi, et autres
Publié: (2024)
Structure-Preserving Network Compression Via Low-Rank Induced Training Through Linear Layers Composition
par: Zhang, Xitong, et autres
Publié: (2024)
par: Zhang, Xitong, et autres
Publié: (2024)
On the Convergence of Zeroth-Order Federated Tuning for Large Language Models
par: Ling, Zhenqing, et autres
Publié: (2024)
par: Ling, Zhenqing, et autres
Publié: (2024)
Dependency-Aware Semi-Structured Sparsity of GLU Variants in Large Language Models
par: Guo, Zhiyu, et autres
Publié: (2024)
par: Guo, Zhiyu, et autres
Publié: (2024)
The Moral Gap of Large Language Models
par: Skorski, Maciej, et autres
Publié: (2025)
par: Skorski, Maciej, et autres
Publié: (2025)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
par: Liu, Shuo, et autres
Publié: (2026)
par: Liu, Shuo, et autres
Publié: (2026)
Collaborative Performance Prediction for Large Language Models
par: Zhang, Qiyuan, et autres
Publié: (2024)
par: Zhang, Qiyuan, et autres
Publié: (2024)
A Survey of On-Policy Distillation for Large Language Models
par: Song, Mingyang, et autres
Publié: (2026)
par: Song, Mingyang, et autres
Publié: (2026)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
par: Yu, Peiqi, et autres
Publié: (2026)
par: Yu, Peiqi, et autres
Publié: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
par: Zhao, Siyan, et autres
Publié: (2026)
par: Zhao, Siyan, et autres
Publié: (2026)
Correcting Large Language Model Behavior via Influence Function
par: Zhang, Han, et autres
Publié: (2024)
par: Zhang, Han, et autres
Publié: (2024)
Graph Machine Learning in the Era of Large Language Models (LLMs)
par: Wang, Shijie, et autres
Publié: (2024)
par: Wang, Shijie, et autres
Publié: (2024)
LLM4Causal: Democratized Causal Tools for Everyone via Large Language Model
par: Jiang, Haitao, et autres
Publié: (2023)
par: Jiang, Haitao, et autres
Publié: (2023)
Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models
par: Morlat, Geoffroy, et autres
Publié: (2025)
par: Morlat, Geoffroy, et autres
Publié: (2025)
Documents similaires
-
Smaller Large Language Models Can Do Moral Self-Correction
par: Liu, Guangliang, et autres
Publié: (2024) -
On the Intrinsic Self-Correction Capability of LLMs: Uncertainty and Latent Concept
par: Liu, Guangliang, et autres
Publié: (2024) -
Discourse Heuristics For Paradoxically Moral Self-Correction
par: Liu, Guangliang, et autres
Publié: (2025) -
Learning to Diagnose and Correct Errors: Towards Moral Sensitivity Acquisition in Large Language Models
par: Chen, Bocheng, et autres
Publié: (2026) -
Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis
par: Liu, Guangliang, et autres
Publié: (2024)