TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shaolei, Yu, Tian, Feng, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
par: Rahman, Subhey Sadi, et autres
Publié: (2025)
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024)
par: Dhurandhar, Amit, et autres
Publié: (2024)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
par: Liang, Kaiqu, et autres
Publié: (2025)
par: Liang, Kaiqu, et autres
Publié: (2025)
Personas as a Way to Model Truthfulness in Language Models
par: Joshi, Nitish, et autres
Publié: (2023)
par: Joshi, Nitish, et autres
Publié: (2023)
Truth-Aware Context Selection: Mitigating Hallucinations of Large Language Models Being Misled by Untruthful Contexts
par: Yu, Tian, et autres
Publié: (2024)
par: Yu, Tian, et autres
Publié: (2024)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
par: Goel, Naman
Publié: (2023)
par: Goel, Naman
Publié: (2023)
When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
par: Halawi, Danny, et autres
Publié: (2023)
par: Halawi, Danny, et autres
Publié: (2023)
Soft Tokens, Hard Truths
par: Butt, Natasha, et autres
Publié: (2025)
par: Butt, Natasha, et autres
Publié: (2025)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
The Geometries of Truth Are Orthogonal Across Tasks
par: Azizian, Waiss, et autres
Publié: (2025)
par: Azizian, Waiss, et autres
Publié: (2025)
FRED: Financial Retrieval-Enhanced Detection and Editing of Hallucinations in Language Models
par: Tan, Likun, et autres
Publié: (2025)
par: Tan, Likun, et autres
Publié: (2025)
Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models
par: Xiong, Guangzhi, et autres
Publié: (2025)
par: Xiong, Guangzhi, et autres
Publié: (2025)
How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence
par: Du, Hongzhe, et autres
Publié: (2025)
par: Du, Hongzhe, et autres
Publié: (2025)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
par: Tang, Zilu, et autres
Publié: (2025)
par: Tang, Zilu, et autres
Publié: (2025)
Manifold-based Sampling for In-Context Hallucination Detection in Large Language Models
par: Vamshi, Bodla Krishna, et autres
Publié: (2026)
par: Vamshi, Bodla Krishna, et autres
Publié: (2026)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
par: Li, Yuangang, et autres
Publié: (2025)
par: Li, Yuangang, et autres
Publié: (2025)
Large Language Models are Skeptics: False Negative Problem of Input-conflicting Hallucination
par: Song, Jongyoon, et autres
Publié: (2024)
par: Song, Jongyoon, et autres
Publié: (2024)
LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning
par: Liu, Zihang, et autres
Publié: (2025)
par: Liu, Zihang, et autres
Publié: (2025)
Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning
par: Wang, Shengyuan, et autres
Publié: (2025)
par: Wang, Shengyuan, et autres
Publié: (2025)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Hallucination is Inevitable: An Innate Limitation of Large Language Models
par: Xu, Ziwei, et autres
Publié: (2024)
par: Xu, Ziwei, et autres
Publié: (2024)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
par: Zhang, Hongxiang, et autres
Publié: (2025)
par: Zhang, Hongxiang, et autres
Publié: (2025)
Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
par: Luo, Wen, et autres
Publié: (2026)
par: Luo, Wen, et autres
Publié: (2026)
From Ground Truth to Measurement: A Statistical Framework for Human Labeling
par: Chew, Robert, et autres
Publié: (2026)
par: Chew, Robert, et autres
Publié: (2026)
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
par: Zhang, Rongzhi, et autres
Publié: (2025)
par: Zhang, Rongzhi, et autres
Publié: (2025)
TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention
par: Duan, Jinhao, et autres
Publié: (2025)
par: Duan, Jinhao, et autres
Publié: (2025)
(Im)possibility of Automated Hallucination Detection in Large Language Models
par: Karbasi, Amin, et autres
Publié: (2025)
par: Karbasi, Amin, et autres
Publié: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
par: Min, Rui, et autres
Publié: (2026)
par: Min, Rui, et autres
Publié: (2026)
Knowledge Editing on Black-box Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024)
par: Qiu, Yifu, et autres
Publié: (2024)
Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
par: Chen, Zhongzhi, et autres
Publié: (2023)
par: Chen, Zhongzhi, et autres
Publié: (2023)
CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
Principled Detection of Hallucinations in Large Language Models via Multiple Testing
par: Li, Jiawei, et autres
Publié: (2025)
par: Li, Jiawei, et autres
Publié: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
par: Mündler, Niels, et autres
Publié: (2023)
par: Mündler, Niels, et autres
Publié: (2023)
Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
Documents similaires
-
Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models
par: Rahman, Subhey Sadi, et autres
Publié: (2025) -
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024) -
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025) -
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
par: Liang, Kaiqu, et autres
Publié: (2025) -
Personas as a Way to Model Truthfulness in Language Models
par: Joshi, Nitish, et autres
Publié: (2023)