Enhanced Language Model Truthfulness with Learnable Intervention and Uncertainty Expression
Fuente:
arXiv
Salvato in:
| Autori principali: | Bayat, Farima Fatahi, Liu, Xin, Jagadish, H. V., Wang, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided Decoding
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024)
From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2025)
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
di: Vazhentsev, Artem, et al.
Pubblicazione: (2024)
di: Vazhentsev, Artem, et al.
Pubblicazione: (2024)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
di: Chen, Zhongzhi, et al.
Pubblicazione: (2023)
di: Chen, Zhongzhi, et al.
Pubblicazione: (2023)
APE: Active Learning-based Tooling for Finding Informative Few-shot Examples for LLM-based Entity Matching
di: Qian, Kun, et al.
Pubblicazione: (2024)
di: Qian, Kun, et al.
Pubblicazione: (2024)
Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
di: Srey, Ponhvoan, et al.
Pubblicazione: (2026)
Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models
di: Vazhentsev, Artem, et al.
Pubblicazione: (2025)
di: Vazhentsev, Artem, et al.
Pubblicazione: (2025)
Finetuning Language Models to Emit Linguistic Expressions of Uncertainty
di: Chaudhry, Arslan, et al.
Pubblicazione: (2024)
di: Chaudhry, Arslan, et al.
Pubblicazione: (2024)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
di: Li, Kenneth, et al.
Pubblicazione: (2023)
di: Li, Kenneth, et al.
Pubblicazione: (2023)
TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
di: Duan, Jinhao, et al.
Pubblicazione: (2025)
ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models
di: Dasgupta, Sharanya, et al.
Pubblicazione: (2026)
di: Dasgupta, Sharanya, et al.
Pubblicazione: (2026)
Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration
di: Liu, Xin, et al.
Pubblicazione: (2026)
di: Liu, Xin, et al.
Pubblicazione: (2026)
Offline Training of Language Model Agents with Functions as Learnable Weights
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
DNACHUNKER: Learnable Tokenization for DNA Language Models
di: Kim, Taewon, et al.
Pubblicazione: (2026)
di: Kim, Taewon, et al.
Pubblicazione: (2026)
Enhancing Confidence Expression in Large Language Models Through Learning from Past Experience
di: Han, Haixia, et al.
Pubblicazione: (2024)
di: Han, Haixia, et al.
Pubblicazione: (2024)
Emergence of Linear Truth Encodings in Language Models
di: Ravfogel, Shauli, et al.
Pubblicazione: (2025)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2025)
On the Learnability of Watermarks for Language Models
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
To Tell The Truth: Language of Deception and Language Models
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs
di: Liu, Gabrielle Kaili-May, et al.
Pubblicazione: (2025)
di: Liu, Gabrielle Kaili-May, et al.
Pubblicazione: (2025)
Syntactic Learnability of Echo State Neural Language Models at Scale
di: Ueda, Ryo, et al.
Pubblicazione: (2025)
di: Ueda, Ryo, et al.
Pubblicazione: (2025)
Representational and Behavioral Stability of Truth in Large Language Models
di: Dies, Samantha, et al.
Pubblicazione: (2025)
di: Dies, Samantha, et al.
Pubblicazione: (2025)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
di: Wang, Keyu, et al.
Pubblicazione: (2025)
di: Wang, Keyu, et al.
Pubblicazione: (2025)
Truth Knows No Language: Evaluating Truthfulness Beyond English
di: Figueras, Blanca Calvo, et al.
Pubblicazione: (2025)
di: Figueras, Blanca Calvo, et al.
Pubblicazione: (2025)
ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory
di: Xiao, Yunzhong, et al.
Pubblicazione: (2025)
di: Xiao, Yunzhong, et al.
Pubblicazione: (2025)
From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
Non-Linear Inference Time Intervention: Improving LLM Truthfulness
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
Learnable Privacy Neurons Localization in Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino
di: Nery, Lorenzo Alfred, et al.
Pubblicazione: (2025)
di: Nery, Lorenzo Alfred, et al.
Pubblicazione: (2025)
Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization
di: Wang, Jianing, et al.
Pubblicazione: (2024)
di: Wang, Jianing, et al.
Pubblicazione: (2024)
LitCab: Lightweight Language Model Calibration over Short- and Long-form Responses
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization
di: Wang, Yun, et al.
Pubblicazione: (2026)
di: Wang, Yun, et al.
Pubblicazione: (2026)
Enhancing Fact Retrieval in PLMs through Truthfulness
di: Youssef, Paul, et al.
Pubblicazione: (2024)
di: Youssef, Paul, et al.
Pubblicazione: (2024)
Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models
di: Zeng, Qingcheng, et al.
Pubblicazione: (2024)
di: Zeng, Qingcheng, et al.
Pubblicazione: (2024)
Entropy2Vec: Crosslingual Language Modeling Entropy as End-to-End Learnable Language Representations
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
Structure-Learnable Adapter Fine-Tuning for Parameter-Efficient Large Language Models
di: Gong, Ming, et al.
Pubblicazione: (2025)
di: Gong, Ming, et al.
Pubblicazione: (2025)
Query-Aware Learnable Graph Pooling Tokens as Prompt for Large Language Models
di: Kim, Wooyoung, et al.
Pubblicazione: (2025)
di: Kim, Wooyoung, et al.
Pubblicazione: (2025)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
di: Yin, Fan, et al.
Pubblicazione: (2024)
di: Yin, Fan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided Decoding
di: Liu, Xin, et al.
Pubblicazione: (2024) -
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2024) -
From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
di: Bayat, Farima Fatahi, et al.
Pubblicazione: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)