Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
Fuente:
arXiv
Salvato in:
| Autori principali: | Mohamadi, Mohamad Amin, Wang, Tianhao, Li, Zhiyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adam Exploits $\ell_\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity
di: Xie, Shuo, et al.
Pubblicazione: (2024)
di: Xie, Shuo, et al.
Pubblicazione: (2024)
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
di: Ren, Richard, et al.
Pubblicazione: (2025)
di: Ren, Richard, et al.
Pubblicazione: (2025)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
di: McKee-Reid, Leo, et al.
Pubblicazione: (2024)
di: McKee-Reid, Leo, et al.
Pubblicazione: (2024)
Training LLMs for Honesty via Confessions
di: Joglekar, Manas, et al.
Pubblicazione: (2025)
di: Joglekar, Manas, et al.
Pubblicazione: (2025)
EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
di: Tamo, J. Ben, et al.
Pubblicazione: (2026)
di: Tamo, J. Ben, et al.
Pubblicazione: (2026)
How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?
di: Liu, Ryan, et al.
Pubblicazione: (2024)
di: Liu, Ryan, et al.
Pubblicazione: (2024)
Honesty in Causal Forests: When It Helps and When It Hurts
di: Hou, Yanfang, et al.
Pubblicazione: (2025)
di: Hou, Yanfang, et al.
Pubblicazione: (2025)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
Provable Benefit of Sign Descent: A Minimal Model Under Heavy-Tailed Class Imbalance
di: Yadav, Robin, et al.
Pubblicazione: (2025)
di: Yadav, Robin, et al.
Pubblicazione: (2025)
A Tale of Two Geometries: Adaptive Optimizers and Non-Euclidean Descent
di: Xie, Shuo, et al.
Pubblicazione: (2025)
di: Xie, Shuo, et al.
Pubblicazione: (2025)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
di: Qian, Tianhao
Pubblicazione: (2026)
di: Qian, Tianhao
Pubblicazione: (2026)
Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis
di: F, Clifford, et al.
Pubblicazione: (2025)
di: F, Clifford, et al.
Pubblicazione: (2025)
Preference Learning with Lie Detectors can Induce Honesty or Evasion
di: Cundy, Chris, et al.
Pubblicazione: (2025)
di: Cundy, Chris, et al.
Pubblicazione: (2025)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
di: Gu, Renjie, et al.
Pubblicazione: (2026)
di: Gu, Renjie, et al.
Pubblicazione: (2026)
Structured Preconditioners in Adaptive Optimization: A Unified Analysis
di: Xie, Shuo, et al.
Pubblicazione: (2025)
di: Xie, Shuo, et al.
Pubblicazione: (2025)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
di: Dorner, Florian E., et al.
Pubblicazione: (2023)
di: Dorner, Florian E., et al.
Pubblicazione: (2023)
AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations
di: Clark, Michael J.
Pubblicazione: (2026)
di: Clark, Michael J.
Pubblicazione: (2026)
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2026)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2026)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
di: Mo, Yichuan, et al.
Pubblicazione: (2026)
The Marginal Value of Momentum for Small Learning Rate SGD
di: Wang, Runzhe, et al.
Pubblicazione: (2023)
di: Wang, Runzhe, et al.
Pubblicazione: (2023)
Enhanced High-Dimensional Data Visualization through Adaptive Multi-Scale Manifold Embedding
di: Ni, Tianhao, et al.
Pubblicazione: (2025)
di: Ni, Tianhao, et al.
Pubblicazione: (2025)
Think Before You Lie: How Reasoning Leads to Honesty
di: Yuan, Ann, et al.
Pubblicazione: (2026)
di: Yuan, Ann, et al.
Pubblicazione: (2026)
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization
di: Yuan, Haochen, et al.
Pubblicazione: (2025)
di: Yuan, Haochen, et al.
Pubblicazione: (2025)
PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
di: Gong, Chen, et al.
Pubblicazione: (2025)
di: Gong, Chen, et al.
Pubblicazione: (2025)
TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents
di: Gong, Chen, et al.
Pubblicazione: (2024)
di: Gong, Chen, et al.
Pubblicazione: (2024)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
di: Pawelczyk, Martin, et al.
Pubblicazione: (2024)
di: Pawelczyk, Martin, et al.
Pubblicazione: (2024)
Beyond Accuracy: On the Effects of Fine-tuning Towards Vision-Language Model's Prediction Rationality
di: Wang, Qitong, et al.
Pubblicazione: (2024)
di: Wang, Qitong, et al.
Pubblicazione: (2024)
Trustworthy Classification through Rank-Based Conformal Prediction Sets
di: Luo, Rui, et al.
Pubblicazione: (2024)
di: Luo, Rui, et al.
Pubblicazione: (2024)
HARP: Hesitation-Aware Reframing in Transformer Inference Pass
di: Storaï, Romain, et al.
Pubblicazione: (2024)
di: Storaï, Romain, et al.
Pubblicazione: (2024)
Strong Transitivity Relations and Graph Neural Networks
di: Mohamadi, Yassin, et al.
Pubblicazione: (2024)
di: Mohamadi, Yassin, et al.
Pubblicazione: (2024)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
di: Pan, Jiazhen, et al.
Pubblicazione: (2025)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment
di: Liu, Yang, et al.
Pubblicazione: (2023)
di: Liu, Yang, et al.
Pubblicazione: (2023)
Unlearning Imperative: Securing Trustworthy and Responsible LLMs through Engineered Forgetting
di: Kang, James Jin, et al.
Pubblicazione: (2025)
di: Kang, James Jin, et al.
Pubblicazione: (2025)
Evaluating Reinforcement Learning Safety and Trustworthiness in Cyber-Physical Systems
di: Dearstyne, Katherine, et al.
Pubblicazione: (2025)
di: Dearstyne, Katherine, et al.
Pubblicazione: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
A Survey on Medical Large Language Models: Technology, Application, Trustworthiness, and Future Directions
di: Liu, Lei, et al.
Pubblicazione: (2024)
di: Liu, Lei, et al.
Pubblicazione: (2024)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
di: Xing, Shuo, et al.
Pubblicazione: (2024)
di: Xing, Shuo, et al.
Pubblicazione: (2024)
Open-World Reinforcement Learning over Long Short-Term Imagination
di: Li, Jiajian, et al.
Pubblicazione: (2024)
di: Li, Jiajian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Adam Exploits $\ell_\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity
di: Xie, Shuo, et al.
Pubblicazione: (2024) -
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024) -
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
di: Ren, Richard, et al.
Pubblicazione: (2025) -
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
di: McKee-Reid, Leo, et al.
Pubblicazione: (2024) -
Training LLMs for Honesty via Confessions
di: Joglekar, Manas, et al.
Pubblicazione: (2025)