Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
Fuente:
arXiv
Guardado en:
| Autores principales: | Mohamadi, Mohamad Amin, Wang, Tianhao, Li, Zhiyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adam Exploits $\ell_\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity
por: Xie, Shuo, et al.
Publicado: (2024)
por: Xie, Shuo, et al.
Publicado: (2024)
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
por: Mohamadi, Mohamad Amin, et al.
Publicado: (2024)
por: Mohamadi, Mohamad Amin, et al.
Publicado: (2024)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
por: Ren, Richard, et al.
Publicado: (2025)
por: Ren, Richard, et al.
Publicado: (2025)
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
por: McKee-Reid, Leo, et al.
Publicado: (2024)
por: McKee-Reid, Leo, et al.
Publicado: (2024)
Training LLMs for Honesty via Confessions
por: Joglekar, Manas, et al.
Publicado: (2025)
por: Joglekar, Manas, et al.
Publicado: (2025)
EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
por: Tamo, J. Ben, et al.
Publicado: (2026)
por: Tamo, J. Ben, et al.
Publicado: (2026)
How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?
por: Liu, Ryan, et al.
Publicado: (2024)
por: Liu, Ryan, et al.
Publicado: (2024)
Honesty in Causal Forests: When It Helps and When It Hurts
por: Hou, Yanfang, et al.
Publicado: (2025)
por: Hou, Yanfang, et al.
Publicado: (2025)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
por: Yang, Jinluan, et al.
Publicado: (2025)
por: Yang, Jinluan, et al.
Publicado: (2025)
Provable Benefit of Sign Descent: A Minimal Model Under Heavy-Tailed Class Imbalance
por: Yadav, Robin, et al.
Publicado: (2025)
por: Yadav, Robin, et al.
Publicado: (2025)
A Tale of Two Geometries: Adaptive Optimizers and Non-Euclidean Descent
por: Xie, Shuo, et al.
Publicado: (2025)
por: Xie, Shuo, et al.
Publicado: (2025)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
por: Qian, Tianhao
Publicado: (2026)
por: Qian, Tianhao
Publicado: (2026)
Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis
por: F, Clifford, et al.
Publicado: (2025)
por: F, Clifford, et al.
Publicado: (2025)
Preference Learning with Lie Detectors can Induce Honesty or Evasion
por: Cundy, Chris, et al.
Publicado: (2025)
por: Cundy, Chris, et al.
Publicado: (2025)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
por: Gu, Renjie, et al.
Publicado: (2026)
por: Gu, Renjie, et al.
Publicado: (2026)
Structured Preconditioners in Adaptive Optimization: A Unified Analysis
por: Xie, Shuo, et al.
Publicado: (2025)
por: Xie, Shuo, et al.
Publicado: (2025)
Incentivizing Honesty among Competitors in Collaborative Learning and Optimization
por: Dorner, Florian E., et al.
Publicado: (2023)
por: Dorner, Florian E., et al.
Publicado: (2023)
AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations
por: Clark, Michael J.
Publicado: (2026)
por: Clark, Michael J.
Publicado: (2026)
The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes
por: Taufeeque, Mohammad, et al.
Publicado: (2026)
por: Taufeeque, Mohammad, et al.
Publicado: (2026)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
por: Mo, Yichuan, et al.
Publicado: (2026)
por: Mo, Yichuan, et al.
Publicado: (2026)
The Marginal Value of Momentum for Small Learning Rate SGD
por: Wang, Runzhe, et al.
Publicado: (2023)
por: Wang, Runzhe, et al.
Publicado: (2023)
Enhanced High-Dimensional Data Visualization through Adaptive Multi-Scale Manifold Embedding
por: Ni, Tianhao, et al.
Publicado: (2025)
por: Ni, Tianhao, et al.
Publicado: (2025)
Think Before You Lie: How Reasoning Leads to Honesty
por: Yuan, Ann, et al.
Publicado: (2026)
por: Yuan, Ann, et al.
Publicado: (2026)
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization
por: Yuan, Haochen, et al.
Publicado: (2025)
por: Yuan, Haochen, et al.
Publicado: (2025)
PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
por: Gong, Chen, et al.
Publicado: (2025)
por: Gong, Chen, et al.
Publicado: (2025)
TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents
por: Gong, Chen, et al.
Publicado: (2024)
por: Gong, Chen, et al.
Publicado: (2024)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
por: Pawelczyk, Martin, et al.
Publicado: (2024)
por: Pawelczyk, Martin, et al.
Publicado: (2024)
Beyond Accuracy: On the Effects of Fine-tuning Towards Vision-Language Model's Prediction Rationality
por: Wang, Qitong, et al.
Publicado: (2024)
por: Wang, Qitong, et al.
Publicado: (2024)
Trustworthy Classification through Rank-Based Conformal Prediction Sets
por: Luo, Rui, et al.
Publicado: (2024)
por: Luo, Rui, et al.
Publicado: (2024)
HARP: Hesitation-Aware Reframing in Transformer Inference Pass
por: Storaï, Romain, et al.
Publicado: (2024)
por: Storaï, Romain, et al.
Publicado: (2024)
Strong Transitivity Relations and Graph Neural Networks
por: Mohamadi, Yassin, et al.
Publicado: (2024)
por: Mohamadi, Yassin, et al.
Publicado: (2024)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
por: Pan, Jiazhen, et al.
Publicado: (2025)
por: Pan, Jiazhen, et al.
Publicado: (2025)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment
por: Liu, Yang, et al.
Publicado: (2023)
por: Liu, Yang, et al.
Publicado: (2023)
Unlearning Imperative: Securing Trustworthy and Responsible LLMs through Engineered Forgetting
por: Kang, James Jin, et al.
Publicado: (2025)
por: Kang, James Jin, et al.
Publicado: (2025)
Evaluating Reinforcement Learning Safety and Trustworthiness in Cyber-Physical Systems
por: Dearstyne, Katherine, et al.
Publicado: (2025)
por: Dearstyne, Katherine, et al.
Publicado: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
por: Hou, Zhenyu, et al.
Publicado: (2025)
por: Hou, Zhenyu, et al.
Publicado: (2025)
A Survey on Medical Large Language Models: Technology, Application, Trustworthiness, and Future Directions
por: Liu, Lei, et al.
Publicado: (2024)
por: Liu, Lei, et al.
Publicado: (2024)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
por: Xing, Shuo, et al.
Publicado: (2024)
por: Xing, Shuo, et al.
Publicado: (2024)
Open-World Reinforcement Learning over Long Short-Term Imagination
por: Li, Jiajian, et al.
Publicado: (2024)
por: Li, Jiajian, et al.
Publicado: (2024)
Ejemplares similares
-
Adam Exploits $\ell_\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity
por: Xie, Shuo, et al.
Publicado: (2024) -
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
por: Mohamadi, Mohamad Amin, et al.
Publicado: (2024) -
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
por: Ren, Richard, et al.
Publicado: (2025) -
Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack
por: McKee-Reid, Leo, et al.
Publicado: (2024) -
Training LLMs for Honesty via Confessions
por: Joglekar, Manas, et al.
Publicado: (2025)