HonestLLM: Toward an Honest and Helpful Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Chujie, Wu, Siyuan, Huang, Yue, Chen, Dongping, Zhang, Qihui, Fu, Zhengyan, Wan, Yao, Sun, Lichao, Zhang, Xiangliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DataGen: Unified Synthetic Dataset Generation via Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
di: Zhang, Qihui, et al.
Pubblicazione: (2024)
di: Zhang, Qihui, et al.
Pubblicazione: (2024)
Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Toward Honest Language Models for Deductive Reasoning
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
BeHonest: Benchmarking Honesty in Large Language Models
di: Chern, Steffi, et al.
Pubblicazione: (2024)
di: Chern, Steffi, et al.
Pubblicazione: (2024)
Are Large Language Models More Honest in Their Probabilistic or Verbalized Confidence?
di: Ni, Shiyu, et al.
Pubblicazione: (2024)
di: Ni, Shiyu, et al.
Pubblicazione: (2024)
Too Helpful, Too Harmless, Too Honest or Just Right?
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
di: Li, Yuan, et al.
Pubblicazione: (2024)
di: Li, Yuan, et al.
Pubblicazione: (2024)
FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness
di: Dong, Xiaoning, et al.
Pubblicazione: (2026)
di: Dong, Xiaoning, et al.
Pubblicazione: (2026)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model
di: Wang, Jingkai, et al.
Pubblicazione: (2025)
di: Wang, Jingkai, et al.
Pubblicazione: (2025)
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
di: Kusuma, Christopher Adrian, et al.
Pubblicazione: (2026)
di: Kusuma, Christopher Adrian, et al.
Pubblicazione: (2026)
Evaluating Large Language Models with Psychometrics
di: Li, Yuan, et al.
Pubblicazione: (2024)
di: Li, Yuan, et al.
Pubblicazione: (2024)
Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
Self-Cognition in Large Language Models: An Exploratory Study
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
di: Men, Tianyi, et al.
Pubblicazione: (2024)
di: Men, Tianyi, et al.
Pubblicazione: (2024)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
di: Chen, Xinxi, et al.
Pubblicazione: (2024)
di: Chen, Xinxi, et al.
Pubblicazione: (2024)
The Honest Equilibrium
di: Elliott, Jacob Alexander
Pubblicazione: (2026)
di: Elliott, Jacob Alexander
Pubblicazione: (2026)
Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
di: Ye, Jiayi, et al.
Pubblicazione: (2024)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
di: Zhang, Kang, et al.
Pubblicazione: (2024)
di: Zhang, Kang, et al.
Pubblicazione: (2024)
VDR-LLM-Prolog: Alignment: Helpful, Harmless, Honest Through Structure, Not Interference
di: Howland, Geoffrey
Pubblicazione: (2026)
di: Howland, Geoffrey
Pubblicazione: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Towards Rational Consensus in Honest Majority
di: Srivastava, Varul, et al.
Pubblicazione: (2024)
di: Srivastava, Varul, et al.
Pubblicazione: (2024)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Honest Students from Untrusted Teachers: Learning an Interpretable Question-Answering Pipeline from a Pretrained Language Model
di: Eisenstein, Jacob, et al.
Pubblicazione: (2022)
di: Eisenstein, Jacob, et al.
Pubblicazione: (2022)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
di: Song, Junru, et al.
Pubblicazione: (2026)
di: Song, Junru, et al.
Pubblicazione: (2026)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
TrustLLM: Trustworthiness in Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Code
di: Guan, Batu, et al.
Pubblicazione: (2024)
di: Guan, Batu, et al.
Pubblicazione: (2024)
Depth-Wise Activation Steering for Honest Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
di: Góral, Gracjan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DataGen: Unified Synthetic Dataset Generation via Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024) -
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
di: Zhang, Qihui, et al.
Pubblicazione: (2024) -
Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles
di: Huang, Yue, et al.
Pubblicazione: (2025) -
Toward Honest Language Models for Deductive Reasoning
di: Liu, Jiarui, et al.
Pubblicazione: (2025) -
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024)