Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yue, Gao, Chujie, Zhou, Yujun, Guo, Kehan, Wang, Xiangqi, Cohen-Sasson, Or, Lamparth, Max, Zhang, Xiangliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HonestLLM: Toward an Honest and Helpful Large Language Model
di: Gao, Chujie, et al.
Pubblicazione: (2024)
di: Gao, Chujie, et al.
Pubblicazione: (2024)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
Causally-Enhanced Reinforcement Policy Optimization
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
ProbeLLM: Automating Principled Diagnosis of LLM Failures
di: Huang, Yue, et al.
Pubblicazione: (2026)
di: Huang, Yue, et al.
Pubblicazione: (2026)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
The New Pro Se: Generative AI and the Surge in Federal Civil Self-Representation
di: Cohen-Sasson, Or
Pubblicazione: (2026)
di: Cohen-Sasson, Or
Pubblicazione: (2026)
Dual Optimal: Make Your LLM Peer-like with Dignity
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
di: Wang, Xiangqi, et al.
Pubblicazione: (2026)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset
di: Chehbouni, Khaoula, et al.
Pubblicazione: (2024)
di: Chehbouni, Khaoula, et al.
Pubblicazione: (2024)
Too Helpful, Too Harmless, Too Honest or Just Right?
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations
di: Shrivastava, Aryan, et al.
Pubblicazione: (2024)
di: Shrivastava, Aryan, et al.
Pubblicazione: (2024)
Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation
di: Grabb, Declan, et al.
Pubblicazione: (2024)
di: Grabb, Declan, et al.
Pubblicazione: (2024)
VDR-LLM-Prolog: Alignment: Helpful, Harmless, Honest Through Structure, Not Interference
di: Howland, Geoffrey
Pubblicazione: (2026)
di: Howland, Geoffrey
Pubblicazione: (2026)
We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
di: Kashyap, Gautam Siddharth, et al.
Pubblicazione: (2025)
Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors
di: Liang, Ren-Wei, et al.
Pubblicazione: (2025)
di: Liang, Ren-Wei, et al.
Pubblicazione: (2025)
Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills
di: Noever, David
Pubblicazione: (2025)
di: Noever, David
Pubblicazione: (2025)
MCTSr-Zero: Self-Reflective Psychological Counseling Dialogues Generation via Principles and Adaptive Exploration
di: Lu, Hao, et al.
Pubblicazione: (2025)
di: Lu, Hao, et al.
Pubblicazione: (2025)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
di: Zhou, Yujun, et al.
Pubblicazione: (2025)
The Emergence of Socio-Economic Structure: A First-Principles Kinetic Theory
di: Durán-Olivencia, Miguel A.
Pubblicazione: (2025)
di: Durán-Olivencia, Miguel A.
Pubblicazione: (2025)
From First Principles to Multi-scale Decomposition:Mutual Information as a Segregation Index
di: Sahasrabuddhe, Rohit, et al.
Pubblicazione: (2025)
di: Sahasrabuddhe, Rohit, et al.
Pubblicazione: (2025)
Dishonesty in Helpful and Harmless Alignment
di: Huang, Youcheng, et al.
Pubblicazione: (2024)
di: Huang, Youcheng, et al.
Pubblicazione: (2024)
The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies
di: Zhou, Jiaxu, et al.
Pubblicazione: (2025)
di: Zhou, Jiaxu, et al.
Pubblicazione: (2025)
On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Towards Harmless Rawlsian Fairness Regardless of Demographic Prior
di: Wang, Xuanqian, et al.
Pubblicazione: (2024)
di: Wang, Xuanqian, et al.
Pubblicazione: (2024)
A First-Principles Based Risk Assessment Framework and the IEEE P3396 Standard
di: Tong, Richard J., et al.
Pubblicazione: (2025)
di: Tong, Richard J., et al.
Pubblicazione: (2025)
Human vs. Machine: Behavioral Differences Between Expert Humans and Language Models in Wargame Simulations
di: Lamparth, Max, et al.
Pubblicazione: (2024)
di: Lamparth, Max, et al.
Pubblicazione: (2024)
The Precautionary Principle and the Innovation Principle: Incompatible Guides for AI Innovation Governance?
di: Kaivanto, Kim
Pubblicazione: (2025)
di: Kaivanto, Kim
Pubblicazione: (2025)
HypoBench: Towards Systematic and Principled Benchmarking for Hypothesis Generation
di: Liu, Haokun, et al.
Pubblicazione: (2025)
di: Liu, Haokun, et al.
Pubblicazione: (2025)
Operations & Supply Chain Management: Principles and Practice
di: Petropoulos, Fotios, et al.
Pubblicazione: (2025)
di: Petropoulos, Fotios, et al.
Pubblicazione: (2025)
Generative AI as a Design Variable: An Evidence-Centered Framework for Principled Governance in STEM Assessment
di: Gao, Yizhu, et al.
Pubblicazione: (2026)
di: Gao, Yizhu, et al.
Pubblicazione: (2026)
NARRA-Gym for Evaluating Interactive Narrative Agents
di: Huang, Yue, et al.
Pubblicazione: (2026)
di: Huang, Yue, et al.
Pubblicazione: (2026)
Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosis
di: Lang, Yicheng, et al.
Pubblicazione: (2025)
di: Lang, Yicheng, et al.
Pubblicazione: (2025)
Effect of Br Substitution on KBeCl 3 : Optoelectronic and Mechanical Properties via First‐Principle Calculations
di: Archana, et al.
Pubblicazione: (2026)
di: Archana, et al.
Pubblicazione: (2026)
World Models Should Prioritize the Unification of Physical and Social Dynamics
di: Zhang, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyuan, et al.
Pubblicazione: (2025)
Toward a Principled Framework for Disclosure Avoidance
di: Hawes, Michael B, et al.
Pubblicazione: (2025)
di: Hawes, Michael B, et al.
Pubblicazione: (2025)
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
di: Rivera, Juan-Pablo, et al.
Pubblicazione: (2024)
di: Rivera, Juan-Pablo, et al.
Pubblicazione: (2024)
Practical Principles for AI Cost and Compute Accounting
di: Casper, Stephen, et al.
Pubblicazione: (2025)
di: Casper, Stephen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HonestLLM: Toward an Honest and Helpful Large Language Model
di: Gao, Chujie, et al.
Pubblicazione: (2024) -
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025) -
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
di: Wang, Xiangqi, et al.
Pubblicazione: (2025) -
Causally-Enhanced Reinforcement Policy Optimization
di: Wang, Xiangqi, et al.
Pubblicazione: (2025) -
ProbeLLM: Automating Principled Diagnosis of LLM Failures
di: Huang, Yue, et al.
Pubblicazione: (2026)