Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Jiajun, Shen, Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
par: Shen, Hua, et autres
Publié: (2025)
par: Shen, Hua, et autres
Publié: (2025)
ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs
par: Shen, Hua, et autres
Publié: (2024)
par: Shen, Hua, et autres
Publié: (2024)
Democratizing Reward Design for Personal and Representative Value-Alignment
par: Blair, Carter, et autres
Publié: (2024)
par: Blair, Carter, et autres
Publié: (2024)
Epistemic Alignment: A Mediating Framework for User-LLM Knowledge Delivery
par: Clark, Nicholas, et autres
Publié: (2025)
par: Clark, Nicholas, et autres
Publié: (2025)
Bidirectional Human-AI Alignment in Education for Trustworthy Learning Environments
par: Shen, Hua
Publié: (2025)
par: Shen, Hua
Publié: (2025)
Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures
par: Shen, Hua, et autres
Publié: (2025)
par: Shen, Hua, et autres
Publié: (2025)
Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking
par: Lau, Gabriel Rongyang, et autres
Publié: (2025)
par: Lau, Gabriel Rongyang, et autres
Publié: (2025)
Heterogeneous Value Alignment Evaluation for Large Language Models
par: Zhang, Zhaowei, et autres
Publié: (2023)
par: Zhang, Zhaowei, et autres
Publié: (2023)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
par: Chen, Guanyu, et autres
Publié: (2026)
par: Chen, Guanyu, et autres
Publié: (2026)
MAP: Multi-Human-Value Alignment Palette
par: Wang, Xinran, et autres
Publié: (2024)
par: Wang, Xinran, et autres
Publié: (2024)
Interactive AI Alignment: Specification, Process, and Evaluation Alignment
par: Terry, Michael, et autres
Publié: (2023)
par: Terry, Michael, et autres
Publié: (2023)
The Moral Turing Test: Evaluating Human-LLM Alignment in Moral Decision-Making
par: Garcia, Basile, et autres
Publié: (2024)
par: Garcia, Basile, et autres
Publié: (2024)
An Audio-Visual Fusion Emotion Generation Model Based on Neuroanatomical Alignment
par: Wang, Haidong, et autres
Publié: (2025)
par: Wang, Haidong, et autres
Publié: (2025)
Context-Value-Action Architecture for Value-Driven Large Language Model Agents
par: Zhang, TianZe, et autres
Publié: (2026)
par: Zhang, TianZe, et autres
Publié: (2026)
DxHF: Providing High-Quality Human Feedback for LLM Alignment via Interactive Decomposition
par: Shi, Danqing, et autres
Publié: (2025)
par: Shi, Danqing, et autres
Publié: (2025)
Chain of Alignment: Integrating Public Will with Expert Intelligence for Language Model Alignment
par: Konya, Andrew, et autres
Publié: (2024)
par: Konya, Andrew, et autres
Publié: (2024)
Alignment has a Fantasia Problem
par: Jo, Nathanael, et autres
Publié: (2026)
par: Jo, Nathanael, et autres
Publié: (2026)
Position: Towards Bidirectional Human-AI Alignment
par: Shen, Hua, et autres
Publié: (2024)
par: Shen, Hua, et autres
Publié: (2024)
Unexploited Information Value in Human-AI Collaboration
par: Guo, Ziyang, et autres
Publié: (2024)
par: Guo, Ziyang, et autres
Publié: (2024)
The Value-Sensitive Conversational Agent Co-Design Framework
par: Sadek, Malak, et autres
Publié: (2023)
par: Sadek, Malak, et autres
Publié: (2023)
Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks
par: Greco, Candida M., et autres
Publié: (2026)
par: Greco, Candida M., et autres
Publié: (2026)
Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale
par: Li, Weiyue, et autres
Publié: (2026)
par: Li, Weiyue, et autres
Publié: (2026)
Interoceptive Divergence in Aesthetic Evaluation and Implications for Human-AI Alignment
par: Abe, Yoshia, et autres
Publié: (2026)
par: Abe, Yoshia, et autres
Publié: (2026)
Alignment-Process-Outcome: Rethinking How AIs and Humans Collaborate
par: Li, Haichang, et autres
Publié: (2026)
par: Li, Haichang, et autres
Publié: (2026)
The Impact of AI on Educational Assessment: A Framework for Constructive Alignment
par: Stokkink, Patrick
Publié: (2025)
par: Stokkink, Patrick
Publié: (2025)
Principles Do Not Apply Themselves: A Hermeneutic Perspective on AI Alignment
par: Razeghi, Behrooz
Publié: (2026)
par: Razeghi, Behrooz
Publié: (2026)
Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans
par: Kwon, Deuksin, et autres
Publié: (2025)
par: Kwon, Deuksin, et autres
Publié: (2025)
Toward Human-AI Alignment in Large-Scale Multi-Player Games
par: Sharma, Sugandha, et autres
Publié: (2024)
par: Sharma, Sugandha, et autres
Publié: (2024)
Infrastructuring Contestability: A Framework for Community-Defined AI Value Pluralism
par: Mayer, Andreas
Publié: (2025)
par: Mayer, Andreas
Publié: (2025)
AI Chatbots for Mental Health: Values and Harms from Lived Experiences of Depression
par: Yoo, Dong Whi, et autres
Publié: (2025)
par: Yoo, Dong Whi, et autres
Publié: (2025)
From Voice to Value: Leveraging AI to Enhance Spoken Online Reviews on the Go
par: Ravishan, Kavindu, et autres
Publié: (2024)
par: Ravishan, Kavindu, et autres
Publié: (2024)
Embedding Democratic Values into Social Media AIs via Societal Objective Functions
par: Jia, Chenyan, et autres
Publié: (2023)
par: Jia, Chenyan, et autres
Publié: (2023)
Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment
par: Ahn, Yongsu, et autres
Publié: (2026)
par: Ahn, Yongsu, et autres
Publié: (2026)
Joint Contrastive Learning with Feature Alignment for Cross-Corpus EEG-based Emotion Recognition
par: Liu, Qile, et autres
Publié: (2024)
par: Liu, Qile, et autres
Publié: (2024)
Human-Human-AI Triadic Programming: Uncovering the Role of AI Agent and the Value of Human Partner in Collaborative Learning
par: Daryanto, Taufiq, et autres
Publié: (2026)
par: Daryanto, Taufiq, et autres
Publié: (2026)
The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers
par: Chen, Benjamin Minhao, et autres
Publié: (2026)
par: Chen, Benjamin Minhao, et autres
Publié: (2026)
A Crowdsourced Study of ChatBot Influence in Value-Driven Decision Making Scenarios
par: Wise, Anthony, et autres
Publié: (2025)
par: Wise, Anthony, et autres
Publié: (2025)
Authors' Values and Attitudes Towards AI-bridged Scalable Personalization of Creative Language Arts
par: Kim, Taewook, et autres
Publié: (2024)
par: Kim, Taewook, et autres
Publié: (2024)
The Use of Artificial Intelligence in Military Intelligence: An Experimental Investigation of Added Value in the Analysis Process
par: Nitzl, Christian, et autres
Publié: (2024)
par: Nitzl, Christian, et autres
Publié: (2024)
Urbanite: A Dataflow-Based Framework for Human-AI Interactive Alignment in Urban Visual Analytics
par: Moreira, Gustavo, et autres
Publié: (2025)
par: Moreira, Gustavo, et autres
Publié: (2025)
Documents similaires
-
Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?
par: Shen, Hua, et autres
Publié: (2025) -
ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs
par: Shen, Hua, et autres
Publié: (2024) -
Democratizing Reward Design for Personal and Representative Value-Alignment
par: Blair, Carter, et autres
Publié: (2024) -
Epistemic Alignment: A Mediating Framework for User-LLM Knowledge Delivery
par: Clark, Nicholas, et autres
Publié: (2025) -
Bidirectional Human-AI Alignment in Education for Trustworthy Learning Environments
par: Shen, Hua
Publié: (2025)