Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Keswani, Vijay, Cousins, Cyrus, Nguyen, Breanna, Conitzer, Vincent, Heidari, Hoda, Borg, Jana Schaich, Sinnott-Armstrong, Walter |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Pros and Cons of Active Learning for Moral Preference Elicitation
di: Keswani, Vijay, et al.
Pubblicazione: (2024)
di: Keswani, Vijay, et al.
Pubblicazione: (2024)
Can AI Model the Complexities of Human Moral Decision-Making? A Qualitative Study of Kidney Allocation Decisions
di: Keswani, Vijay, et al.
Pubblicazione: (2025)
di: Keswani, Vijay, et al.
Pubblicazione: (2025)
On The Stability of Moral Preferences: A Problem with Computational Elicitation Methods
di: Boerstler, Kyle, et al.
Pubblicazione: (2024)
di: Boerstler, Kyle, et al.
Pubblicazione: (2024)
Towards Cognitively-Faithful Decision-Making Models to Improve AI Alignment
di: Cousins, Cyrus, et al.
Pubblicazione: (2025)
di: Cousins, Cyrus, et al.
Pubblicazione: (2025)
What Is Required for Empathic AI? It Depends, and Why That Matters for AI Developers and Users
di: Borg, Jana Schaich, et al.
Pubblicazione: (2024)
di: Borg, Jana Schaich, et al.
Pubblicazione: (2024)
Algorithms and Analysis for Optimizing Robust Objectives in Fair Machine Learning
di: Cousins, Cyrus
Pubblicazione: (2024)
di: Cousins, Cyrus
Pubblicazione: (2024)
Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
di: Liu, Jiarui, et al.
Pubblicazione: (2025)
Fair Classification with Partial Feedback: An Exploration-Based Data Collection Approach
di: Keswani, Vijay, et al.
Pubblicazione: (2024)
di: Keswani, Vijay, et al.
Pubblicazione: (2024)
The Complexity of Computing Robust Mediated Equilibria in Ordinal Games
di: Conitzer, Vincent
Pubblicazione: (2024)
di: Conitzer, Vincent
Pubblicazione: (2024)
Why (not) use AI? Analyzing People's Reasoning and Conditions for AI Acceptability
di: Mun, Jimin, et al.
Pubblicazione: (2025)
di: Mun, Jimin, et al.
Pubblicazione: (2025)
Choosing What Game to Play without Selecting Equilibria: Inferring Safe (Pareto) Improvements in Binary Constraint Structures
di: Oesterheld, Caspar, et al.
Pubblicazione: (2025)
di: Oesterheld, Caspar, et al.
Pubblicazione: (2025)
Designing Rules for Choosing a Winner in a Debate
di: Heckett, Alexander, et al.
Pubblicazione: (2025)
di: Heckett, Alexander, et al.
Pubblicazione: (2025)
The Backfiring Effect of Weak AI Safety Regulation
di: Laufer, Benjamin, et al.
Pubblicazione: (2025)
di: Laufer, Benjamin, et al.
Pubblicazione: (2025)
To Pool or Not To Pool: Analyzing the Regularizing Effects of Group-Fair Training on Shared Models
di: Cousins, Cyrus, et al.
Pubblicazione: (2024)
di: Cousins, Cyrus, et al.
Pubblicazione: (2024)
Toward Valid Measurement Of (Un)fairness For Generative AI: A Proposal For Systematization Through The Lens Of Fair Equality of Chances
di: Truong, Kimberly Le, et al.
Pubblicazione: (2025)
di: Truong, Kimberly Le, et al.
Pubblicazione: (2025)
An Interpretable Automated Mechanism Design Framework with Large Language Models
di: Liu, Jiayuan, et al.
Pubblicazione: (2025)
di: Liu, Jiayuan, et al.
Pubblicazione: (2025)
Modeling the Economic Impacts of AI Openness Regulation
di: Qiu, Tori, et al.
Pubblicazione: (2025)
di: Qiu, Tori, et al.
Pubblicazione: (2025)
Game Theory with Simulation of Other Players
di: Kovarik, Vojtech, et al.
Pubblicazione: (2023)
di: Kovarik, Vojtech, et al.
Pubblicazione: (2023)
When Should AI Read the Room? Public Perceptions of Social Intelligence in AI Agents
di: Mathur, Leena, et al.
Pubblicazione: (2026)
di: Mathur, Leena, et al.
Pubblicazione: (2026)
Fair and Welfare-Efficient Constrained Multi-matchings under Uncertainty
di: Lobo, Elita, et al.
Pubblicazione: (2024)
di: Lobo, Elita, et al.
Pubblicazione: (2024)
Fine-Tuning Games: Bargaining and Adaptation for General-Purpose Models
di: Laufer, Benjamin, et al.
Pubblicazione: (2023)
di: Laufer, Benjamin, et al.
Pubblicazione: (2023)
Deploying Fair and Efficient Course Allocation Mechanisms
di: Bissias, George, et al.
Pubblicazione: (2025)
di: Bissias, George, et al.
Pubblicazione: (2025)
RLSF: Fine-tuning LLMs via Symbolic Feedback
di: Jha, Piyush, et al.
Pubblicazione: (2024)
di: Jha, Piyush, et al.
Pubblicazione: (2024)
Maximizing Social Welfare with Side Payments
di: Geffner, Ivan, et al.
Pubblicazione: (2025)
di: Geffner, Ivan, et al.
Pubblicazione: (2025)
Can CDT rationalise the ex ante optimal policy via modified anthropics?
di: Cooper, Emery, et al.
Pubblicazione: (2024)
di: Cooper, Emery, et al.
Pubblicazione: (2024)
Recursive Joint Simulation in Games
di: Kovarik, Vojtech, et al.
Pubblicazione: (2024)
di: Kovarik, Vojtech, et al.
Pubblicazione: (2024)
Disclosure or Marketing? Analyzing the Efficacy of Vendor Self-reports for Vetting Public-sector AI
di: Kuehnert, Blaine, et al.
Pubblicazione: (2026)
di: Kuehnert, Blaine, et al.
Pubblicazione: (2026)
Why Do Decision Makers (Not) Use AI? A Cross-Domain Analysis of Factors Impacting AI Adoption
di: Yu, Rebecca, et al.
Pubblicazione: (2025)
di: Yu, Rebecca, et al.
Pubblicazione: (2025)
Computing Optimal Equilibria in Repeated Games with Restarts
di: Berker, Ratip Emin, et al.
Pubblicazione: (2024)
di: Berker, Ratip Emin, et al.
Pubblicazione: (2024)
Game Transformations That Preserve Nash Equilibria or Best-Response Sets
di: Tewolde, Emanuel, et al.
Pubblicazione: (2021)
di: Tewolde, Emanuel, et al.
Pubblicazione: (2021)
Implicit Humanization in Everyday LLM Moral Judgments
di: Ayad, Hoda, et al.
Pubblicazione: (2026)
di: Ayad, Hoda, et al.
Pubblicazione: (2026)
Complexity of Scheduling Charging in the Smart Grid
di: de Weerdt, Mathijs, et al.
Pubblicazione: (2017)
di: de Weerdt, Mathijs, et al.
Pubblicazione: (2017)
The "Who", "What", and "How" of Responsible AI Governance: A Systematic Review and Meta-Analysis of (Actor, Stage)-Specific Tools
di: Kuehnert, Blaine, et al.
Pubblicazione: (2025)
di: Kuehnert, Blaine, et al.
Pubblicazione: (2025)
SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior
di: Li, Jing-Jing, et al.
Pubblicazione: (2024)
di: Li, Jing-Jing, et al.
Pubblicazione: (2024)
'Simulacrum of Stories': Examining Large Language Models as Qualitative Research Participants
di: Kapania, Shivani, et al.
Pubblicazione: (2024)
di: Kapania, Shivani, et al.
Pubblicazione: (2024)
Characterising Simulation-Based Program Equilibria
di: Cooper, Emery, et al.
Pubblicazione: (2024)
di: Cooper, Emery, et al.
Pubblicazione: (2024)
Designing Algorithmic Delegates: The Role of Indistinguishability in Human-AI Handoff
di: Greenwood, Sophie, et al.
Pubblicazione: (2025)
di: Greenwood, Sophie, et al.
Pubblicazione: (2025)
Designing Rules to Pick a Rule: Aggregation by Consistency
di: Berker, Ratip Emin, et al.
Pubblicazione: (2025)
di: Berker, Ratip Emin, et al.
Pubblicazione: (2025)
Cheap Talk, Empty Promise: Frontier LLMs easily break public promises for self-interest
di: Shi, Jerick, et al.
Pubblicazione: (2026)
di: Shi, Jerick, et al.
Pubblicazione: (2026)
From Hallucination to Scheming: A Unified Taxonomy and Benchmark Analysis for LLM Deception
di: Shi, Jerick, et al.
Pubblicazione: (2026)
di: Shi, Jerick, et al.
Pubblicazione: (2026)
Documenti analoghi
-
On the Pros and Cons of Active Learning for Moral Preference Elicitation
di: Keswani, Vijay, et al.
Pubblicazione: (2024) -
Can AI Model the Complexities of Human Moral Decision-Making? A Qualitative Study of Kidney Allocation Decisions
di: Keswani, Vijay, et al.
Pubblicazione: (2025) -
On The Stability of Moral Preferences: A Problem with Computational Elicitation Methods
di: Boerstler, Kyle, et al.
Pubblicazione: (2024) -
Towards Cognitively-Faithful Decision-Making Models to Improve AI Alignment
di: Cousins, Cyrus, et al.
Pubblicazione: (2025) -
What Is Required for Empathic AI? It Depends, and Why That Matters for AI Developers and Users
di: Borg, Jana Schaich, et al.
Pubblicazione: (2024)