The PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kirk, Hannah Rose, Whitefield, Alexander, Röttger, Paul, Bean, Andrew, Margatina, Katerina, Ciro, Juan, Mosquera, Rafael, Bartolo, Max, Williams, Adina, He, He, Vidgen, Bertie, Hale, Scott A. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
par: Kirk, Hannah Rose, et autres
Publié: (2026)
par: Kirk, Hannah Rose, et autres
Publié: (2026)
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
par: Vidgen, Bertie, et autres
Publié: (2023)
par: Vidgen, Bertie, et autres
Publié: (2023)
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
par: Röttger, Paul, et autres
Publié: (2023)
par: Röttger, Paul, et autres
Publié: (2023)
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025)
par: Rystrøm, Jonathan, et autres
Publié: (2025)
Why human-AI relationships need socioaffective alignment
par: Kirk, Hannah Rose, et autres
Publié: (2025)
par: Kirk, Hannah Rose, et autres
Publié: (2025)
SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety
par: Röttger, Paul, et autres
Publié: (2024)
par: Röttger, Paul, et autres
Publié: (2024)
Neural steering vectors reveal dose and exposure-dependent impacts of human-AI relationships
par: Kirk, Hannah Rose, et autres
Publié: (2025)
par: Kirk, Hannah Rose, et autres
Publié: (2025)
Classification is a RAG problem: A case study on hate speech detection
par: Willats, Richard, et autres
Publié: (2025)
par: Willats, Richard, et autres
Publié: (2025)
Indian-BhED: A Dataset for Measuring India-Centric Biases in Large Language Models
par: Khandelwal, Khyati, et autres
Publié: (2023)
par: Khandelwal, Khyati, et autres
Publié: (2023)
Measuring and Mitigating Persona Distortions from AI Writing Assistance
par: Röttger, Paul, et autres
Publié: (2026)
par: Röttger, Paul, et autres
Publié: (2026)
PRISM: Probability Reallocation with In-Span Masking for Knowledge-Sensitive Alignment
par: Xu, Chenning, et autres
Publié: (2026)
par: Xu, Chenning, et autres
Publié: (2026)
WorkBench: a Benchmark Dataset for Agents in a Realistic Workplace Setting
par: Styles, Olly, et autres
Publié: (2024)
par: Styles, Olly, et autres
Publié: (2024)
A Study on Leveraging Search and Self-Feedback for Agent Reasoning
par: K, Karthikeyan, et autres
Publié: (2025)
par: K, Karthikeyan, et autres
Publié: (2025)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
par: Li, Nanxi, et autres
Publié: (2025)
par: Li, Nanxi, et autres
Publié: (2025)
Explicit Trait Inference for Multi-Agent Coordination
par: Abdurahman, Suhaib, et autres
Publié: (2026)
par: Abdurahman, Suhaib, et autres
Publié: (2026)
HateDay: Insights from a Global Hate Speech Dataset Representative of a Day on Twitter
par: Tonneau, Manuel, et autres
Publié: (2024)
par: Tonneau, Manuel, et autres
Publié: (2024)
Religious Individualisation
Publié: (2020)
Publié: (2020)
Biological Plausibility and Representational Alignment of Feedback Alignment in Convolutional Networks
par: Lance, Jake, et autres
Publié: (2026)
par: Lance, Jake, et autres
Publié: (2026)
Federated Learning with Feedback Alignment
par: Baek, Incheol, et autres
Publié: (2025)
par: Baek, Incheol, et autres
Publié: (2025)
The AI Consumer Index (ACE)
par: Benchek, Julien, et autres
Publié: (2025)
par: Benchek, Julien, et autres
Publié: (2025)
Co-Constructing Alignment: A Participatory Approach to Situate AI Values
par: Arzberger, Anne, et autres
Publié: (2026)
par: Arzberger, Anne, et autres
Publié: (2026)
Understanding Likelihood Over-optimisation in Direct Alignment Algorithms
par: Shi, Zhengyan, et autres
Publié: (2024)
par: Shi, Zhengyan, et autres
Publié: (2024)
Democratizing Reward Design for Personal and Representative Value-Alignment
par: Blair, Carter, et autres
Publié: (2024)
par: Blair, Carter, et autres
Publié: (2024)
NPO: Learning Alignment and Meta-Alignment through Structured Human Feedback
par: Gaikwad, Madhava, et autres
Publié: (2025)
par: Gaikwad, Madhava, et autres
Publié: (2025)
PRISM: Perspective Reasoning for Integrated Synthesis and Mediation as a Multi-Perspective Framework for AI Alignment
par: Diamond, Anthony
Publié: (2025)
par: Diamond, Anthony
Publié: (2025)
CONFETTI: Conversational Function-Calling Evaluation Through Turn-Level Interactions
par: Alkhouli, Tamer, et autres
Publié: (2025)
par: Alkhouli, Tamer, et autres
Publié: (2025)
Clinical knowledge in LLMs does not translate to human interactions
par: Bean, Andrew M., et autres
Publié: (2025)
par: Bean, Andrew M., et autres
Publié: (2025)
On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
par: Wen, Xueru, et autres
Publié: (2024)
par: Wen, Xueru, et autres
Publié: (2024)
Beyond the Binary: Capturing Diverse Preferences With Reward Regularization
par: Padmakumar, Vishakh, et autres
Publié: (2024)
par: Padmakumar, Vishakh, et autres
Publié: (2024)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
par: Chen, Tiejin, et autres
Publié: (2026)
par: Chen, Tiejin, et autres
Publié: (2026)
Representative Social Choice: From Learning Theory to AI Alignment
par: Qiu, Tianyi
Publié: (2024)
par: Qiu, Tianyi
Publié: (2024)
AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment
par: Xu, Yuanfeng, et autres
Publié: (2024)
par: Xu, Yuanfeng, et autres
Publié: (2024)
Truth-Revealing Participatory Budgeting
par: Han, Qishen, et autres
Publié: (2026)
par: Han, Qishen, et autres
Publié: (2026)
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
par: Hu, Zizhao, et autres
Publié: (2026)
par: Hu, Zizhao, et autres
Publié: (2026)
An Aligned Sub-Neptune Revealed with MAROON-X and a Tendency Towards Alignment for Small Planets
par: Polanski, Alex S., et autres
Publié: (2025)
par: Polanski, Alex S., et autres
Publié: (2025)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
par: Ma, Weitao, et autres
Publié: (2026)
par: Ma, Weitao, et autres
Publié: (2026)
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
par: He, Xiaoxuan, et autres
Publié: (2026)
par: He, Xiaoxuan, et autres
Publié: (2026)
Maximizing Alignment with Minimal Feedback: Efficiently Learning Rewards for Visuomotor Robot Policy Alignment
par: Tian, Ran, et autres
Publié: (2024)
par: Tian, Ran, et autres
Publié: (2024)
LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages
par: Bean, Andrew M., et autres
Publié: (2024)
par: Bean, Andrew M., et autres
Publié: (2024)
The Polytechnic Library and Individualised Learning.
par: Revill, D. H.
Publié: (1981)
par: Revill, D. H.
Publié: (1981)
Documents similaires
-
PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users
par: Kirk, Hannah Rose, et autres
Publié: (2026) -
SimpleSafetyTests: a Test Suite for Identifying Critical Safety Risks in Large Language Models
par: Vidgen, Bertie, et autres
Publié: (2023) -
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
par: Röttger, Paul, et autres
Publié: (2023) -
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
par: Rystrøm, Jonathan, et autres
Publié: (2025) -
Why human-AI relationships need socioaffective alignment
par: Kirk, Hannah Rose, et autres
Publié: (2025)