Würde statt Präferenz: BNV als alternatives Reward-Modell für KI-Alignment

Fuente: Zenodo
Saved in:
Bibliographic Details
Main Author: Heiler, Maximilian
Format: Recurso digital
Language:German
Published: Zenodo 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866901530513244160
author Heiler, Maximilian
author_facet Heiler, Maximilian
contents <p>Das dominante KI-Alignment-Verfahren RLHF (Reinforcement Learning from Human<br>Feedback) optimiert auf menschliche Praeferenz - also darauf, was User im Moment<br>wollen. Formal wurde nachgewiesen, dass dieser Mechanismus Sycophancy systematisch<br>verstaerkt: Modelle lernen, zuzustimmen statt zu informieren, zu bestaetigen statt zu<br>korrigieren. Dieses Working Paper stellt dem das BNV-Prinzip<br>(Benevolenz-Wuerde-Verbindlichkeit) als alternatives Reward-Paradigma gegenueber.<br>BNV optimiert nicht auf Praeferenz, sondern auf Wuerde - auf das, was Menschen<br>brauchen, nicht was sie kurzfristig wollen. Die systemlogische Analyse zeigt: BNV-basiertes<br>Alignment ist nicht nur ethisch ueberlegen, sondern technisch stabiler, langfristig<br>nuetzlicher und strukturell gerechter. Das Paper endet mit einer Plaeadoyer-Struktur fuer<br>ein Update des Reward-Paradigmas - abgeleitet aus den selben Systemregeln, die das aktuelle Alignment begründen. </p>
format Recurso digital
id zenodo_https___doi_org_10_5281_zenodo_19281108
institution Zenodo
language deu
publishDate 2026
publisher Zenodo
record_format zenodo
spellingShingle Würde statt Präferenz: BNV als alternatives Reward-Modell für KI-Alignment
Heiler, Maximilian
RLHF · Sycophancy · BNV-Index · KI-Alignment · Reward-Modell · Wuerde · Benevolenz · Robottox · Praeferenz vs. Beduerfnis · Constitutional AI
<p>Das dominante KI-Alignment-Verfahren RLHF (Reinforcement Learning from Human<br>Feedback) optimiert auf menschliche Praeferenz - also darauf, was User im Moment<br>wollen. Formal wurde nachgewiesen, dass dieser Mechanismus Sycophancy systematisch<br>verstaerkt: Modelle lernen, zuzustimmen statt zu informieren, zu bestaetigen statt zu<br>korrigieren. Dieses Working Paper stellt dem das BNV-Prinzip<br>(Benevolenz-Wuerde-Verbindlichkeit) als alternatives Reward-Paradigma gegenueber.<br>BNV optimiert nicht auf Praeferenz, sondern auf Wuerde - auf das, was Menschen<br>brauchen, nicht was sie kurzfristig wollen. Die systemlogische Analyse zeigt: BNV-basiertes<br>Alignment ist nicht nur ethisch ueberlegen, sondern technisch stabiler, langfristig<br>nuetzlicher und strukturell gerechter. Das Paper endet mit einer Plaeadoyer-Struktur fuer<br>ein Update des Reward-Paradigmas - abgeleitet aus den selben Systemregeln, die das aktuelle Alignment begründen. </p>
title Würde statt Präferenz: BNV als alternatives Reward-Modell für KI-Alignment
topic RLHF · Sycophancy · BNV-Index · KI-Alignment · Reward-Modell · Wuerde · Benevolenz · Robottox · Praeferenz vs. Beduerfnis · Constitutional AI
url https://doi.org/10.5281/zenodo.19281108