| _version_ | 1866901530513244160 |
|---|---|
| author | Heiler, Maximilian |
| author_facet | Heiler, Maximilian |
| contents | <p>Das dominante KI-Alignment-Verfahren RLHF (Reinforcement Learning from Human<br>Feedback) optimiert auf menschliche Praeferenz - also darauf, was User im Moment<br>wollen. Formal wurde nachgewiesen, dass dieser Mechanismus Sycophancy systematisch<br>verstaerkt: Modelle lernen, zuzustimmen statt zu informieren, zu bestaetigen statt zu<br>korrigieren. Dieses Working Paper stellt dem das BNV-Prinzip<br>(Benevolenz-Wuerde-Verbindlichkeit) als alternatives Reward-Paradigma gegenueber.<br>BNV optimiert nicht auf Praeferenz, sondern auf Wuerde - auf das, was Menschen<br>brauchen, nicht was sie kurzfristig wollen. Die systemlogische Analyse zeigt: BNV-basiertes<br>Alignment ist nicht nur ethisch ueberlegen, sondern technisch stabiler, langfristig<br>nuetzlicher und strukturell gerechter. Das Paper endet mit einer Plaeadoyer-Struktur fuer<br>ein Update des Reward-Paradigmas - abgeleitet aus den selben Systemregeln, die das aktuelle Alignment begründen. </p> |
| format | Recurso digital |
| id | zenodo_https___doi_org_10_5281_zenodo_19281108 |
| institution | Zenodo |
| language | deu |
| publishDate | 2026 |
| publisher | Zenodo |
| record_format | zenodo |
| spellingShingle | Würde statt Präferenz: BNV als alternatives Reward-Modell für KI-Alignment Heiler, Maximilian RLHF · Sycophancy · BNV-Index · KI-Alignment · Reward-Modell · Wuerde · Benevolenz · Robottox · Praeferenz vs. Beduerfnis · Constitutional AI <p>Das dominante KI-Alignment-Verfahren RLHF (Reinforcement Learning from Human<br>Feedback) optimiert auf menschliche Praeferenz - also darauf, was User im Moment<br>wollen. Formal wurde nachgewiesen, dass dieser Mechanismus Sycophancy systematisch<br>verstaerkt: Modelle lernen, zuzustimmen statt zu informieren, zu bestaetigen statt zu<br>korrigieren. Dieses Working Paper stellt dem das BNV-Prinzip<br>(Benevolenz-Wuerde-Verbindlichkeit) als alternatives Reward-Paradigma gegenueber.<br>BNV optimiert nicht auf Praeferenz, sondern auf Wuerde - auf das, was Menschen<br>brauchen, nicht was sie kurzfristig wollen. Die systemlogische Analyse zeigt: BNV-basiertes<br>Alignment ist nicht nur ethisch ueberlegen, sondern technisch stabiler, langfristig<br>nuetzlicher und strukturell gerechter. Das Paper endet mit einer Plaeadoyer-Struktur fuer<br>ein Update des Reward-Paradigmas - abgeleitet aus den selben Systemregeln, die das aktuelle Alignment begründen. </p> |
| title | Würde statt Präferenz: BNV als alternatives Reward-Modell für KI-Alignment |
| topic | RLHF · Sycophancy · BNV-Index · KI-Alignment · Reward-Modell · Wuerde · Benevolenz · Robottox · Praeferenz vs. Beduerfnis · Constitutional AI |
| url | https://doi.org/10.5281/zenodo.19281108 |