_version_ 1866909307172290560
author Anwar, Usman
Saparov, Abulhair
Rando, Javier
Paleka, Daniel
Turpin, Miles
Hase, Peter
Lubana, Ekdeep Singh
Jenner, Erik
Casper, Stephen
Sourbut, Oliver
Edelman, Benjamin L.
Zhang, Zhaowei
Günther, Mario
Korinek, Anton
Hernandez-Orallo, Jose
Hammond, Lewis
Bigelow, Eric
Pan, Alexander
Langosco, Lauro
Korbak, Tomasz
Zhang, Heidi
Zhong, Ruiqi
hÉigeartaigh, Seán Ó
Recchia, Gabriel
Corsi, Giulio
Chan, Alan
Anderljung, Markus
Edwards, Lilian
Petrov, Aleksandar
de Witt, Christian Schroeder
Motwan, Sumeet Ramesh
Bengio, Yoshua
Chen, Danqi
Torr, Philip H. S.
Albanie, Samuel
Maharaj, Tegan
Foerster, Jakob
Tramer, Florian
He, He
Kasirzadeh, Atoosa
Choi, Yejin
Krueger, David
author_facet Anwar, Usman
Saparov, Abulhair
Rando, Javier
Paleka, Daniel
Turpin, Miles
Hase, Peter
Lubana, Ekdeep Singh
Jenner, Erik
Casper, Stephen
Sourbut, Oliver
Edelman, Benjamin L.
Zhang, Zhaowei
Günther, Mario
Korinek, Anton
Hernandez-Orallo, Jose
Hammond, Lewis
Bigelow, Eric
Pan, Alexander
Langosco, Lauro
Korbak, Tomasz
Zhang, Heidi
Zhong, Ruiqi
hÉigeartaigh, Seán Ó
Recchia, Gabriel
Corsi, Giulio
Chan, Alan
Anderljung, Markus
Edwards, Lilian
Petrov, Aleksandar
de Witt, Christian Schroeder
Motwan, Sumeet Ramesh
Bengio, Yoshua
Chen, Danqi
Torr, Philip H. S.
Albanie, Samuel
Maharaj, Tegan
Foerster, Jakob
Tramer, Florian
He, He
Kasirzadeh, Atoosa
Choi, Yejin
Krueger, David
contents This work identifies 18 foundational challenges in assuring the alignment and safety of large language models (LLMs). These challenges are organized into three different categories: scientific understanding of LLMs, development and deployment methods, and sociotechnical challenges. Based on the identified challenges, we pose $200+$ concrete research questions.
format Preprint
id arxiv_https___arxiv_org_abs_2404_09932
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Foundational Challenges in Assuring Alignment and Safety of Large Language Models
Anwar, Usman
Saparov, Abulhair
Rando, Javier
Paleka, Daniel
Turpin, Miles
Hase, Peter
Lubana, Ekdeep Singh
Jenner, Erik
Casper, Stephen
Sourbut, Oliver
Edelman, Benjamin L.
Zhang, Zhaowei
Günther, Mario
Korinek, Anton
Hernandez-Orallo, Jose
Hammond, Lewis
Bigelow, Eric
Pan, Alexander
Langosco, Lauro
Korbak, Tomasz
Zhang, Heidi
Zhong, Ruiqi
hÉigeartaigh, Seán Ó
Recchia, Gabriel
Corsi, Giulio
Chan, Alan
Anderljung, Markus
Edwards, Lilian
Petrov, Aleksandar
de Witt, Christian Schroeder
Motwan, Sumeet Ramesh
Bengio, Yoshua
Chen, Danqi
Torr, Philip H. S.
Albanie, Samuel
Maharaj, Tegan
Foerster, Jakob
Tramer, Florian
He, He
Kasirzadeh, Atoosa
Choi, Yejin
Krueger, David
Machine Learning
Artificial Intelligence
Computation and Language
Computers and Society
This work identifies 18 foundational challenges in assuring the alignment and safety of large language models (LLMs). These challenges are organized into three different categories: scientific understanding of LLMs, development and deployment methods, and sociotechnical challenges. Based on the identified challenges, we pose $200+$ concrete research questions.
title Foundational Challenges in Assuring Alignment and Safety of Large Language Models
topic Machine Learning
Artificial Intelligence
Computation and Language
Computers and Society
url https://arxiv.org/abs/2404.09932