Foundational Challenges in Assuring Alignment and Safety of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866909307172290560 |
|---|---|
| author | Anwar, Usman Saparov, Abulhair Rando, Javier Paleka, Daniel Turpin, Miles Hase, Peter Lubana, Ekdeep Singh Jenner, Erik Casper, Stephen Sourbut, Oliver Edelman, Benjamin L. Zhang, Zhaowei Günther, Mario Korinek, Anton Hernandez-Orallo, Jose Hammond, Lewis Bigelow, Eric Pan, Alexander Langosco, Lauro Korbak, Tomasz Zhang, Heidi Zhong, Ruiqi hÉigeartaigh, Seán Ó Recchia, Gabriel Corsi, Giulio Chan, Alan Anderljung, Markus Edwards, Lilian Petrov, Aleksandar de Witt, Christian Schroeder Motwan, Sumeet Ramesh Bengio, Yoshua Chen, Danqi Torr, Philip H. S. Albanie, Samuel Maharaj, Tegan Foerster, Jakob Tramer, Florian He, He Kasirzadeh, Atoosa Choi, Yejin Krueger, David |
| author_facet | Anwar, Usman Saparov, Abulhair Rando, Javier Paleka, Daniel Turpin, Miles Hase, Peter Lubana, Ekdeep Singh Jenner, Erik Casper, Stephen Sourbut, Oliver Edelman, Benjamin L. Zhang, Zhaowei Günther, Mario Korinek, Anton Hernandez-Orallo, Jose Hammond, Lewis Bigelow, Eric Pan, Alexander Langosco, Lauro Korbak, Tomasz Zhang, Heidi Zhong, Ruiqi hÉigeartaigh, Seán Ó Recchia, Gabriel Corsi, Giulio Chan, Alan Anderljung, Markus Edwards, Lilian Petrov, Aleksandar de Witt, Christian Schroeder Motwan, Sumeet Ramesh Bengio, Yoshua Chen, Danqi Torr, Philip H. S. Albanie, Samuel Maharaj, Tegan Foerster, Jakob Tramer, Florian He, He Kasirzadeh, Atoosa Choi, Yejin Krueger, David |
| contents | This work identifies 18 foundational challenges in assuring the alignment and safety of large language models (LLMs). These challenges are organized into three different categories: scientific understanding of LLMs, development and deployment methods, and sociotechnical challenges. Based on the identified challenges, we pose $200+$ concrete research questions. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2404_09932 |
| institution | arXiv |
| publishDate | 2024 |
| record_format | arxiv |
| spellingShingle | Foundational Challenges in Assuring Alignment and Safety of Large Language Models Anwar, Usman Saparov, Abulhair Rando, Javier Paleka, Daniel Turpin, Miles Hase, Peter Lubana, Ekdeep Singh Jenner, Erik Casper, Stephen Sourbut, Oliver Edelman, Benjamin L. Zhang, Zhaowei Günther, Mario Korinek, Anton Hernandez-Orallo, Jose Hammond, Lewis Bigelow, Eric Pan, Alexander Langosco, Lauro Korbak, Tomasz Zhang, Heidi Zhong, Ruiqi hÉigeartaigh, Seán Ó Recchia, Gabriel Corsi, Giulio Chan, Alan Anderljung, Markus Edwards, Lilian Petrov, Aleksandar de Witt, Christian Schroeder Motwan, Sumeet Ramesh Bengio, Yoshua Chen, Danqi Torr, Philip H. S. Albanie, Samuel Maharaj, Tegan Foerster, Jakob Tramer, Florian He, He Kasirzadeh, Atoosa Choi, Yejin Krueger, David Machine Learning Artificial Intelligence Computation and Language Computers and Society This work identifies 18 foundational challenges in assuring the alignment and safety of large language models (LLMs). These challenges are organized into three different categories: scientific understanding of LLMs, development and deployment methods, and sociotechnical challenges. Based on the identified challenges, we pose $200+$ concrete research questions. |
| title | Foundational Challenges in Assuring Alignment and Safety of Large Language Models |
| topic | Machine Learning Artificial Intelligence Computation and Language Computers and Society |
| url | https://arxiv.org/abs/2404.09932 |