Salta al contenuto
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Entra
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Avanzata
  • The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning
Copertina

The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Li, Nathaniel, Pan, Alexander, Gopal, Anjali, Yue, Summer, Berrios, Daniel, Gatti, Alice, Li, Justin D., Dombrowski, Ann-Kathrin, Goel, Shashwat, Phan, Long, Mukobi, Gabriel, Helm-Burger, Nathan, Lababidi, Rassin, Justen, Lennart, Liu, Andrew B., Chen, Michael, Barrass, Isabelle, Zhang, Oliver, Zhu, Xiaoyuan, Tamirisa, Rishub, Bharathi, Bhrugu, Khoja, Adam, Zhao, Zhenqi, Herbert-Voss, Ariel, Breuer, Cort B., Marks, Samuel, Patel, Oam, Zou, Andy, Mazeika, Mantas, Wang, Zifan, Oswal, Palash, Lin, Weiran, Hunt, Adam A., Tienken-Harder, Justin, Shih, Kevin Y., Talley, Kemper, Guan, John, Kaplan, Russell, Steneker, Ian, Campbell, David, Jokubaitis, Brad, Levinson, Alex, Wang, Jean, Qian, William, Karmakar, Kallol Krishna, Basart, Steven, Fitz, Stephen, Levine, Mindy, Kumaraguru, Ponnurangam, Tupakula, Uday, Varadharajan, Vijay, Wang, Ruoyu, Shoshitaishvili, Yan, Ba, Jimmy, Esvelt, Kevin M., Wang, Alexandr, Hendrycks, Dan
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Machine Learning
Artificial Intelligence
Computation and Language
Computers and Society
Accesso online:
Acceder al recurso
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
  • Citazione
  • Invia SMS
  • Invia email
  • Stampa
  • Esporta il record
    • Esporta a RefWorks
    • Esporta a EndNoteWeb
    • Esporta a EndNote
  • Aggiungi alla lista
  • PLink permanente
  • Posseduto
  • Descrizione
  • Commenti
  • Documenti analoghi
  • MARC21

Accesso online

https://arxiv.org/abs/2403.03218

Documenti analoghi

  • Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
    di: Mazeika, Mantas, et al.
    Pubblicazione: (2025)
  • Tamper-Resistant Safeguards for Open-Weight LLMs
    di: Tamirisa, Rishub, et al.
    Pubblicazione: (2024)
  • Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
    di: Ren, Richard, et al.
    Pubblicazione: (2024)
  • Foundation models may exhibit staged progression in novel CBRN threat disclosure
    di: Esvelt, Kevin M
    Pubblicazione: (2025)
  • FedSelect: Customized Selection of Parameters for Fine-Tuning during Personalized Federated Learning
    di: Tamirisa, Rishub, et al.
    Pubblicazione: (2023)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar