Unmasking the Trojan Horse: Provable Detection and Mitigation of Deceptive Alignment in AI Systems

Fuente: Zenodo
Salvato in:
Dettagli Bibliografici
Autori principali: Revista, Zen, IA, 10
Natura: Recurso digital
Pubblicazione: Zenodo 2025
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!