Risultati della ricerca - Simko, Samuel
- Mostra 1 - 3 risultati su 3
-
1
Improving Large Language Model Safety with Contrastive Representation Learning di Simko, Samuel, Sachan, Mrinmaya, Schölkopf, Bernhard, Jin, Zhijing
Pubblicazione 2025Testo
Preprint -
2
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards di Pandey, Punya Syon, Simko, Samuel, Pelrine, Kellin, Jin, Zhijing
Pubblicazione 2025Testo
Preprint -
3
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering di Hossain, Saad, Tseng, Tom, Pandey, Punya Syon, Vajpayee, Samanvay, Kowal, Matthew, Nonta, Nayeema, Simko, Samuel, Casper, Stephen, Jin, Zhijing, Pelrine, Kellin, Rambhatla, Sirisha
Pubblicazione 2026Testo
Preprint