Résultats de la recherche - Simko, Samuel
- Résultat(s) 1 - 3 résultats de 3
-
1
Improving Large Language Model Safety with Contrastive Representation Learning Autoría: Simko, Samuel, Sachan, Mrinmaya, Schölkopf, Bernhard, Jin, Zhijing
Publié 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
2
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards Autoría: Pandey, Punya Syon, Simko, Samuel, Pelrine, Kellin, Jin, Zhijing
Publié 2025Fuente: arXivTipo de material: PreprintAcceso al recurso -
3
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering Autoría: Hossain, Saad, Tseng, Tom, Pandey, Punya Syon, Vajpayee, Samanvay, Kowal, Matthew, Nonta, Nayeema, Simko, Samuel, Casper, Stephen, Jin, Zhijing, Pelrine, Kellin, Rambhatla, Sirisha
Publié 2026Fuente: arXivTipo de material: PreprintAcceso al recurso