Interpretable Steering of Large Language Models with Feature Guided Activation Additions

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Soo, Samuel, Guang, Chen, Teng, Wesley, Balaganesh, Chandrasekaran, Guoxian, Tan, Ming, Yan
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!