Interpretable Steering of Large Language Models with Feature Guided Activation Additions

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Soo, Samuel, Guang, Chen, Teng, Wesley, Balaganesh, Chandrasekaran, Guoxian, Tan, Ming, Yan
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!