Ravindran, S. K. (2025). Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers.
Style de citation Chicago (17e éd.)Ravindran, Santhosh Kumar. Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers. 2025.
Style de citation MLA (9e éd.)Ravindran, Santhosh Kumar. Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers. 2025.
Attention : ces citations peuvent ne pas être correctes à 100%.