Zhao, X., Yang, X., Pang, T., Du, C., Li, L., Wang, Y., & Wang, W. Y. (2024). Weak-to-Strong Jailbreaking on Large Language Models.
Cita Chicago Style (17a ed.)Zhao, Xuandong, Xianjun Yang, Tianyu Pang, Chao Du, Lei Li, Yu-Xiang Wang, y William Yang Wang. Weak-to-Strong Jailbreaking on Large Language Models. 2024.
Cita MLA (9a ed.)Zhao, Xuandong, et al. Weak-to-Strong Jailbreaking on Large Language Models. 2024.
Precaución: Estas citas no son 100% exactas.