Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Tianlong, Wang, Zhenghua, Liu, Wenhao, Wu, Muling, Dou, Shihan, Lv, Changze, Wang, Xiaohua, Zheng, Xiaoqing, Huang, Xuanjing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
por: Li, Tianlong, et al.
Publicado: (2023)
por: Li, Tianlong, et al.
Publicado: (2023)
Aligning Large Language Models with Human Preferences through Representation Engineering
por: Liu, Wenhao, et al.
Publicado: (2023)
por: Liu, Wenhao, et al.
Publicado: (2023)
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
por: Wu, Muling, et al.
Publicado: (2024)
por: Wu, Muling, et al.
Publicado: (2024)
Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning
por: Wu, Muling, et al.
Publicado: (2025)
por: Wu, Muling, et al.
Publicado: (2025)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
por: Zhu, JianHao, et al.
Publicado: (2024)
por: Zhu, JianHao, et al.
Publicado: (2024)
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
por: Lv, Changze, et al.
Publicado: (2023)
por: Lv, Changze, et al.
Publicado: (2023)
Layer-Specific Scaling of Positional Encodings for Superior Long-Context Modeling
por: Wang, Zhenghua, et al.
Publicado: (2025)
por: Wang, Zhenghua, et al.
Publicado: (2025)
Improving Continual Pre-training Through Seamless Data Packing
por: Yin, Ruicheng, et al.
Publicado: (2025)
por: Yin, Ruicheng, et al.
Publicado: (2025)
VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
por: Zhang, Feiran, et al.
Publicado: (2026)
por: Zhang, Feiran, et al.
Publicado: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
por: Lv, Huijie, et al.
Publicado: (2024)
por: Lv, Huijie, et al.
Publicado: (2024)
Benchmark^2: Systematic Evaluation of LLM Benchmarks
por: Qian, Qi, et al.
Publicado: (2026)
por: Qian, Qi, et al.
Publicado: (2026)
Tell Me What You Don't Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editing
por: Liu, Wenhao, et al.
Publicado: (2024)
por: Liu, Wenhao, et al.
Publicado: (2024)
SpikeBERT: A Language Spikformer Learned from BERT with Knowledge Distillation
por: Lv, Changze, et al.
Publicado: (2023)
por: Lv, Changze, et al.
Publicado: (2023)
Explainable Synthetic Image Detection through Diffusion Timestep Ensembling
por: Wu, Yixin, et al.
Publicado: (2025)
por: Wu, Yixin, et al.
Publicado: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
por: Dou, Shihan, et al.
Publicado: (2025)
por: Dou, Shihan, et al.
Publicado: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
por: Zhou, Weikang, et al.
Publicado: (2024)
por: Zhou, Weikang, et al.
Publicado: (2024)
Searching for Best Practices in Retrieval-Augmented Generation
por: Wang, Xiaohua, et al.
Publicado: (2024)
por: Wang, Xiaohua, et al.
Publicado: (2024)
Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
por: Xu, Zhibo, et al.
Publicado: (2025)
por: Xu, Zhibo, et al.
Publicado: (2025)
Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement
por: Wang, Xiaohua, et al.
Publicado: (2024)
por: Wang, Xiaohua, et al.
Publicado: (2024)
Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
por: Lv, Changze, et al.
Publicado: (2026)
por: Lv, Changze, et al.
Publicado: (2026)
Spiking Convolutional Neural Networks for Text Classification
por: Lv, Changze, et al.
Publicado: (2024)
por: Lv, Changze, et al.
Publicado: (2024)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
CSSG: Measuring Code Similarity with Semantic Graphs
por: Lu, Yiyang, et al.
Publicado: (2026)
por: Lu, Yiyang, et al.
Publicado: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
por: Shen, Yuanzhe, et al.
Publicado: (2025)
por: Shen, Yuanzhe, et al.
Publicado: (2025)
Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data Augmentation
por: Xu, Haozhe, et al.
Publicado: (2025)
por: Xu, Haozhe, et al.
Publicado: (2025)
Dendritic Localized Learning: Toward Biologically Plausible Algorithm
por: Lv, Changze, et al.
Publicado: (2025)
por: Lv, Changze, et al.
Publicado: (2025)
Decoding Continuous Character-based Language from Non-invasive Brain Recordings
por: Zhang, Cenyuan, et al.
Publicado: (2024)
por: Zhang, Cenyuan, et al.
Publicado: (2024)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
Advancing Spiking Neural Networks for Sequential Modeling with Central Pattern Generators
por: Lv, Changze, et al.
Publicado: (2024)
por: Lv, Changze, et al.
Publicado: (2024)
Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
por: Wang, Xiaohua, et al.
Publicado: (2026)
por: Wang, Xiaohua, et al.
Publicado: (2026)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models
por: Huang, Linghan, et al.
Publicado: (2025)
por: Huang, Linghan, et al.
Publicado: (2025)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
por: Xu, Ningyu, et al.
Publicado: (2026)
por: Xu, Ningyu, et al.
Publicado: (2026)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025)
por: Jiang, Lei, et al.
Publicado: (2025)
Efficient and Effective Time-Series Forecasting with Spiking Neural Networks
por: Lv, Changze, et al.
Publicado: (2024)
por: Lv, Changze, et al.
Publicado: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
Multi-Programming Language Sandbox for LLMs
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Jailbreaking Large Language Models with Morality Attacks
por: Su, Ying, et al.
Publicado: (2026)
por: Su, Ying, et al.
Publicado: (2026)
Ejemplares similares
-
UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation
por: Li, Tianlong, et al.
Publicado: (2023) -
Aligning Large Language Models with Human Preferences through Representation Engineering
por: Liu, Wenhao, et al.
Publicado: (2023) -
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
por: Wu, Muling, et al.
Publicado: (2024) -
Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning
por: Wu, Muling, et al.
Publicado: (2025) -
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
por: Zhu, JianHao, et al.
Publicado: (2024)