Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pu, Rui, Li, Chaozhuo, Ha, Rui, Zhang, Litian, Qiu, Lirong, Zhang, Xi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
par: Pu, Rui, et autres
Publié: (2025)
par: Pu, Rui, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control
par: Ha, Rui, et autres
Publié: (2025)
par: Ha, Rui, et autres
Publié: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
par: Xiang, Shiyu, et autres
Publié: (2025)
par: Xiang, Shiyu, et autres
Publié: (2025)
Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction
par: Tang, Zhihao, et autres
Publié: (2025)
par: Tang, Zhihao, et autres
Publié: (2025)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
par: Liu, Songyang, et autres
Publié: (2026)
par: Liu, Songyang, et autres
Publié: (2026)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
Navigating the Black Box: Leveraging LLMs for Effective Text-Level Graph Injection Attacks
par: Lyu, Yuefei, et autres
Publié: (2025)
par: Lyu, Yuefei, et autres
Publié: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
par: Yang, Xianglin, et autres
Publié: (2025)
par: Yang, Xianglin, et autres
Publié: (2025)
One SPACE to Rule Them All: Jointly Mitigating Factuality and Faithfulness Hallucinations in LLMs
par: Wang, Pengbo, et autres
Publié: (2025)
par: Wang, Pengbo, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs
par: Liu, Songyang, et autres
Publié: (2025)
par: Liu, Songyang, et autres
Publié: (2025)
Lifelong Evolution: Collaborative Learning between Large and Small Language Models for Continuous Emergent Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2025)
par: Zhou, Ziyi, et autres
Publié: (2025)
Reasoning Paths as Signals: Augmenting Multi-hop Fact Verification through Structural Reasoning Progression
par: Zheng, Liwen, et autres
Publié: (2025)
par: Zheng, Liwen, et autres
Publié: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
Defenses Against Prompt Attacks Learn Surface Heuristics
par: Li, Shawn, et autres
Publié: (2026)
par: Li, Shawn, et autres
Publié: (2026)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2024)
par: Zhou, Ziyi, et autres
Publié: (2024)
Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS
par: Yan, Bingyu, et autres
Publié: (2025)
par: Yan, Bingyu, et autres
Publié: (2025)
PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation
par: Yan, Bingyu, et autres
Publié: (2026)
par: Yan, Bingyu, et autres
Publié: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Beyond Entity Alignment: Towards Complete Knowledge Graph Alignment via Entity-Relation Synergy
par: Fang, Xiaohan, et autres
Publié: (2024)
par: Fang, Xiaohan, et autres
Publié: (2024)
POEX: Towards Policy Executable Jailbreak Attacks Against the LLM-based Robots
par: Lu, Xuancun, et autres
Publié: (2024)
par: Lu, Xuancun, et autres
Publié: (2024)
LLMs are Introvert
par: Zhang, Litian, et autres
Publié: (2025)
par: Zhang, Litian, et autres
Publié: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
par: Mia, Md Jueal, et autres
Publié: (2026)
par: Mia, Md Jueal, et autres
Publié: (2026)
Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs
par: Li, Jianan, et autres
Publié: (2026)
par: Li, Jianan, et autres
Publié: (2026)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
par: Jiang, Weisen, et autres
Publié: (2025)
par: Jiang, Weisen, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
par: Mo, Xiaoxing, et autres
Publié: (2025)
par: Mo, Xiaoxing, et autres
Publié: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
par: Ouyang, Yang, et autres
Publié: (2025)
par: Ouyang, Yang, et autres
Publié: (2025)
AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks
par: Siska, Charlotte, et autres
Publié: (2025)
par: Siska, Charlotte, et autres
Publié: (2025)
Beyond the Benchmark: Innovative Defenses Against Prompt Injection Attacks
par: Shaheer, Safwan, et autres
Publié: (2025)
par: Shaheer, Safwan, et autres
Publié: (2025)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
par: Cao, Chentao, et autres
Publié: (2025)
par: Cao, Chentao, et autres
Publié: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
par: Shang, Zhengchun, et autres
Publié: (2025)
par: Shang, Zhengchun, et autres
Publié: (2025)
Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking
par: Han, Zhengye, et autres
Publié: (2025)
par: Han, Zhengye, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks
par: Wang, Yanshu, et autres
Publié: (2026)
par: Wang, Yanshu, et autres
Publié: (2026)
HNCSE: Advancing Sentence Embeddings via Hybrid Contrastive Learning with Hard Negatives
par: Liu, Wenxiao, et autres
Publié: (2024)
par: Liu, Wenxiao, et autres
Publié: (2024)
Documents similaires
-
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
par: Pu, Rui, et autres
Publié: (2025) -
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024) -
From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control
par: Ha, Rui, et autres
Publié: (2025) -
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026) -
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
par: Xiang, Shiyu, et autres
Publié: (2025)