ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Shaowei, Zhai, Yu, Zhang, Zhengyu, Wang, Yanze, Kwok, Hin Chi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Privacy Challenges and Solutions in Retrieval-Augmented Generation-Enhanced LLMs for Healthcare Chatbots: A Review of Applications, Risks, and Future Directions
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025)
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025)
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense
di: Zhai, Keke
Pubblicazione: (2024)
di: Zhai, Keke
Pubblicazione: (2024)
CoTSRF: Utilize Chain of Thought as Stealthy and Robust Fingerprint of Large Language Models
di: Ren, Zhenzhen, et al.
Pubblicazione: (2025)
di: Ren, Zhenzhen, et al.
Pubblicazione: (2025)
Large Language Model-driven Security Assistant for Internet of Things via Chain-of-Thought
di: Zeng, Mingfei, et al.
Pubblicazione: (2025)
di: Zeng, Mingfei, et al.
Pubblicazione: (2025)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models
di: Deng, Jia, et al.
Pubblicazione: (2025)
di: Deng, Jia, et al.
Pubblicazione: (2025)
MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
di: Liu, Junhao, et al.
Pubblicazione: (2025)
di: Liu, Junhao, et al.
Pubblicazione: (2025)
Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
di: Chang, Ching-Chun, et al.
Pubblicazione: (2025)
Evaluation of Prompt Injection Defenses in Large Language Models
di: Deep, Priyal, et al.
Pubblicazione: (2026)
di: Deep, Priyal, et al.
Pubblicazione: (2026)
Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024)
di: Cui, Jing, et al.
Pubblicazione: (2024)
A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory
di: Wei, Qianshan, et al.
Pubblicazione: (2025)
di: Wei, Qianshan, et al.
Pubblicazione: (2025)
TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense
di: Liu, Cheng, et al.
Pubblicazione: (2026)
di: Liu, Cheng, et al.
Pubblicazione: (2026)
Reasoning Under Pressure: How do Training Incentives Influence Chain-of-Thought Monitorability?
di: MacDermott, Matt, et al.
Pubblicazione: (2025)
di: MacDermott, Matt, et al.
Pubblicazione: (2025)
Mitigating the Structural Bias in Graph Adversarial Defenses
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
di: Fang, Junyuan, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Adversarial Text Purification: A Large Language Model Approach for Defense
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
Chain-of-Thought Prompting of Large Language Models for Discovering and Fixing Software Vulnerabilities
di: Nong, Yu, et al.
Pubblicazione: (2024)
di: Nong, Yu, et al.
Pubblicazione: (2024)
Thought Purity: A Defense Framework For Chain-of-Thought Attack
di: Xue, Zihao, et al.
Pubblicazione: (2025)
di: Xue, Zihao, et al.
Pubblicazione: (2025)
Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs
di: Lu, Yu-An, et al.
Pubblicazione: (2026)
di: Lu, Yu-An, et al.
Pubblicazione: (2026)
Hey GPT-OSS, Looks Like You Got It -- Now Walk Me Through It! An Assessment of the Reasoning Language Models Chain of Thought Mechanism for Digital Forensics
di: Michelet, Gaëtan, et al.
Pubblicazione: (2025)
di: Michelet, Gaëtan, et al.
Pubblicazione: (2025)
SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration
di: Pan, Yu, et al.
Pubblicazione: (2026)
di: Pan, Yu, et al.
Pubblicazione: (2026)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
Automating Prompt Leakage Attacks on Large Language Models Using Agentic Approach
di: Sternak, Tvrtko, et al.
Pubblicazione: (2025)
di: Sternak, Tvrtko, et al.
Pubblicazione: (2025)
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
di: Green, Tommaso, et al.
Pubblicazione: (2025)
di: Green, Tommaso, et al.
Pubblicazione: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Evaluating Adversarial Vulnerabilities in Modern Large Language Models
di: Perel, Tom
Pubblicazione: (2025)
di: Perel, Tom
Pubblicazione: (2025)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
di: Jiang, Bo
Pubblicazione: (2026)
di: Jiang, Bo
Pubblicazione: (2026)
Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework
di: Zhou, Jiling, et al.
Pubblicazione: (2026)
di: Zhou, Jiling, et al.
Pubblicazione: (2026)
PPMI: Privacy-Preserving LLM Interaction with Socratic Chain-of-Thought Reasoning and Homomorphically Encrypted Vector Databases
di: Bae, Yubeen, et al.
Pubblicazione: (2025)
di: Bae, Yubeen, et al.
Pubblicazione: (2025)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image
di: Wang, Zefeng, et al.
Pubblicazione: (2024)
di: Wang, Zefeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Privacy Challenges and Solutions in Retrieval-Augmented Generation-Enhanced LLMs for Healthcare Chatbots: A Review of Applications, Risks, and Future Directions
di: Guan, Shaowei, et al.
Pubblicazione: (2025) -
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
di: Liu, Shuaitong, et al.
Pubblicazione: (2025) -
Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025) -
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025) -
Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)