TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Churui, Qi, Weiwei, Xiu, Kedong, Zheng, Tianhang, Lu, Chaochao, He, Liang, Qin, Zhan, Ren, Kui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Dynamic Target Attack
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
MAJIC: Markovian Adaptive Jailbreaking via Iterative Composition of Diverse Innovative Strategies
di: Qi, Weiwei, et al.
Pubblicazione: (2025)
di: Qi, Weiwei, et al.
Pubblicazione: (2025)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
Releasing Malevolence from Benevolence: The Menace of Benign Data on Machine Unlearning
di: Ma, Binhao, et al.
Pubblicazione: (2024)
di: Ma, Binhao, et al.
Pubblicazione: (2024)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
di: Zhang, Junke, et al.
Pubblicazione: (2026)
di: Zhang, Junke, et al.
Pubblicazione: (2026)
Guardians of the Agentic System: Preventing Many Shots Jailbreak with Agentic System
di: Barua, Saikat, et al.
Pubblicazione: (2025)
di: Barua, Saikat, et al.
Pubblicazione: (2025)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
di: Li, Jindong, et al.
Pubblicazione: (2026)
di: Li, Jindong, et al.
Pubblicazione: (2026)
Combating Concept Drift with Explanatory Detection and Adaptation for Android Malware Classification
di: He, Yiling, et al.
Pubblicazione: (2024)
di: He, Yiling, et al.
Pubblicazione: (2024)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
di: Zeng, Xiyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiyu, et al.
Pubblicazione: (2025)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
FINER: Enhancing State-of-the-art Classifiers with Feature Attribution to Facilitate Security Analysis
di: He, Yiling, et al.
Pubblicazione: (2023)
di: He, Yiling, et al.
Pubblicazione: (2023)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation
di: Zhang, Wenhui, et al.
Pubblicazione: (2025)
di: Zhang, Wenhui, et al.
Pubblicazione: (2025)
ERASER: Machine Unlearning in MLaaS via an Inference Serving-Aware Approach
di: Hu, Yuke, et al.
Pubblicazione: (2023)
di: Hu, Yuke, et al.
Pubblicazione: (2023)
SWAT: A System-Wide Approach to Tunable Leakage Mitigation in Encrypted Data Stores
di: Zheng, Leqian, et al.
Pubblicazione: (2023)
di: Zheng, Leqian, et al.
Pubblicazione: (2023)
FDINet: Protecting against DNN Model Extraction via Feature Distortion Index
di: Yao, Hongwei, et al.
Pubblicazione: (2023)
di: Yao, Hongwei, et al.
Pubblicazione: (2023)
PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration
di: Zhan, Junfei, et al.
Pubblicazione: (2025)
di: Zhan, Junfei, et al.
Pubblicazione: (2025)
MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
di: Chen, Tailun, et al.
Pubblicazione: (2025)
di: Chen, Tailun, et al.
Pubblicazione: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
PermLLM: Private Inference of Large Language Models within 3 Seconds under WAN
di: Zheng, Fei, et al.
Pubblicazione: (2024)
di: Zheng, Fei, et al.
Pubblicazione: (2024)
EVA: Editing for Versatile Alignment against Jailbreaks
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Membership Inference Attacks Against Vision-Language Models
di: Hu, Yuke, et al.
Pubblicazione: (2025)
di: Hu, Yuke, et al.
Pubblicazione: (2025)
An LLM-based Self-Evolving Security Framework for 6G Space-Air-Ground Integrated Networks
di: Qin, Qi, et al.
Pubblicazione: (2025)
di: Qin, Qi, et al.
Pubblicazione: (2025)
KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
AgenticVM: Agentic AI for Adaptive Software Vulnerability Management
di: Arifin, Asrul, et al.
Pubblicazione: (2026)
di: Arifin, Asrul, et al.
Pubblicazione: (2026)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
TRACE: Timely Retrieval and Alignment for Cybersecurity Knowledge Graph Construction and Expansion
di: Xu, Zijing, et al.
Pubblicazione: (2026)
di: Xu, Zijing, et al.
Pubblicazione: (2026)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
di: Nian, Yi, et al.
Pubblicazione: (2025)
di: Nian, Yi, et al.
Pubblicazione: (2025)
Uncertainty-Aware, Risk-Adaptive Access Control for Agentic Systems using an LLM-Judged TBAC Model
di: Fleming, Charles, et al.
Pubblicazione: (2025)
di: Fleming, Charles, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
FedReview: A Review Mechanism for Rejecting Poisoned Updates in Federated Learning
di: Zheng, Tianhang, et al.
Pubblicazione: (2024)
di: Zheng, Tianhang, et al.
Pubblicazione: (2024)
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
di: Shao, Shuo, et al.
Pubblicazione: (2024)
di: Shao, Shuo, et al.
Pubblicazione: (2024)
Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization
di: Huang, Xinzhe, et al.
Pubblicazione: (2025) -
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025) -
Dynamic Target Attack
di: Xiu, Kedong, et al.
Pubblicazione: (2025) -
MAJIC: Markovian Adaptive Jailbreaking via Iterative Composition of Diverse Innovative Strategies
di: Qi, Weiwei, et al.
Pubblicazione: (2025) -
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
di: Qi, Weiwei, et al.
Pubblicazione: (2026)