Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Das, Saswat, Sandler, Jameson, Fioretto, Ferdinando |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
par: Das, Saswat, et autres
Publié: (2026)
par: Das, Saswat, et autres
Publié: (2026)
Fairness Issues and Mitigations in (Differentially Private) Socio-Demographic Data Processes
par: Ko, Joonhyuk, et autres
Publié: (2024)
par: Ko, Joonhyuk, et autres
Publié: (2024)
Contextualized Privacy Defense for LLM Agents
par: Wen, Yule, et autres
Publié: (2026)
par: Wen, Yule, et autres
Publié: (2026)
Optimal Allocation of Privacy Budget on Hierarchical Data Release
par: Ko, Joonhyuk, et autres
Publié: (2025)
par: Ko, Joonhyuk, et autres
Publié: (2025)
Disparate Impact on Group Accuracy of Linearization for Private Inference
par: Das, Saswat, et autres
Publié: (2024)
par: Das, Saswat, et autres
Publié: (2024)
Differential Privacy Overview and Fundamental Techniques
par: Fioretto, Ferdinando, et autres
Publié: (2024)
par: Fioretto, Ferdinando, et autres
Publié: (2024)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)
par: Ngong, Ivoline, et autres
Publié: (2025)
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)
par: Chen, Guorui, et autres
Publié: (2025)
Searching for Privacy Risks in LLM Agents via Simulation
par: Zhang, Yanzhe, et autres
Publié: (2025)
par: Zhang, Yanzhe, et autres
Publié: (2025)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Large Reasoning Models Are Autonomous Jailbreak Agents
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
par: Wu, Tianyi, et autres
Publié: (2025)
par: Wu, Tianyi, et autres
Publié: (2025)
How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?
par: Li, Yuxuan, et autres
Publié: (2026)
par: Li, Yuxuan, et autres
Publié: (2026)
Say Something Else: Rethinking Contextual Privacy as Information Sufficiency
par: Xiao, Yunze, et autres
Publié: (2026)
par: Xiao, Yunze, et autres
Publié: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
par: Li, Xirui, et autres
Publié: (2024)
par: Li, Xirui, et autres
Publié: (2024)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
par: Zhang, Tianyu, et autres
Publié: (2024)
par: Zhang, Tianyu, et autres
Publié: (2024)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
par: Yi, Sibo, et autres
Publié: (2025)
par: Yi, Sibo, et autres
Publié: (2025)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
par: Li, Jing-Jing, et autres
Publié: (2025)
par: Li, Jing-Jing, et autres
Publié: (2025)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks
par: Kabir, Md Rysul, et autres
Publié: (2026)
par: Kabir, Md Rysul, et autres
Publié: (2026)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
par: Mireshghallah, Niloofar, et autres
Publié: (2023)
par: Mireshghallah, Niloofar, et autres
Publié: (2023)
Security and Privacy Challenges of Large Language Models: A Survey
par: Das, Badhan Chandra, et autres
Publié: (2024)
par: Das, Badhan Chandra, et autres
Publié: (2024)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
Differentially Private Data Release on Graphs: Inefficiencies and Unfairness
par: Fioretto, Ferdinando, et autres
Publié: (2024)
par: Fioretto, Ferdinando, et autres
Publié: (2024)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
On the Suitability of LLM-Driven Agents for Dark Pattern Audits
par: Sun, Chen, et autres
Publié: (2026)
par: Sun, Chen, et autres
Publié: (2026)
Ghost Tool Calls: Issue-Time Privacy for Speculative Agent Tools
par: Mohammadi, Bardia, et autres
Publié: (2026)
par: Mohammadi, Bardia, et autres
Publié: (2026)
Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility
par: Murphy, Brendan, et autres
Publié: (2025)
par: Murphy, Brendan, et autres
Publié: (2025)
Jailbreaking Large Language Models Through Content Concretization
par: Wahréus, Johan, et autres
Publié: (2025)
par: Wahréus, Johan, et autres
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Jailbreaking Frontier Foundation Models Through Intention Deception
par: Wang, Xinhe, et autres
Publié: (2026)
par: Wang, Xinhe, et autres
Publié: (2026)
Documents similaires
-
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
par: Das, Saswat, et autres
Publié: (2026) -
Fairness Issues and Mitigations in (Differentially Private) Socio-Demographic Data Processes
par: Ko, Joonhyuk, et autres
Publié: (2024) -
Contextualized Privacy Defense for LLM Agents
par: Wen, Yule, et autres
Publié: (2026) -
Optimal Allocation of Privacy Budget on Hierarchical Data Release
par: Ko, Joonhyuk, et autres
Publié: (2025) -
Disparate Impact on Group Accuracy of Linearization for Private Inference
par: Das, Saswat, et autres
Publié: (2024)