Large Language Models are Advanced Anonymizers
Fuente:
arXiv
Salvato in:
| Autori principali: | Staab, Robin, Vero, Mark, Balunović, Mislav, Vechev, Martin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Memorization: Violating Privacy Via Inference with Large Language Models
di: Staab, Robin, et al.
Pubblicazione: (2023)
di: Staab, Robin, et al.
Pubblicazione: (2023)
Unlocking the Potential of Large Language Models for Clinical Text Anonymization: A Comparative Study
di: Pissarra, David, et al.
Pubblicazione: (2024)
di: Pissarra, David, et al.
Pubblicazione: (2024)
Adversarial Attacks on Large Language Models Using Regularized Relaxation
di: Chacko, Samuel Jacob, et al.
Pubblicazione: (2024)
di: Chacko, Samuel Jacob, et al.
Pubblicazione: (2024)
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
di: Xin, Yuan, et al.
Pubblicazione: (2025)
di: Xin, Yuan, et al.
Pubblicazione: (2025)
Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems
di: Pai, Aaditya
Pubblicazione: (2026)
di: Pai, Aaditya
Pubblicazione: (2026)
ConfusionPrompt: Practical Private Inference for Online Large Language Models
di: Mai, Peihua, et al.
Pubblicazione: (2023)
di: Mai, Peihua, et al.
Pubblicazione: (2023)
Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)
di: Verma, Apurv, et al.
Pubblicazione: (2024)
di: Verma, Apurv, et al.
Pubblicazione: (2024)
Scaling Trends in Language Model Robustness
di: Howe, Nikolaus, et al.
Pubblicazione: (2024)
di: Howe, Nikolaus, et al.
Pubblicazione: (2024)
Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts
di: Downey-Webb, Tiarnaigh, et al.
Pubblicazione: (2025)
di: Downey-Webb, Tiarnaigh, et al.
Pubblicazione: (2025)
Terrarium: Revisiting the Blackboard for Multi-Agent Safety, Privacy, and Security Studies
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
sudoLLM: On Multi-role Alignment of Language Models
di: Saha, Soumadeep, et al.
Pubblicazione: (2025)
di: Saha, Soumadeep, et al.
Pubblicazione: (2025)
Powerful Training-Free Membership Inference Against Autoregressive Language Models
di: Ilić, David, et al.
Pubblicazione: (2026)
di: Ilić, David, et al.
Pubblicazione: (2026)
Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously
di: Adiletta, Andrew, et al.
Pubblicazione: (2025)
di: Adiletta, Andrew, et al.
Pubblicazione: (2025)
Temporal Attack Pattern Detection in Multi-Agent AI Workflows: An Open Framework for Training Trace-Based Security Models
di: Del Rosario, Ron F.
Pubblicazione: (2025)
di: Del Rosario, Ron F.
Pubblicazione: (2025)
Exploiting Novel GPT-4 APIs
di: Pelrine, Kellin, et al.
Pubblicazione: (2023)
di: Pelrine, Kellin, et al.
Pubblicazione: (2023)
A Semantic Invariant Robust Watermark for Large Language Models
di: Liu, Aiwei, et al.
Pubblicazione: (2023)
di: Liu, Aiwei, et al.
Pubblicazione: (2023)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
di: Palit, Sayon, et al.
Pubblicazione: (2025)
di: Palit, Sayon, et al.
Pubblicazione: (2025)
Real AI Agents with Fake Memories: Fatal Context Manipulation Attacks on Web3 Agents
di: Patlan, Atharv Singh, et al.
Pubblicazione: (2025)
di: Patlan, Atharv Singh, et al.
Pubblicazione: (2025)
Split-and-Denoise: Protect large language model inference with local differential privacy
di: Mai, Peihua, et al.
Pubblicazione: (2023)
di: Mai, Peihua, et al.
Pubblicazione: (2023)
AI Safeguards, Generative AI and the Pandora Box: AI Safety Measures to Protect Businesses and Personal Reputation
di: Kumar, Prasanna
Pubblicazione: (2026)
di: Kumar, Prasanna
Pubblicazione: (2026)
Efficient LLM Safety Evaluation through Multi-Agent Debate
di: Lin, Dachuan, et al.
Pubblicazione: (2025)
di: Lin, Dachuan, et al.
Pubblicazione: (2025)
Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible
di: Zhao, Lepeng, et al.
Pubblicazione: (2026)
di: Zhao, Lepeng, et al.
Pubblicazione: (2026)
Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies
di: Cotti, Luca, et al.
Pubblicazione: (2025)
di: Cotti, Luca, et al.
Pubblicazione: (2025)
Unlearning at Scale: Implementing the Right to be Forgotten in Large Language Models
di: X, Abdullah
Pubblicazione: (2025)
di: X, Abdullah
Pubblicazione: (2025)
Jailbreak Mimicry: Automated Discovery of Narrative-Based Jailbreaks for Large Language Models
di: Ntais, Pavlos
Pubblicazione: (2025)
di: Ntais, Pavlos
Pubblicazione: (2025)
Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Model Prompts
di: Peh, Steven
Pubblicazione: (2025)
di: Peh, Steven
Pubblicazione: (2025)
Defending against Backdoor Attacks via Module Switching
di: Li, Weijun, et al.
Pubblicazione: (2025)
di: Li, Weijun, et al.
Pubblicazione: (2025)
UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
Forecasting Anonymized Electricity Load Profiles
di: Fernandez, Joaquin Delgado, et al.
Pubblicazione: (2025)
di: Fernandez, Joaquin Delgado, et al.
Pubblicazione: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
Countermind: A Multi-Layered Security Architecture for Large Language Models
di: Schwarz, Dominik
Pubblicazione: (2025)
di: Schwarz, Dominik
Pubblicazione: (2025)
POISONCRAFT: Practical Poisoning of Retrieval-Augmented Generation for Large Language Models
di: Shao, Yangguang, et al.
Pubblicazione: (2025)
di: Shao, Yangguang, et al.
Pubblicazione: (2025)
Quantifying Return on Security Controls in LLM Systems
di: Moulton, Richard Helder, et al.
Pubblicazione: (2025)
di: Moulton, Richard Helder, et al.
Pubblicazione: (2025)
Watermarking Degrades Alignment in Language Models: Analysis and Mitigation
di: Verma, Apurv, et al.
Pubblicazione: (2025)
di: Verma, Apurv, et al.
Pubblicazione: (2025)
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
di: Young, Richard J.
Pubblicazione: (2025)
di: Young, Richard J.
Pubblicazione: (2025)
Mitigating Trojanized Prompt Chains in Educational LLM Use Cases: Experimental Findings and Detection Tool Design
di: Charles, Richard M., et al.
Pubblicazione: (2025)
di: Charles, Richard M., et al.
Pubblicazione: (2025)
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults
di: Usman, Rana Muhammad
Pubblicazione: (2026)
di: Usman, Rana Muhammad
Pubblicazione: (2026)
Logits of API-Protected LLMs Leak Proprietary Information
di: Finlayson, Matthew, et al.
Pubblicazione: (2024)
di: Finlayson, Matthew, et al.
Pubblicazione: (2024)
Shortcuts Arising from Contrast: Effective and Covert Clean-Label Attacks in Prompt-Based Learning
di: Xie, Xiaopeng, et al.
Pubblicazione: (2024)
di: Xie, Xiaopeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Beyond Memorization: Violating Privacy Via Inference with Large Language Models
di: Staab, Robin, et al.
Pubblicazione: (2023) -
Unlocking the Potential of Large Language Models for Clinical Text Anonymization: A Comparative Study
di: Pissarra, David, et al.
Pubblicazione: (2024) -
Adversarial Attacks on Large Language Models Using Regularized Relaxation
di: Chacko, Samuel Jacob, et al.
Pubblicazione: (2024) -
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
di: Xin, Yuan, et al.
Pubblicazione: (2025) -
Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems
di: Pai, Aaditya
Pubblicazione: (2026)