Protecting Your LLMs with Information Bottleneck
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Zichuan, Wang, Zefan, Xu, Linjie, Wang, Jinyu, Song, Lei, Wang, Tianchun, Chen, Chunlin, Cheng, Wei, Bian, Jiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
di: Wang, Tianchun, et al.
Pubblicazione: (2024)
di: Wang, Tianchun, et al.
Pubblicazione: (2024)
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
di: Liang, Zi, et al.
Pubblicazione: (2025)
di: Liang, Zi, et al.
Pubblicazione: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
HARMONIC: Harnessing LLMs for Tabular Data Synthesis and Privacy Protection
di: Wang, Yuxin, et al.
Pubblicazione: (2024)
di: Wang, Yuxin, et al.
Pubblicazione: (2024)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning
di: Hasan, Adib, et al.
Pubblicazione: (2024)
di: Hasan, Adib, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
CrypTorch: PyTorch-based Auto-tuning Compiler for Machine Learning with Multi-party Computation
di: Liu, Jinyu, et al.
Pubblicazione: (2025)
di: Liu, Jinyu, et al.
Pubblicazione: (2025)
SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters
di: Yang, Yan, et al.
Pubblicazione: (2024)
di: Yang, Yan, et al.
Pubblicazione: (2024)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
di: Wang, Zijun, et al.
Pubblicazione: (2026)
di: Wang, Zijun, et al.
Pubblicazione: (2026)
DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection
di: Yan, Yuliang, et al.
Pubblicazione: (2025)
di: Yan, Yuliang, et al.
Pubblicazione: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Protecting Your Voice: Temporal-aware Robust Watermarking
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
di: Xu, Naen, et al.
Pubblicazione: (2026)
di: Xu, Naen, et al.
Pubblicazione: (2026)
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
di: Li, Xingyu, et al.
Pubblicazione: (2025)
di: Li, Xingyu, et al.
Pubblicazione: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
di: Huang, Chung-ju, et al.
Pubblicazione: (2026)
di: Huang, Chung-ju, et al.
Pubblicazione: (2026)
Is Your Prompt Safe? Investigating Prompt Injection Attacks Against Open-Source LLMs
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From
di: Tong, Yao, et al.
Pubblicazione: (2025)
di: Tong, Yao, et al.
Pubblicazione: (2025)
WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents
di: Wang, Xilong, et al.
Pubblicazione: (2026)
di: Wang, Xilong, et al.
Pubblicazione: (2026)
Do Phone-Use Agents Respect Your Privacy?
di: Tang, Zhengyang, et al.
Pubblicazione: (2026)
di: Tang, Zhengyang, et al.
Pubblicazione: (2026)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
di: Liu, Songyang, et al.
Pubblicazione: (2026)
di: Liu, Songyang, et al.
Pubblicazione: (2026)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
di: Ngong, Ivoline, et al.
Pubblicazione: (2025)
di: Ngong, Ivoline, et al.
Pubblicazione: (2025)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
di: Hu, Xuhao, et al.
Pubblicazione: (2025)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
di: Geng, Runpeng, et al.
Pubblicazione: (2025)
A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy
di: Wang, Huandong, et al.
Pubblicazione: (2025)
di: Wang, Huandong, et al.
Pubblicazione: (2025)
Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
di: Liu, Jinbo, et al.
Pubblicazione: (2025)
di: Liu, Jinbo, et al.
Pubblicazione: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
di: Ji, Wence, et al.
Pubblicazione: (2025)
di: Ji, Wence, et al.
Pubblicazione: (2025)
Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
RedacBench: Can AI Erase Your Secrets?
di: Jeon, Hyunjun, et al.
Pubblicazione: (2026)
di: Jeon, Hyunjun, et al.
Pubblicazione: (2026)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
di: Min, Rui, et al.
Pubblicazione: (2025)
di: Min, Rui, et al.
Pubblicazione: (2025)
Dagger Behind Smile: Fool LLMs with a Happy Ending Story
di: Song, Xurui, et al.
Pubblicazione: (2025)
di: Song, Xurui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
di: Wang, Tianchun, et al.
Pubblicazione: (2024) -
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
di: Liang, Zi, et al.
Pubblicazione: (2025) -
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024) -
HARMONIC: Harnessing LLMs for Tabular Data Synthesis and Privacy Protection
di: Wang, Yuxin, et al.
Pubblicazione: (2024) -
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
di: Lu, Guoxin, et al.
Pubblicazione: (2026)