ICLGuard: Controlling In-Context Learning Behavior for Applicability Authorization
Fuente:
arXiv
Guardado en:
| Autores principales: | Si, Wai Man, Backes, Michael, Zhang, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Membership Inference Attacks Against In-Context Learning
por: Wen, Rui, et al.
Publicado: (2024)
por: Wen, Rui, et al.
Publicado: (2024)
Excessive Reasoning Attack on Reasoning LLMs
por: Si, Wai Man, et al.
Publicado: (2025)
por: Si, Wai Man, et al.
Publicado: (2025)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
por: Yang, Ziqing, et al.
Publicado: (2024)
por: Yang, Ziqing, et al.
Publicado: (2024)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
por: Zhang, Rui, et al.
Publicado: (2026)
por: Zhang, Rui, et al.
Publicado: (2026)
SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
por: Xin, Yuan, et al.
Publicado: (2026)
por: Xin, Yuan, et al.
Publicado: (2026)
Composite Backdoor Attacks Against Large Language Models
por: Huang, Hai, et al.
Publicado: (2023)
por: Huang, Hai, et al.
Publicado: (2023)
Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
por: Chen, Chaoran, et al.
Publicado: (2026)
por: Chen, Chaoran, et al.
Publicado: (2026)
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
por: Choi, Jacob, et al.
Publicado: (2025)
por: Choi, Jacob, et al.
Publicado: (2025)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
por: Zhang, Chiyu, et al.
Publicado: (2026)
por: Zhang, Chiyu, et al.
Publicado: (2026)
Secure Composition of Robust and Optimising Compilers
por: Kruse, Matthis, et al.
Publicado: (2023)
por: Kruse, Matthis, et al.
Publicado: (2023)
Universal and Context-Independent Triggers for Precise Control of LLM Outputs
por: Liang, Jiashuo, et al.
Publicado: (2024)
por: Liang, Jiashuo, et al.
Publicado: (2024)
LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops
por: Fu, Jiyuan, et al.
Publicado: (2025)
por: Fu, Jiyuan, et al.
Publicado: (2025)
LLM Reinforcement in Context
por: Rivasseau, Thomas
Publicado: (2025)
por: Rivasseau, Thomas
Publicado: (2025)
MPMA: Preference Manipulation Attack Against Model Context Protocol
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents
por: Zhou, Zhenhong, et al.
Publicado: (2026)
por: Zhou, Zhenhong, et al.
Publicado: (2026)
CAPID: Context-Aware PII Detection for Question-Answering Systems
por: Ponomarenko, Mariia, et al.
Publicado: (2026)
por: Ponomarenko, Mariia, et al.
Publicado: (2026)
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
por: Fu, Yu, et al.
Publicado: (2026)
por: Fu, Yu, et al.
Publicado: (2026)
InfoFlood: Jailbreaking Large Language Models with Information Overload
por: Yadav, Advait, et al.
Publicado: (2025)
por: Yadav, Advait, et al.
Publicado: (2025)
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
por: Xin, Yuan, et al.
Publicado: (2025)
por: Xin, Yuan, et al.
Publicado: (2025)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
por: An, Li, et al.
Publicado: (2025)
por: An, Li, et al.
Publicado: (2025)
TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts
por: Chu, Hua-Rong, et al.
Publicado: (2026)
por: Chu, Hua-Rong, et al.
Publicado: (2026)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
por: Wang, Yidan, et al.
Publicado: (2025)
por: Wang, Yidan, et al.
Publicado: (2025)
What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs
por: Kim, Sangyeop, et al.
Publicado: (2025)
por: Kim, Sangyeop, et al.
Publicado: (2025)
AdvAgent: Controllable Blackbox Red-teaming on Web Agents
por: Xu, Chejian, et al.
Publicado: (2024)
por: Xu, Chejian, et al.
Publicado: (2024)
Prompt Stealing Attacks Against Large Language Models
por: Sha, Zeyang, et al.
Publicado: (2024)
por: Sha, Zeyang, et al.
Publicado: (2024)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
Hijacking Large Language Models via Adversarial In-Context Learning
por: Zhou, Xiangyu, et al.
Publicado: (2023)
por: Zhou, Xiangyu, et al.
Publicado: (2023)
Privacy Preserving In-Context-Learning Framework for Large Language Models
por: Bhusal, Bishnu, et al.
Publicado: (2025)
por: Bhusal, Bishnu, et al.
Publicado: (2025)
CATMark: A Context-Aware Thresholding Framework for Robust Cross-Task Watermarking in Large Language Models
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
por: Zheng, JiaYing, et al.
Publicado: (2024)
por: Zheng, JiaYing, et al.
Publicado: (2024)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
por: Wei, Zhang, et al.
Publicado: (2025)
por: Wei, Zhang, et al.
Publicado: (2025)
Bag of Tricks for Subverting Reasoning-based Safety Guardrails
por: Chen, Shuo, et al.
Publicado: (2025)
por: Chen, Shuo, et al.
Publicado: (2025)
SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
por: Qu, Yubin, et al.
Publicado: (2026)
por: Qu, Yubin, et al.
Publicado: (2026)
Yet Another Watermark for Large Language Models
por: Bao, Siyuan, et al.
Publicado: (2025)
por: Bao, Siyuan, et al.
Publicado: (2025)
Are We in the AI-Generated Text World Already? Quantifying and Monitoring AIGT on Social Media
por: Sun, Zhen, et al.
Publicado: (2024)
por: Sun, Zhen, et al.
Publicado: (2024)
TempCharBERT: Keystroke Dynamics for Continuous Access Control Based on Pre-trained Language Models
por: Simão, Matheus, et al.
Publicado: (2024)
por: Simão, Matheus, et al.
Publicado: (2024)
A General Pseudonymization Framework for Cloud-Based LLMs: Replacing Privacy Information in Controlled Text Generation
por: Hou, Shilong, et al.
Publicado: (2025)
por: Hou, Shilong, et al.
Publicado: (2025)
Ejemplares similares
-
Membership Inference Attacks Against In-Context Learning
por: Wen, Rui, et al.
Publicado: (2024) -
Excessive Reasoning Attack on Reasoning LLMs
por: Si, Wai Man, et al.
Publicado: (2025) -
SOS! Soft Prompt Attack Against Open-Source Large Language Models
por: Yang, Ziqing, et al.
Publicado: (2024) -
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
por: Zhang, Rui, et al.
Publicado: (2026) -
SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
por: Xin, Yuan, et al.
Publicado: (2026)