Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Chaoran, Yuan, Dayu, Kairouz, Peter |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
di: Choi, Jacob, et al.
Pubblicazione: (2025)
di: Choi, Jacob, et al.
Pubblicazione: (2025)
Privacy-Preserving Instructions for Aligning Large Language Models
di: Yu, Da, et al.
Pubblicazione: (2024)
di: Yu, Da, et al.
Pubblicazione: (2024)
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
di: Meeus, Matthieu, et al.
Pubblicazione: (2025)
di: Meeus, Matthieu, et al.
Pubblicazione: (2025)
MAPLE: Metadata Augmented Private Language Evolution
di: Chien, Eli, et al.
Pubblicazione: (2026)
di: Chien, Eli, et al.
Pubblicazione: (2026)
LMO-DP: Optimizing the Randomization Mechanism for Differentially Private Fine-Tuning (Large) Language Models
di: Yang, Qin, et al.
Pubblicazione: (2024)
di: Yang, Qin, et al.
Pubblicazione: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
Differentially Private Retrieval-Augmented Generation
di: Tang, Tingting, et al.
Pubblicazione: (2026)
di: Tang, Tingting, et al.
Pubblicazione: (2026)
ICLGuard: Controlling In-Context Learning Behavior for Applicability Authorization
di: Si, Wai Man, et al.
Pubblicazione: (2024)
di: Si, Wai Man, et al.
Pubblicazione: (2024)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
di: Li, Yansong, et al.
Pubblicazione: (2023)
di: Li, Yansong, et al.
Pubblicazione: (2023)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets
di: Frikha, Ahmed, et al.
Pubblicazione: (2024)
di: Frikha, Ahmed, et al.
Pubblicazione: (2024)
Urania: Differentially Private Insights into AI Use
di: Liu, Daogao, et al.
Pubblicazione: (2025)
di: Liu, Daogao, et al.
Pubblicazione: (2025)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
di: Zhang, Rui, et al.
Pubblicazione: (2026)
di: Zhang, Rui, et al.
Pubblicazione: (2026)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
ACTG-ARL: Differentially Private Conditional Text Generation with RL-Boosted Control
di: Hu, Yuzheng, et al.
Pubblicazione: (2025)
di: Hu, Yuzheng, et al.
Pubblicazione: (2025)
Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface
di: Labunets, Andrey, et al.
Pubblicazione: (2025)
di: Labunets, Andrey, et al.
Pubblicazione: (2025)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)
di: Mori, Junki, et al.
Pubblicazione: (2025)
di: Mori, Junki, et al.
Pubblicazione: (2025)
CLIOPATRA: Extracting Private Information from LLM Insights
di: Annamalai, Meenatchi Sundaram Muthu Selva, et al.
Pubblicazione: (2026)
di: Annamalai, Meenatchi Sundaram Muthu Selva, et al.
Pubblicazione: (2026)
AirGapAgent: Protecting Privacy-Conscious Conversational Agents
di: Bagdasarian, Eugene, et al.
Pubblicazione: (2024)
di: Bagdasarian, Eugene, et al.
Pubblicazione: (2024)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks
di: Iyer, Karthik Raghu, et al.
Pubblicazione: (2026)
di: Iyer, Karthik Raghu, et al.
Pubblicazione: (2026)
Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry
di: Lan, Wenhao, et al.
Pubblicazione: (2026)
di: Lan, Wenhao, et al.
Pubblicazione: (2026)
Retrieval-Augmented Few-Shot Prompting Versus Fine-Tuning for Code Vulnerability Detection
di: Trad, Fouad, et al.
Pubblicazione: (2025)
di: Trad, Fouad, et al.
Pubblicazione: (2025)
The Obvious Invisible Threat: LLM-Powered GUI Agents' Vulnerability to Fine-Print Injections
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
di: Chen, Chaoran, et al.
Pubblicazione: (2025)
DP-BART for Privatized Text Rewriting under Local Differential Privacy
di: Igamberdiev, Timour, et al.
Pubblicazione: (2023)
di: Igamberdiev, Timour, et al.
Pubblicazione: (2023)
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
di: Rajore, Tanmay, et al.
Pubblicazione: (2024)
di: Rajore, Tanmay, et al.
Pubblicazione: (2024)
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
di: Fu, Yu, et al.
Pubblicazione: (2024)
di: Fu, Yu, et al.
Pubblicazione: (2024)
Synthetic Query Generation for Privacy-Preserving Deep Retrieval Systems using Differentially Private Language Models
di: Carranza, Aldo Gael, et al.
Pubblicazione: (2023)
di: Carranza, Aldo Gael, et al.
Pubblicazione: (2023)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence
di: Gan, Jialing, et al.
Pubblicazione: (2026)
di: Gan, Jialing, et al.
Pubblicazione: (2026)
LLM Reinforcement in Context
di: Rivasseau, Thomas
Pubblicazione: (2025)
di: Rivasseau, Thomas
Pubblicazione: (2025)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
Mind the Privacy Unit! User-Level Differential Privacy for Language Model Fine-Tuning
di: Chua, Lynn, et al.
Pubblicazione: (2024)
di: Chua, Lynn, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
di: Choi, Jacob, et al.
Pubblicazione: (2025) -
Privacy-Preserving Instructions for Aligning Large Language Models
di: Yu, Da, et al.
Pubblicazione: (2024) -
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
di: Liu, Yepeng, et al.
Pubblicazione: (2025) -
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
di: Meeus, Matthieu, et al.
Pubblicazione: (2025) -
MAPLE: Metadata Augmented Private Language Evolution
di: Chien, Eli, et al.
Pubblicazione: (2026)