Asking Forever: Universal Activations Behind Turn Amplification in Conversational LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Coalson, Zachary, Fang, Bo, Hong, Sanghyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Discovering Universal Activation Directions for PII Leakage in Language Models
di: Marchyok, Leo, et al.
Pubblicazione: (2026)
di: Marchyok, Leo, et al.
Pubblicazione: (2026)
IF-GUIDE: Influence Function-Guided Detoxification of LLMs
di: Coalson, Zachary, et al.
Pubblicazione: (2025)
di: Coalson, Zachary, et al.
Pubblicazione: (2025)
Fail-Closed Alignment for Large Language Models
di: Coalson, Zachary, et al.
Pubblicazione: (2026)
di: Coalson, Zachary, et al.
Pubblicazione: (2026)
Hard Work Does Not Always Pay Off: Poisoning Attacks on Neural Architecture Search
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
di: Coalson, Zachary, et al.
Pubblicazione: (2024)
Black-box Optimization of LLM Outputs by Asking for Directions
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Turn-Based Structural Triggers: Prompt-Free Backdoors in Multi-Turn LLMs
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
Mitigating Error Amplification in Fast Adversarial Training
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
Modeling Neural Networks with Privacy Using Neural Stochastic Differential Equations
di: Hong, Sanghyun, et al.
Pubblicazione: (2025)
di: Hong, Sanghyun, et al.
Pubblicazione: (2025)
Hessian-aware Training for Enhancing DNNs Resilience to Parameter Corruptions
di: Prato, Tahmid Hasan, et al.
Pubblicazione: (2025)
di: Prato, Tahmid Hasan, et al.
Pubblicazione: (2025)
Unified Mechanism-Specific Amplification by Subsampling and Group Privacy Amplification
di: Schuchardt, Jan, et al.
Pubblicazione: (2024)
di: Schuchardt, Jan, et al.
Pubblicazione: (2024)
MADCAT: Combating Malware Detection Under Concept Drift with Test-Time Adaptation
di: Roh, Eunjin, et al.
Pubblicazione: (2025)
di: Roh, Eunjin, et al.
Pubblicazione: (2025)
Privacy Amplification for Matrix Mechanisms
di: Choquette-Choo, Christopher A., et al.
Pubblicazione: (2023)
di: Choquette-Choo, Christopher A., et al.
Pubblicazione: (2023)
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
di: Wen, Yuxin, et al.
Pubblicazione: (2024)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
di: Wang, Linlin, et al.
Pubblicazione: (2025)
di: Wang, Linlin, et al.
Pubblicazione: (2025)
Personalized Privacy Amplification via Importance Sampling
di: Fay, Dominik, et al.
Pubblicazione: (2023)
di: Fay, Dominik, et al.
Pubblicazione: (2023)
Leveraging Randomness in Model and Data Partitioning for Privacy Amplification
di: Dong, Andy, et al.
Pubblicazione: (2025)
di: Dong, Andy, et al.
Pubblicazione: (2025)
Privacy Amplification for the Gaussian Mechanism via Bounded Support
di: Hu, Shengyuan, et al.
Pubblicazione: (2024)
di: Hu, Shengyuan, et al.
Pubblicazione: (2024)
Detecting Adversarial Data via Provable Adversarial Noise Amplification
di: Mumcu, Furkan, et al.
Pubblicazione: (2026)
di: Mumcu, Furkan, et al.
Pubblicazione: (2026)
Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
di: Zhang, Boyang, et al.
Pubblicazione: (2024)
Privacy Amplification Through Synthetic Data: Insights from Linear Regression
di: Pierquin, Clément, et al.
Pubblicazione: (2025)
di: Pierquin, Clément, et al.
Pubblicazione: (2025)
Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
di: Zhao, Mengnan, et al.
Pubblicazione: (2026)
Rényi Pufferfish Privacy: General Additive Noise Mechanisms and Privacy Amplification by Iteration
di: Pierquin, Clément, et al.
Pubblicazione: (2023)
di: Pierquin, Clément, et al.
Pubblicazione: (2023)
Privacy Amplification by Structured Subsampling for Deep Differentially Private Time Series Forecasting
di: Schuchardt, Jan, et al.
Pubblicazione: (2025)
di: Schuchardt, Jan, et al.
Pubblicazione: (2025)
Turning Federated Learning Systems Into Covert Channels
di: Costa, Gabriele, et al.
Pubblicazione: (2021)
di: Costa, Gabriele, et al.
Pubblicazione: (2021)
It's Our Loss: No Privacy Amplification for Hidden State DP-SGD With Non-Convex Loss
di: Annamalai, Meenatchi Sundaram Muthu Selva
Pubblicazione: (2024)
di: Annamalai, Meenatchi Sundaram Muthu Selva
Pubblicazione: (2024)
Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising
di: Hong, Sanghyun, et al.
Pubblicazione: (2024)
di: Hong, Sanghyun, et al.
Pubblicazione: (2024)
Towards Strong Certified Defense with Universal Asymmetric Randomization
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
di: Li, Songze, et al.
Pubblicazione: (2026)
di: Li, Songze, et al.
Pubblicazione: (2026)
Universally Harmonizing Differential Privacy Mechanisms for Federated Learning: Boosting Accuracy and Convergence
di: Feng, Shuya, et al.
Pubblicazione: (2024)
di: Feng, Shuya, et al.
Pubblicazione: (2024)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
di: Chen, Boyuan, et al.
Pubblicazione: (2025)
Shake to Leak: Fine-tuning Diffusion Models Can Amplify the Generative Privacy Risk
di: Li, Zhangheng, et al.
Pubblicazione: (2024)
di: Li, Zhangheng, et al.
Pubblicazione: (2024)
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
di: Abdali, Sara, et al.
Pubblicazione: (2024)
di: Abdali, Sara, et al.
Pubblicazione: (2024)
LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs
di: Jha, Piyush, et al.
Pubblicazione: (2024)
di: Jha, Piyush, et al.
Pubblicazione: (2024)
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems
di: Rahman, Md Hafizur, et al.
Pubblicazione: (2026)
di: Rahman, Md Hafizur, et al.
Pubblicazione: (2026)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
di: Chen, Zhuowei, et al.
Pubblicazione: (2025)
di: Chen, Zhuowei, et al.
Pubblicazione: (2025)
Compact: Approximating Complex Activation Functions for Secure Computation
di: Islam, Mazharul, et al.
Pubblicazione: (2023)
di: Islam, Mazharul, et al.
Pubblicazione: (2023)
BAN: Detecting Backdoors Activated by Adversarial Neuron Noise
di: Xu, Xiaoyun, et al.
Pubblicazione: (2024)
di: Xu, Xiaoyun, et al.
Pubblicazione: (2024)
xMLP: Revolutionizing Private Inference with Exclusive Square Activation
di: Li, Jiajie, et al.
Pubblicazione: (2024)
di: Li, Jiajie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Discovering Universal Activation Directions for PII Leakage in Language Models
di: Marchyok, Leo, et al.
Pubblicazione: (2026) -
IF-GUIDE: Influence Function-Guided Detoxification of LLMs
di: Coalson, Zachary, et al.
Pubblicazione: (2025) -
Fail-Closed Alignment for Large Language Models
di: Coalson, Zachary, et al.
Pubblicazione: (2026) -
Hard Work Does Not Always Pay Off: Poisoning Attacks on Neural Architecture Search
di: Coalson, Zachary, et al.
Pubblicazione: (2024) -
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
di: Coalson, Zachary, et al.
Pubblicazione: (2024)