Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dabas, Mahavir, Huynh, Tran, Billa, Nikhil Reddy, Wang, Jiachen T., Gao, Peng, Peris, Charith, Ma, Yao, Gupta, Rahul, Jin, Ming, Mittal, Prateek, Jia, Ruoxi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory-Induced Tool-Drift in LLM Agents
par: Dabas, Mahavir, et autres
Publié: (2026)
par: Dabas, Mahavir, et autres
Publié: (2026)
Déjà Vu
par: Houppermans, Sjef, et autres
Publié: (2016)
par: Houppermans, Sjef, et autres
Publié: (2016)
Efficient Data Shapley for Weighted Nearest Neighbor Algorithms
par: Wang, Jiachen T., et autres
Publié: (2024)
par: Wang, Jiachen T., et autres
Publié: (2024)
Characterizing Model-Native Skills
par: Kang, Feiyang, et autres
Publié: (2026)
par: Kang, Feiyang, et autres
Publié: (2026)
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)
par: Dabas, Mahavir, et autres
Publié: (2025)
Deja Vu from the Bridge.
par: Sullivan, Peggy
Publié: (1979)
par: Sullivan, Peggy
Publié: (1979)
DiPT: Enhancing LLM reasoning through diversified perspective-taking
par: Just, Hoang Anh, et autres
Publié: (2024)
par: Just, Hoang Anh, et autres
Publié: (2024)
Data Shapley in One Training Run
par: Wang, Jiachen T., et autres
Publié: (2024)
par: Wang, Jiachen T., et autres
Publié: (2024)
Déjà Vu Memorization in Vision-Language Models
par: Jayaraman, Bargav, et autres
Publié: (2024)
par: Jayaraman, Bargav, et autres
Publié: (2024)
The Electronic Revolution in Libraries: Microfilm Deja Vu?
par: Cady, Susan A.
Publié: (1990)
par: Cady, Susan A.
Publié: (1990)
Info Lit 2.0 or Déjà Vu?
par: Ianuzzi, Patricia Anne
Publié: (2013)
par: Ianuzzi, Patricia Anne
Publié: (2013)
Retracing the Past: LLMs Emit Training Data When They Get Lost
par: Ko, Myeongseob, et autres
Publié: (2025)
par: Ko, Myeongseob, et autres
Publié: (2025)
Capturing the Temporal Dependence of Training Data Influence
par: Wang, Jiachen T., et autres
Publié: (2024)
par: Wang, Jiachen T., et autres
Publié: (2024)
DejaVu: A Minimalistic Mechanism for Distributed Plurality Consensus
par: d'Amore, Francesco, et autres
Publié: (2026)
par: d'Amore, Francesco, et autres
Publié: (2026)
Déjà Vu? Decoding Repeated Reading from Eye Movements
par: Meiri, Yoav, et autres
Publié: (2025)
par: Meiri, Yoav, et autres
Publié: (2025)
News Deja Vu: Connecting Past and Present with Semantic Search
par: Franklin, Brevin, et autres
Publié: (2024)
par: Franklin, Brevin, et autres
Publié: (2024)
School and Public Library Relationships: Deja Vu or New Beginnings.
par: Fitzgibbons, Shirley A.
Publié: (2001)
par: Fitzgibbons, Shirley A.
Publié: (2001)
Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation
par: Kreutzer, Julia, et autres
Publié: (2025)
par: Kreutzer, Julia, et autres
Publié: (2025)
DéjàVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving
par: Strati, Foteini, et autres
Publié: (2024)
par: Strati, Foteini, et autres
Publié: (2024)
Déjà Vu Packing: Optimizing FPGA Logic Clustering Runtime via Pattern Memoization
par: Liebster, Milo, et autres
Publié: (2026)
par: Liebster, Milo, et autres
Publié: (2026)
Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice
par: Wang, Jiachen T., et autres
Publié: (2025)
par: Wang, Jiachen T., et autres
Publié: (2025)
Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse
par: Hwang, Jinwoo, et autres
Publié: (2025)
par: Hwang, Jinwoo, et autres
Publié: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
par: Ma, Jiachen, et autres
Publié: (2024)
par: Ma, Jiachen, et autres
Publié: (2024)
A Linguistic Analysis of Spontaneous Thoughts: Investigating Experiences of Déjà Vu, Unexpected Thoughts, and Involuntary Autobiographical Memories
par: Venkatesha, Videep, et autres
Publié: (2025)
par: Venkatesha, Videep, et autres
Publié: (2025)
Deja Vu in Plots: Leveraging Cross-Session Evidence with Retrieval-Augmented LLMs for Live Streaming Risk Assessment
par: Qiao, Yiran, et autres
Publié: (2026)
par: Qiao, Yiran, et autres
Publié: (2026)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
par: Liang, Shuang, et autres
Publié: (2025)
par: Liang, Shuang, et autres
Publié: (2025)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
PatchDEMUX: A Certifiably Robust Framework for Multi-label Classifiers Against Adversarial Patches
par: Jacob, Dennis, et autres
Publié: (2025)
par: Jacob, Dennis, et autres
Publié: (2025)
The existence and controllability of nonautonomous system influenced by impulses on both state and control
par: Gupta, Garima, et autres
Publié: (2024)
par: Gupta, Garima, et autres
Publié: (2024)
Existence And Approximate Controllability for a class of Fractional Order Hemivariational Inequalities
par: Gupta, Garima, et autres
Publié: (2024)
par: Gupta, Garima, et autres
Publié: (2024)
Study on Control Problem of a Impulsive Neutral Integro-Differential Equations with Fading Memory
par: Gupta, Garima, et autres
Publié: (2025)
par: Gupta, Garima, et autres
Publié: (2025)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
par: Zhao, Yunhan, et autres
Publié: (2025)
par: Zhao, Yunhan, et autres
Publié: (2025)
Position: Towards Resilience Against Adversarial Examples
par: Dai, Sihui, et autres
Publié: (2024)
par: Dai, Sihui, et autres
Publié: (2024)
K-Edit: Language Model Editing with Contextual Knowledge Awareness
par: Markowitz, Elan, et autres
Publié: (2025)
par: Markowitz, Elan, et autres
Publié: (2025)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
par: Chen, Kejia, et autres
Publié: (2026)
par: Chen, Kejia, et autres
Publié: (2026)
Towards Million-Scale Adversarial Robustness Evaluation With Stronger Individual Attacks
par: Xie, Yong, et autres
Publié: (2024)
par: Xie, Yong, et autres
Publié: (2024)
Defenses Against Prompt Attacks Learn Surface Heuristics
par: Li, Shawn, et autres
Publié: (2026)
par: Li, Shawn, et autres
Publié: (2026)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
par: Nasr, Milad, et autres
Publié: (2025)
par: Nasr, Milad, et autres
Publié: (2025)
Déjà vu
par: Ernesto Raabe
Publié: (2009)
par: Ernesto Raabe
Publié: (2009)
Documents similaires
-
Memory-Induced Tool-Drift in LLM Agents
par: Dabas, Mahavir, et autres
Publié: (2026) -
Déjà Vu
par: Houppermans, Sjef, et autres
Publié: (2016) -
Efficient Data Shapley for Weighted Nearest Neighbor Algorithms
par: Wang, Jiachen T., et autres
Publié: (2024) -
Characterizing Model-Native Skills
par: Kang, Feiyang, et autres
Publié: (2026) -
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)