PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Coalson, Zachary, Woo, Jeonghyun, Lin, Chris S., Qu, Joyce, Sun, Yu, Chen, Shiyang, Yang, Lishan, Saileshwar, Gururaj, Nair, Prashant, Fang, Bo, Hong, Sanghyun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Mitigations Backfire: Timing Channel Attacks and Defense for PRAC-Based RowHammer Mitigations
par: Woo, Jeonghyun, et autres
Publié: (2025)
par: Woo, Jeonghyun, et autres
Publié: (2025)
Scalable and Secure Row-Swap: Efficient and Safe Row Hammer Mitigation in Memory Systems
par: Woo, Jeonghyun, et autres
Publié: (2022)
par: Woo, Jeonghyun, et autres
Publié: (2022)
CnC-PRAC: Coalesce, not Cache, Per Row Activation Counts for an Efficient in-DRAM Rowhammer Mitigation
par: Lin, Chris S., et autres
Publié: (2025)
par: Lin, Chris S., et autres
Publié: (2025)
QPRAC: Towards Secure and Practical PRAC-based Rowhammer Mitigation using Priority Queues
par: Woo, Jeonghyun, et autres
Publié: (2025)
par: Woo, Jeonghyun, et autres
Publié: (2025)
Redacted Title
par: Chris S., Lin, et autres
Publié: (2025)
par: Chris S., Lin, et autres
Publié: (2025)
GPUHammer: Rowhammer Attacks on GPU Memories are Practical
par: Lin, Chris S., et autres
Publié: (2025)
par: Lin, Chris S., et autres
Publié: (2025)
Yet Another Mirage of Breaking MIRAGE: Debunking Occupancy-based Side-Channel Attacks on Fully Associative Randomized Caches
par: Cao, Chris, et autres
Publié: (2025)
par: Cao, Chris, et autres
Publié: (2025)
Asking Forever: Universal Activations Behind Turn Amplification in Conversational LLMs
par: Coalson, Zachary, et autres
Publié: (2026)
par: Coalson, Zachary, et autres
Publié: (2026)
DAPPER: A Performance-Attack-Resilient Tracker for RowHammer Defense
par: Woo, Jeonghyun, et autres
Publié: (2025)
par: Woo, Jeonghyun, et autres
Publié: (2025)
GPUBreach: Privilege Escalation Attacks on GPUs using Rowhammer
par: Lin, Chris S., et autres
Publié: (2026)
par: Lin, Chris S., et autres
Publié: (2026)
Fail-Closed Alignment for Large Language Models
par: Coalson, Zachary, et autres
Publié: (2026)
par: Coalson, Zachary, et autres
Publié: (2026)
Hard Work Does Not Always Pay Off: Poisoning Attacks on Neural Architecture Search
par: Coalson, Zachary, et autres
Publié: (2024)
par: Coalson, Zachary, et autres
Publié: (2024)
IF-GUIDE: Influence Function-Guided Detoxification of LLMs
par: Coalson, Zachary, et autres
Publié: (2025)
par: Coalson, Zachary, et autres
Publié: (2025)
Time Will Tell: Timing Side Channels via Output Token Count in Large Language Models
par: Zhang, Tianchen, et autres
Publié: (2024)
par: Zhang, Tianchen, et autres
Publié: (2024)
CLIP: Client-Side Invariant Pruning for Mitigating Stragglers in Secure Federated Learning
par: DiMaggio, Anthony, et autres
Publié: (2025)
par: DiMaggio, Anthony, et autres
Publié: (2025)
Probabilistic Tracker Management Policies for Low-Cost and Scalable Rowhammer Mitigation
par: Jaleel, Aamer, et autres
Publié: (2024)
par: Jaleel, Aamer, et autres
Publié: (2024)
Loaded Dice: Solving the Non-Selection Problem for Scalable Probabilistic RowHammer Defense
par: Woo, Jeonghyun, et autres
Publié: (2026)
par: Woo, Jeonghyun, et autres
Publié: (2026)
Discovering Universal Activation Directions for PII Leakage in Language Models
par: Marchyok, Leo, et autres
Publié: (2026)
par: Marchyok, Leo, et autres
Publié: (2026)
Harnessing Input-Adaptive Inference for Efficient VLN
par: Kang, Dongwoo, et autres
Publié: (2025)
par: Kang, Dongwoo, et autres
Publié: (2025)
When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
par: Wei, Jiankun, et autres
Publié: (2024)
par: Wei, Jiankun, et autres
Publié: (2024)
Teaching an Old Dog New Tricks: Verifiable FHE Using Commodity Hardware
par: Drean, Jules, et autres
Publié: (2024)
par: Drean, Jules, et autres
Publié: (2024)
Breaking the Moss rule
par: Raza, Søren, et autres
Publié: (2026)
par: Raza, Søren, et autres
Publié: (2026)
Breaking In: Library Service to Prisoners
par: Rubin, Rhea J.
Publié: (1977)
par: Rubin, Rhea J.
Publié: (1977)
From diagnostic errors to diagnostic excellence in emergency care: Time to flip the script
par: Prashant Mahajan
Publié: (2024)
par: Prashant Mahajan
Publié: (2024)
Twenty‐Five Percent of Patients Undergoing Knee Arthroscopy Use Psychotropic Medications
par: Zachary Ramsey, et autres
Publié: (2025)
par: Zachary Ramsey, et autres
Publié: (2025)
BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models
par: Yan, Xiaobei, et autres
Publié: (2025)
par: Yan, Xiaobei, et autres
Publié: (2025)
Bit flips, saturation, and quantum chaos in dissipative cat qubits
par: Ferrari, Filippo, et autres
Publié: (2026)
par: Ferrari, Filippo, et autres
Publié: (2026)
Twenty Five Habits To Encourage Reading.
par: Shaughnessy, Michael F.
Publié: (1995)
par: Shaughnessy, Michael F.
Publié: (1995)
Learning ON Large Datasets Using Bit-String Trees
par: Gupta, Prashant
Publié: (2025)
par: Gupta, Prashant
Publié: (2025)
The Challenge Continues: Prison Librarianship in the 1980s.
par: Rubin, Rhea Joyce, et autres
Publié: (1989)
par: Rubin, Rhea Joyce, et autres
Publié: (1989)
Jailbreaking is (Mostly) Simpler Than You Think
par: Russinovich, Mark, et autres
Publié: (2025)
par: Russinovich, Mark, et autres
Publié: (2025)
COBRA: Catastrophic Bit-flip Reliability Analysis of State-Space Models
par: Das, Sanjay, et autres
Publié: (2025)
par: Das, Sanjay, et autres
Publié: (2025)
Wi-Fi: Twenty-Five Years and Counting
par: Geraci, Giovanni, et autres
Publié: (2025)
par: Geraci, Giovanni, et autres
Publié: (2025)
Scouring Parrondo's Paradox in Discrete-Time Quantum Walks
par: Kadiri, Gururaj
Publié: (2024)
par: Kadiri, Gururaj
Publié: (2024)
U. S. Prison Library Services And Their Theoretical Bases. Occasional Papers Number 110.
par: Rubin, Rhea Joyce
Publié: (1973)
par: Rubin, Rhea Joyce
Publié: (1973)
Bit-flip errors in dissipative cat qubits: second-order perturbation theory
par: Dubovitskii, Kirill S.
Publié: (2024)
par: Dubovitskii, Kirill S.
Publié: (2024)
Jailbreaking Black Box Large Language Models in Twenty Queries
par: Chao, Patrick, et autres
Publié: (2023)
par: Chao, Patrick, et autres
Publié: (2023)
AMuLeT: Automated Design-Time Testing of Secure Speculation Countermeasures
par: Fu, Bo, et autres
Publié: (2025)
par: Fu, Bo, et autres
Publié: (2025)
Twenty-Five Years of "School Library Media Quarterly."
par: Callison, Daniel
Publié: (1997)
par: Callison, Daniel
Publié: (1997)
Twenty-Five Years of Academic Library Building Planning.
par: Kaser, David
Publié: (1984)
par: Kaser, David
Publié: (1984)
Documents similaires
-
When Mitigations Backfire: Timing Channel Attacks and Defense for PRAC-Based RowHammer Mitigations
par: Woo, Jeonghyun, et autres
Publié: (2025) -
Scalable and Secure Row-Swap: Efficient and Safe Row Hammer Mitigation in Memory Systems
par: Woo, Jeonghyun, et autres
Publié: (2022) -
CnC-PRAC: Coalesce, not Cache, Per Row Activation Counts for an Efficient in-DRAM Rowhammer Mitigation
par: Lin, Chris S., et autres
Publié: (2025) -
QPRAC: Towards Secure and Practical PRAC-based Rowhammer Mitigation using Priority Queues
par: Woo, Jeonghyun, et autres
Publié: (2025) -
Redacted Title
par: Chris S., Lin, et autres
Publié: (2025)