ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Yein, Park, Jungwoo, Kang, Jaewoo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Does Time Have Its Place? Temporal Heads: Where Language Models Recall Time-specific Information
by: Park, Yein, et al.
Published: (2025)
by: Park, Yein, et al.
Published: (2025)
Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
by: Park, Yein, et al.
Published: (2025)
by: Park, Yein, et al.
Published: (2025)
ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains
by: Park, Yein, et al.
Published: (2024)
by: Park, Yein, et al.
Published: (2024)
MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification
by: Park, Jueon, et al.
Published: (2026)
by: Park, Jueon, et al.
Published: (2026)
ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway
by: Park, Jueon, et al.
Published: (2026)
by: Park, Jueon, et al.
Published: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
by: Park, Junyoung, et al.
Published: (2026)
by: Park, Junyoung, et al.
Published: (2026)
CoTox: Chain-of-Thought-Based Molecular Toxicity Reasoning and Prediction
by: Park, Jueon, et al.
Published: (2025)
by: Park, Jueon, et al.
Published: (2025)
Monet: Mixture of Monosemantic Experts for Transformers
by: Park, Jungwoo, et al.
Published: (2024)
by: Park, Jungwoo, et al.
Published: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
by: Park, Jungwoo, et al.
Published: (2025)
by: Park, Jungwoo, et al.
Published: (2025)
Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures
by: Park, Junyoung, et al.
Published: (2026)
by: Park, Junyoung, et al.
Published: (2026)
Assessing LLM Reasoning Steps via Principal Knowledge Grounding
by: Hwang, Hyeon, et al.
Published: (2025)
by: Hwang, Hyeon, et al.
Published: (2025)
Tracing Mathematical Proficiency Through Problem-Solving Processes
by: Park, Jungyang, et al.
Published: (2025)
by: Park, Jungyang, et al.
Published: (2025)
Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
by: Yang, Yudong, et al.
Published: (2025)
by: Yang, Yudong, et al.
Published: (2025)
Activation-Guided Local Editing for Jailbreaking Attacks
by: Wang, Jiecong, et al.
Published: (2025)
by: Wang, Jiecong, et al.
Published: (2025)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
by: Cornacchia, Giandomenico, et al.
Published: (2024)
by: Cornacchia, Giandomenico, et al.
Published: (2024)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
by: Chen, Kejia, et al.
Published: (2026)
by: Chen, Kejia, et al.
Published: (2026)
Face Reconstruction Transfer Attack as Out-of-Distribution Generalization
by: Jung, Yoon Gyo, et al.
Published: (2024)
by: Jung, Yoon Gyo, et al.
Published: (2024)
Vibration-Assisted Hysteresis Mitigation for Achieving High Compensation Efficiency
by: Park, Myeongbo, et al.
Published: (2025)
by: Park, Myeongbo, et al.
Published: (2025)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
by: Oh, Sejoon, et al.
Published: (2024)
by: Oh, Sejoon, et al.
Published: (2024)
EP-HDC: Hyperdimensional Computing with Encrypted Parameters for High-Throughput Privacy-Preserving Inference
by: Park, Jaewoo, et al.
Published: (2025)
by: Park, Jaewoo, et al.
Published: (2025)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
by: Song, Chihyeon, et al.
Published: (2025)
by: Song, Chihyeon, et al.
Published: (2025)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
by: Kang, Hyeongyu, et al.
Published: (2025)
by: Kang, Hyeongyu, et al.
Published: (2025)
Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
by: Giarrusso, Francesco, et al.
Published: (2025)
by: Giarrusso, Francesco, et al.
Published: (2025)
Untargeted Jailbreak Attack
by: Huang, Xinzhe, et al.
Published: (2025)
by: Huang, Xinzhe, et al.
Published: (2025)
SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models
by: Zhao, Qinjian, et al.
Published: (2025)
by: Zhao, Qinjian, et al.
Published: (2025)
GPO-VAE: Modeling Explainable Gene Perturbation Responses utilizing GRN-Aligned Parameter Optimization
by: Baek, Seungheun, et al.
Published: (2025)
by: Baek, Seungheun, et al.
Published: (2025)
LASTIST: LArge-Scale Target-Independent STance dataset
by: Kim, DongJae, et al.
Published: (2025)
by: Kim, DongJae, et al.
Published: (2025)
Culinary Class Wars: Evaluating LLMs using ASH in Cuisine Transfer Task
by: Lee, Hoonick, et al.
Published: (2024)
by: Lee, Hoonick, et al.
Published: (2024)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
by: Mia, Md Jueal, et al.
Published: (2026)
by: Mia, Md Jueal, et al.
Published: (2026)
Guided Trajectory Generation with Diffusion Models for Offline Model-based Optimization
by: Yun, Taeyoung, et al.
Published: (2024)
by: Yun, Taeyoung, et al.
Published: (2024)
GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning
by: Lee, Jaewoo, et al.
Published: (2024)
by: Lee, Jaewoo, et al.
Published: (2024)
Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory Conditioning
by: Jeong, Jaewoo, et al.
Published: (2024)
by: Jeong, Jaewoo, et al.
Published: (2024)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
by: Ouyang, Yang, et al.
Published: (2025)
by: Ouyang, Yang, et al.
Published: (2025)
TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense
by: Liu, Cheng, et al.
Published: (2026)
by: Liu, Cheng, et al.
Published: (2026)
Harnessing LLM to Attack LLM-Guarded Text-to-Image Models
by: Deng, Yimo, et al.
Published: (2023)
by: Deng, Yimo, et al.
Published: (2023)
Involuntary Jailbreak: On Self-Prompting Attacks
by: Guo, Yangyang, et al.
Published: (2025)
by: Guo, Yangyang, et al.
Published: (2025)
Mitigating Many-Shot Jailbreaking
by: Ackerman, Christopher M., et al.
Published: (2025)
by: Ackerman, Christopher M., et al.
Published: (2025)
HiRef: Leveraging Hierarchical Ontology and Network Refinement for Robust Medication Recommendation
by: Chok, Yan Ting, et al.
Published: (2025)
by: Chok, Yan Ting, et al.
Published: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
by: Lv, Lijia, et al.
Published: (2024)
by: Lv, Lijia, et al.
Published: (2024)
Mitigating Spurious Correlations via Disagreement Probability
by: Han, Hyeonggeun, et al.
Published: (2024)
by: Han, Hyeonggeun, et al.
Published: (2024)
Similar Items
-
Does Time Have Its Place? Temporal Heads: Where Language Models Recall Time-specific Information
by: Park, Yein, et al.
Published: (2025) -
Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
by: Park, Yein, et al.
Published: (2025) -
ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains
by: Park, Yein, et al.
Published: (2024) -
MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification
by: Park, Jueon, et al.
Published: (2026) -
ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway
by: Park, Jueon, et al.
Published: (2026)