Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Tung-Ling, Liu, Hongliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
por: Li, Tung-Ling, et al.
Publicado: (2025)
por: Li, Tung-Ling, et al.
Publicado: (2025)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
por: Hu, Hanjiang, et al.
Publicado: (2025)
por: Hu, Hanjiang, et al.
Publicado: (2025)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
por: Wang, Linlin, et al.
Publicado: (2025)
por: Wang, Linlin, et al.
Publicado: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors
por: Chen, Yen-Shan, et al.
Publicado: (2025)
por: Chen, Yen-Shan, et al.
Publicado: (2025)
AirGapAgent: Protecting Privacy-Conscious Conversational Agents
por: Bagdasarian, Eugene, et al.
Publicado: (2024)
por: Bagdasarian, Eugene, et al.
Publicado: (2024)
Improving LLM Safety Alignment with Dual-Objective Optimization
por: Zhao, Xuandong, et al.
Publicado: (2025)
por: Zhao, Xuandong, et al.
Publicado: (2025)
Cross-Modal Safety Alignment: Is textual unlearning all you need?
por: Chakraborty, Trishna, et al.
Publicado: (2024)
por: Chakraborty, Trishna, et al.
Publicado: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
por: Cao, Bochuan, et al.
Publicado: (2023)
por: Cao, Bochuan, et al.
Publicado: (2023)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
por: Zhu, Kaijie, et al.
Publicado: (2023)
por: Zhu, Kaijie, et al.
Publicado: (2023)
MPAT: Building Robust Deep Neural Networks against Textual Adversarial Attacks
por: Zhang, Fangyuan, et al.
Publicado: (2024)
por: Zhang, Fangyuan, et al.
Publicado: (2024)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
por: Liang, Jiacheng, et al.
Publicado: (2024)
por: Liang, Jiacheng, et al.
Publicado: (2024)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
por: Hsiung, Lei, et al.
Publicado: (2025)
por: Hsiung, Lei, et al.
Publicado: (2025)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
por: Rastogi, Saksham, et al.
Publicado: (2024)
por: Rastogi, Saksham, et al.
Publicado: (2024)
Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
por: Liu, Hongliang, et al.
Publicado: (2026)
por: Liu, Hongliang, et al.
Publicado: (2026)
Robust Distortion-free Watermarks for Language Models
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
Certifiably Robust RAG against Retrieval Corruption
por: Xiang, Chong, et al.
Publicado: (2024)
por: Xiang, Chong, et al.
Publicado: (2024)
Text-CRS: A Generalized Certified Robustness Framework against Textual Adversarial Attacks
por: Zhang, Xinyu, et al.
Publicado: (2023)
por: Zhang, Xinyu, et al.
Publicado: (2023)
Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
por: Rad, Melissa Kazemi, et al.
Publicado: (2025)
A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models
por: Dang, Cuong, et al.
Publicado: (2024)
por: Dang, Cuong, et al.
Publicado: (2024)
Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge
por: Cui, Xinyue, et al.
Publicado: (2025)
por: Cui, Xinyue, et al.
Publicado: (2025)
CERT-ED: Certifiably Robust Text Classification for Edit Distance
por: Huang, Zhuoqun, et al.
Publicado: (2024)
por: Huang, Zhuoqun, et al.
Publicado: (2024)
Robust LLM safeguarding via refusal feature adversarial training
por: Yu, Lei, et al.
Publicado: (2024)
por: Yu, Lei, et al.
Publicado: (2024)
Promoting Data and Model Privacy in Federated Learning through Quantized LoRA
por: Zhu, JianHao, et al.
Publicado: (2024)
por: Zhu, JianHao, et al.
Publicado: (2024)
AdaptDel: Adaptable Deletion Rate Randomized Smoothing for Certified Robustness
por: Huang, Zhuoqun, et al.
Publicado: (2025)
por: Huang, Zhuoqun, et al.
Publicado: (2025)
Enhancing Robustness of AI Offensive Code Generators via Data Augmentation
por: Improta, Cristina, et al.
Publicado: (2023)
por: Improta, Cristina, et al.
Publicado: (2023)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
por: Batra, Shourya, et al.
Publicado: (2025)
por: Batra, Shourya, et al.
Publicado: (2025)
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
por: Zhang, Ruisi, et al.
Publicado: (2025)
por: Zhang, Ruisi, et al.
Publicado: (2025)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
por: Lou, Qian, et al.
Publicado: (2024)
por: Lou, Qian, et al.
Publicado: (2024)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
por: Li, Jianwei, et al.
Publicado: (2025)
por: Li, Jianwei, et al.
Publicado: (2025)
Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs
por: Liu, Ruixuan, et al.
Publicado: (2026)
por: Liu, Ruixuan, et al.
Publicado: (2026)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
por: Shao, Zedian, et al.
Publicado: (2024)
por: Shao, Zedian, et al.
Publicado: (2024)
On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing
por: Liu, Zeyan, et al.
Publicado: (2023)
por: Liu, Zeyan, et al.
Publicado: (2023)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
por: Liu, Frank Weizhen, et al.
Publicado: (2024)
por: Liu, Frank Weizhen, et al.
Publicado: (2024)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
por: Li, Nathaniel, et al.
Publicado: (2024)
por: Li, Nathaniel, et al.
Publicado: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
por: Fu, Wenjie, et al.
Publicado: (2024)
por: Fu, Wenjie, et al.
Publicado: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
por: Fu, Wenjie, et al.
Publicado: (2023)
por: Fu, Wenjie, et al.
Publicado: (2023)
Lifelong Safety Alignment for Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
por: Roth, Tom, et al.
Publicado: (2021)
por: Roth, Tom, et al.
Publicado: (2021)
Ejemplares similares
-
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
por: Li, Tung-Ling, et al.
Publicado: (2025) -
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
por: Hu, Hanjiang, et al.
Publicado: (2025) -
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
por: Wang, Linlin, et al.
Publicado: (2025) -
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024) -
Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors
por: Chen, Yen-Shan, et al.
Publicado: (2025)