Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Peng, Kuang, Jun, Sun, Wen, Wang, Zongyu, Cao, Xuezhi, Cai, Xunliang, Chen, Jiajun, Huang, Shujian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
par: Ding, Peng, et autres
Publié: (2025)
par: Ding, Peng, et autres
Publié: (2025)
A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
par: Ding, Peng, et autres
Publié: (2023)
par: Ding, Peng, et autres
Publié: (2023)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
par: Ding, Peng, et autres
Publié: (2024)
par: Ding, Peng, et autres
Publié: (2024)
Friend or Foe
par: Cherendichenko, Oleksandr, et autres
Publié: (2025)
par: Cherendichenko, Oleksandr, et autres
Publié: (2025)
Alcohol: Friend or Foe?
par: Ricardo A. González
Publié: (2011)
par: Ricardo A. González
Publié: (2011)
LLMs in Cybersecurity: Friend or Foe in the Human Decision Loop?
par: Pekaric, Irdin, et autres
Publié: (2025)
par: Pekaric, Irdin, et autres
Publié: (2025)
SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
par: Ding, Peng, et autres
Publié: (2025)
par: Ding, Peng, et autres
Publié: (2025)
Chemifriction and Superlubricity: Friends or Foes?
par: Ying, Penghua, et autres
Publié: (2024)
par: Ying, Penghua, et autres
Publié: (2024)
Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability
par: wang, Jiaming, et autres
Publié: (2025)
par: wang, Jiaming, et autres
Publié: (2025)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
par: Nie, Dujun, et autres
Publié: (2026)
par: Nie, Dujun, et autres
Publié: (2026)
Fooling SHAP with Output Shuffling Attacks
par: Yuan, Jun, et autres
Publié: (2024)
par: Yuan, Jun, et autres
Publié: (2024)
Friend or Foe Inside? Exploring In-Process Isolation to Maintain Memory Safety for Unsafe Rust
par: Gülmez, Merve, et autres
Publié: (2023)
par: Gülmez, Merve, et autres
Publié: (2023)
Movable Antennas Meet Intelligent Reflecting Surface: Friends or Foes?
par: Wei, Xin, et autres
Publié: (2025)
par: Wei, Xin, et autres
Publié: (2025)
Knowledge Graphs and Critical Infrastructures: Friends or Foes?
par: José Miguel Blanco, et autres
Publié: (2026)
par: José Miguel Blanco, et autres
Publié: (2026)
AI Code Generators for Security: Friend or Foe?
par: Natella, Roberto, et autres
Publié: (2024)
par: Natella, Roberto, et autres
Publié: (2024)
Audio and Video Cassettes; Friend or Foe of the Librarian?
par: Poulos, Arthur
Publié: (1972)
par: Poulos, Arthur
Publié: (1972)
Conflict in the Large Academic Library: Friend or Foe?
par: Pettas, William, et autres
Publié: (1992)
par: Pettas, William, et autres
Publié: (1992)
Tissue Resident Memory Cells: Friend or Foe?
par: Chidimma F. Chude, et autres
Publié: (2025)
par: Chidimma F. Chude, et autres
Publié: (2025)
Local ancestry in Apoe3: Friend or Foe?
par: Sofia Moura, et autres
Publié: (2024)
par: Sofia Moura, et autres
Publié: (2024)
Defects of Metal Halide Perovskites in Photocatalytic Energy Conversion: Friend or Foe?
par: Chunhua Wang, et autres
Publié: (2024)
par: Chunhua Wang, et autres
Publié: (2024)
StyleFool: Fooling Video Classification Systems via Style Transfer
par: Cao, Yuxin, et autres
Publié: (2022)
par: Cao, Yuxin, et autres
Publié: (2022)
Friend or Foe? Navigating and Re-configuring "Snipers' Alley"
par: Dwyer, Andrew C, et autres
Publié: (2025)
par: Dwyer, Andrew C, et autres
Publié: (2025)
Friend or Foe? Harnessing Controllable Overfitting for Anomaly Detection
par: Qian, Long, et autres
Publié: (2024)
par: Qian, Long, et autres
Publié: (2024)
Friend or Foe: Delegating to an AI Whose Alignment is Unknown
par: Fudenberg, Drew, et autres
Publié: (2025)
par: Fudenberg, Drew, et autres
Publié: (2025)
Valganciclovir and Risk for Neutropenia: When the Friend Becomes the Foe
par: Nadya Nalli, et autres
Publié: (2024)
par: Nadya Nalli, et autres
Publié: (2024)
Fat‐Free Mass: Friend or Foe to Metabolic Health?
par: Christopher J. Oliver, et autres
Publié: (2025)
par: Christopher J. Oliver, et autres
Publié: (2025)
The Role of ROS and Its Sources in Tumorigenesis: Friend or Foe?
par: Qin Jiang, et autres
Publié: (2025)
par: Qin Jiang, et autres
Publié: (2025)
Classroom Management and Novice Language Teachers: Friend or Foe?
par: Ana Clara Sánchez Solarte
Publié: (2019)
par: Ana Clara Sánchez Solarte
Publié: (2019)
Making Mathematical Reasoning Adaptive
par: Lai, Zhejian, et autres
Publié: (2025)
par: Lai, Zhejian, et autres
Publié: (2025)
Machine Learning and Artificial Intelligence in PK‐PD Modeling: Fad, Friend, or Foe?
par: Zhonghui Huang, et autres
Publié: (2024)
par: Zhonghui Huang, et autres
Publié: (2024)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
par: Yan, Siyu, et autres
Publié: (2025)
par: Yan, Siyu, et autres
Publié: (2025)
Friend or Foe: Unraveling the Ties Between Deepfakes, Pornography, and Women
par: Fihsani, Marsya Diandra, et autres
Publié: (2025)
par: Fihsani, Marsya Diandra, et autres
Publié: (2025)
Platelets During Myelin Repair in Multiple Sclerosis: Friend or Foe?
par: Francisco J. Rivera, et autres
Publié: (2025)
par: Francisco J. Rivera, et autres
Publié: (2025)
Mutual Coupling in Dynamic Metasurface Antennas: Foe, but also Friend
par: Prod'homme, Hugo, et autres
Publié: (2024)
par: Prod'homme, Hugo, et autres
Publié: (2024)
Navigating the Paradox of IL‐22: Friend or Foe in Hepatic Health?
par: Jianqi Qin, et autres
Publié: (2025)
par: Jianqi Qin, et autres
Publié: (2025)
JAK Inhibitors and Cardiovascular Disease in Psoriatic Arthritis: Friends or Foe?
par: Jenny Lin‐Hong Shi, et autres
Publié: (2024)
par: Jenny Lin‐Hong Shi, et autres
Publié: (2024)
Natural Killer Cells in Alzheimer's Disease: From Foe to Friend
par: Milos Kostic, et autres
Publié: (2025)
par: Milos Kostic, et autres
Publié: (2025)
Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation
par: Geng, Xiang, et autres
Publié: (2025)
par: Geng, Xiang, et autres
Publié: (2025)
Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
par: Qraitem, Maan, et autres
Publié: (2024)
par: Qraitem, Maan, et autres
Publié: (2024)
Turning Foe into Friend: Bridging Neutrophil Biological Characteristics and Neutrophil‐Based Oncolytic Nanotherapeutics
par: Sitong Chen, et autres
Publié: (2026)
par: Sitong Chen, et autres
Publié: (2026)
Documents similaires
-
Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
par: Ding, Peng, et autres
Publié: (2025) -
A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily
par: Ding, Peng, et autres
Publié: (2023) -
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
par: Ding, Peng, et autres
Publié: (2024) -
Friend or Foe
par: Cherendichenko, Oleksandr, et autres
Publié: (2025) -
Alcohol: Friend or Foe?
par: Ricardo A. González
Publié: (2011)