FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Kuznetsov, Daniel, Cohen, Ofir, Shistik, Karin, Puzis, Rami, Shabtai, Asaf |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LISAA: A Framework for Large Language Model Information Security Awareness Assessment
di: Cohen, Ofir, et al.
Pubblicazione: (2024)
di: Cohen, Ofir, et al.
Pubblicazione: (2024)
ConGISATA: A Framework for Continuous Gamified Information Security Awareness Training and Assessment
di: Cohen, Ofir, et al.
Pubblicazione: (2026)
di: Cohen, Ofir, et al.
Pubblicazione: (2026)
FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations
di: Shuster, Shaun, et al.
Pubblicazione: (2025)
di: Shuster, Shaun, et al.
Pubblicazione: (2025)
ATAG: AI-Agent Application Threat Assessment with Attack Graphs
di: Gandhi, Parth Atulbhai, et al.
Pubblicazione: (2025)
di: Gandhi, Parth Atulbhai, et al.
Pubblicazione: (2025)
MIA-EPT: Membership Inference Attack via Error Prediction for Tabular Data
di: German, Eyal, et al.
Pubblicazione: (2025)
di: German, Eyal, et al.
Pubblicazione: (2025)
VAULT: Vigilant Adversarial Updates via LLM-Driven Retrieval-Augmented Generation for NLI
di: Kazoom, Roie, et al.
Pubblicazione: (2025)
di: Kazoom, Roie, et al.
Pubblicazione: (2025)
Mind the Web: The Security of Web Use Agents
di: Shapira, Avishag, et al.
Pubblicazione: (2025)
di: Shapira, Avishag, et al.
Pubblicazione: (2025)
From Tool Orchestration to Code Execution: A Study of MCP Design Choices
di: Felendler, Yuval, et al.
Pubblicazione: (2026)
di: Felendler, Yuval, et al.
Pubblicazione: (2026)
GPT in Sheep's Clothing: The Risk of Customized GPTs
di: Antebi, Sagiv, et al.
Pubblicazione: (2024)
di: Antebi, Sagiv, et al.
Pubblicazione: (2024)
DOMBA: Double Model Balancing for Access-Controlled Language Models via Minimum-Bounded Aggregation
di: Segal, Tom, et al.
Pubblicazione: (2024)
di: Segal, Tom, et al.
Pubblicazione: (2024)
SCyTAG: Scalable Cyber-Twin for Threat-Assessment Based on Attack Graphs
di: Tayouri, David, et al.
Pubblicazione: (2025)
di: Tayouri, David, et al.
Pubblicazione: (2025)
SecMate: Multi-Agent Adaptive Cybersecurity Troubleshooting with Tri-Context Personalization
di: Meidan, Yair, et al.
Pubblicazione: (2026)
di: Meidan, Yair, et al.
Pubblicazione: (2026)
Measuring Safety Alignment Effects in Autonomous Security Agents
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior
di: Abaev, Nadya, et al.
Pubblicazione: (2026)
di: Abaev, Nadya, et al.
Pubblicazione: (2026)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
Reimagining Safety Alignment with An Image
di: Xia, Yifan, et al.
Pubblicazione: (2025)
di: Xia, Yifan, et al.
Pubblicazione: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Agent Safety Alignment via Reinforcement Learning
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
LumiMAS: A Comprehensive Framework for Real-Time Monitoring and Enhanced Observability in Multi-Agent Systems
di: Solomon, Ron, et al.
Pubblicazione: (2025)
di: Solomon, Ron, et al.
Pubblicazione: (2025)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
di: Li, Xurui, et al.
Pubblicazione: (2025)
di: Li, Xurui, et al.
Pubblicazione: (2025)
In-Browser LLM-Guided Fuzzing for Real-Time Prompt Injection Testing in Agentic AI Browsers
di: Cohen, Avihay
Pubblicazione: (2025)
di: Cohen, Avihay
Pubblicazione: (2025)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
di: Zaree, Pedram, et al.
Pubblicazione: (2025)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
di: Li, MingSheng, et al.
Pubblicazione: (2025)
di: Li, MingSheng, et al.
Pubblicazione: (2025)
LLM-Safety Evaluations Lack Robustness
di: Beyer, Tim, et al.
Pubblicazione: (2025)
di: Beyer, Tim, et al.
Pubblicazione: (2025)
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
di: Campbell, David, et al.
Pubblicazione: (2026)
di: Campbell, David, et al.
Pubblicazione: (2026)
Matching Ranks Over Probability Yields Truly Deep Safety Alignment
di: Vega, Jason, et al.
Pubblicazione: (2025)
di: Vega, Jason, et al.
Pubblicazione: (2025)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
di: Li, Nanxi, et al.
Pubblicazione: (2025)
di: Li, Nanxi, et al.
Pubblicazione: (2025)
aiXamine: Simplified LLM Safety and Security
di: Deniz, Fatih, et al.
Pubblicazione: (2025)
di: Deniz, Fatih, et al.
Pubblicazione: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
di: Fang, Xianya, et al.
Pubblicazione: (2026)
di: Fang, Xianya, et al.
Pubblicazione: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
di: Yin, Qingyu, et al.
Pubblicazione: (2025)
di: Yin, Qingyu, et al.
Pubblicazione: (2025)
SAGE: A Generic Framework for LLM Safety Evaluation
di: Jindal, Madhur, et al.
Pubblicazione: (2025)
di: Jindal, Madhur, et al.
Pubblicazione: (2025)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
Deep Learning Based XIoT Malware Analysis: A Comprehensive Survey, Taxonomy, and Research Challenges
di: Darwish, Rami, et al.
Pubblicazione: (2024)
di: Darwish, Rami, et al.
Pubblicazione: (2024)
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
di: Guo, Weiyang, et al.
Pubblicazione: (2025)
di: Guo, Weiyang, et al.
Pubblicazione: (2025)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
When Alignment Isn't Enough: Response-Path Attacks on LLM Agents
di: Luo, Mingyu, et al.
Pubblicazione: (2026)
di: Luo, Mingyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LISAA: A Framework for Large Language Model Information Security Awareness Assessment
di: Cohen, Ofir, et al.
Pubblicazione: (2024) -
ConGISATA: A Framework for Continuous Gamified Information Security Awareness Training and Assessment
di: Cohen, Ofir, et al.
Pubblicazione: (2026) -
FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations
di: Shuster, Shaun, et al.
Pubblicazione: (2025) -
ATAG: AI-Agent Application Threat Assessment with Attack Graphs
di: Gandhi, Parth Atulbhai, et al.
Pubblicazione: (2025) -
MIA-EPT: Membership Inference Attack via Error Prediction for Tabular Data
di: German, Eyal, et al.
Pubblicazione: (2025)