Guardado en:
| Autores principales: | Kuznetsov, Daniel, Cohen, Ofir, Shistik, Karin, Puzis, Rami, Shabtai, Asaf |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.04992 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LISAA: A Framework for Large Language Model Information Security Awareness Assessment
por: Cohen, Ofir, et al.
Publicado: (2024)
por: Cohen, Ofir, et al.
Publicado: (2024)
ConGISATA: A Framework for Continuous Gamified Information Security Awareness Training and Assessment
por: Cohen, Ofir, et al.
Publicado: (2026)
por: Cohen, Ofir, et al.
Publicado: (2026)
FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations
por: Shuster, Shaun, et al.
Publicado: (2025)
por: Shuster, Shaun, et al.
Publicado: (2025)
ATAG: AI-Agent Application Threat Assessment with Attack Graphs
por: Gandhi, Parth Atulbhai, et al.
Publicado: (2025)
por: Gandhi, Parth Atulbhai, et al.
Publicado: (2025)
VAULT: Vigilant Adversarial Updates via LLM-Driven Retrieval-Augmented Generation for NLI
por: Kazoom, Roie, et al.
Publicado: (2025)
por: Kazoom, Roie, et al.
Publicado: (2025)
MIA-EPT: Membership Inference Attack via Error Prediction for Tabular Data
por: German, Eyal, et al.
Publicado: (2025)
por: German, Eyal, et al.
Publicado: (2025)
Mind the Web: The Security of Web Use Agents
por: Shapira, Avishag, et al.
Publicado: (2025)
por: Shapira, Avishag, et al.
Publicado: (2025)
DOMBA: Double Model Balancing for Access-Controlled Language Models via Minimum-Bounded Aggregation
por: Segal, Tom, et al.
Publicado: (2024)
por: Segal, Tom, et al.
Publicado: (2024)
From Tool Orchestration to Code Execution: A Study of MCP Design Choices
por: Felendler, Yuval, et al.
Publicado: (2026)
por: Felendler, Yuval, et al.
Publicado: (2026)
SCyTAG: Scalable Cyber-Twin for Threat-Assessment Based on Attack Graphs
por: Tayouri, David, et al.
Publicado: (2025)
por: Tayouri, David, et al.
Publicado: (2025)
GPT in Sheep's Clothing: The Risk of Customized GPTs
por: Antebi, Sagiv, et al.
Publicado: (2024)
por: Antebi, Sagiv, et al.
Publicado: (2024)
SecMate: Multi-Agent Adaptive Cybersecurity Troubleshooting with Tri-Context Personalization
por: Meidan, Yair, et al.
Publicado: (2026)
por: Meidan, Yair, et al.
Publicado: (2026)
AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior
por: Abaev, Nadya, et al.
Publicado: (2026)
por: Abaev, Nadya, et al.
Publicado: (2026)
Measuring Safety Alignment Effects in Autonomous Security Agents
por: David, Isaac, et al.
Publicado: (2026)
por: David, Isaac, et al.
Publicado: (2026)
LumiMAS: A Comprehensive Framework for Real-Time Monitoring and Enhanced Observability in Multi-Agent Systems
por: Solomon, Ron, et al.
Publicado: (2025)
por: Solomon, Ron, et al.
Publicado: (2025)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
por: Ferrand, Jean-Charles Noirot, et al.
Publicado: (2025)
por: Ferrand, Jean-Charles Noirot, et al.
Publicado: (2025)
Reimagining Safety Alignment with An Image
por: Xia, Yifan, et al.
Publicado: (2025)
por: Xia, Yifan, et al.
Publicado: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
por: Zaree, Pedram, et al.
Publicado: (2025)
por: Zaree, Pedram, et al.
Publicado: (2025)
Agent Safety Alignment via Reinforcement Learning
por: Sha, Zeyang, et al.
Publicado: (2025)
por: Sha, Zeyang, et al.
Publicado: (2025)
In-Browser LLM-Guided Fuzzing for Real-Time Prompt Injection Testing in Agentic AI Browsers
por: Cohen, Avihay
Publicado: (2025)
por: Cohen, Avihay
Publicado: (2025)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
por: Li, Xurui, et al.
Publicado: (2025)
por: Li, Xurui, et al.
Publicado: (2025)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
por: Li, MingSheng, et al.
Publicado: (2025)
por: Li, MingSheng, et al.
Publicado: (2025)
LED there be DoS: Exploiting variable bitrate IP cameras for network DoS
por: Goldberg, Emmanuel, et al.
Publicado: (2025)
por: Goldberg, Emmanuel, et al.
Publicado: (2025)
LLM-Safety Evaluations Lack Robustness
por: Beyer, Tim, et al.
Publicado: (2025)
por: Beyer, Tim, et al.
Publicado: (2025)
Deep Learning Based XIoT Malware Analysis: A Comprehensive Survey, Taxonomy, and Research Challenges
por: Darwish, Rami, et al.
Publicado: (2024)
por: Darwish, Rami, et al.
Publicado: (2024)
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
por: David, Isaac, et al.
Publicado: (2026)
por: David, Isaac, et al.
Publicado: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
por: Campbell, David, et al.
Publicado: (2026)
por: Campbell, David, et al.
Publicado: (2026)
Matching Ranks Over Probability Yields Truly Deep Safety Alignment
por: Vega, Jason, et al.
Publicado: (2025)
por: Vega, Jason, et al.
Publicado: (2025)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
por: Li, Nanxi, et al.
Publicado: (2025)
por: Li, Nanxi, et al.
Publicado: (2025)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
por: Nawal, Aditya, et al.
Publicado: (2026)
por: Nawal, Aditya, et al.
Publicado: (2026)
aiXamine: Simplified LLM Safety and Security
por: Deniz, Fatih, et al.
Publicado: (2025)
por: Deniz, Fatih, et al.
Publicado: (2025)
What Matters For Safety Alignment?
por: Li, Xing, et al.
Publicado: (2026)
por: Li, Xing, et al.
Publicado: (2026)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
por: Fang, Xianya, et al.
Publicado: (2026)
por: Fang, Xianya, et al.
Publicado: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
por: Yin, Qingyu, et al.
Publicado: (2025)
por: Yin, Qingyu, et al.
Publicado: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
por: Wang, Yanbo, et al.
Publicado: (2026)
por: Wang, Yanbo, et al.
Publicado: (2026)
SAGE: A Generic Framework for LLM Safety Evaluation
por: Jindal, Madhur, et al.
Publicado: (2025)
por: Jindal, Madhur, et al.
Publicado: (2025)
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
por: Qi, Xiangyu, et al.
Publicado: (2024)
por: Qi, Xiangyu, et al.
Publicado: (2024)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
por: Guo, Weiyang, et al.
Publicado: (2025)
por: Guo, Weiyang, et al.
Publicado: (2025)
FedP3E: Privacy-Preserving Prototype Exchange for Non-IID IoT Malware Detection in Cross-Silo Federated Learning
por: Darwish, Rami, et al.
Publicado: (2025)
por: Darwish, Rami, et al.
Publicado: (2025)
Ejemplares similares
-
LISAA: A Framework for Large Language Model Information Security Awareness Assessment
por: Cohen, Ofir, et al.
Publicado: (2024) -
ConGISATA: A Framework for Continuous Gamified Information Security Awareness Training and Assessment
por: Cohen, Ofir, et al.
Publicado: (2026) -
FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations
por: Shuster, Shaun, et al.
Publicado: (2025) -
ATAG: AI-Agent Application Threat Assessment with Attack Graphs
por: Gandhi, Parth Atulbhai, et al.
Publicado: (2025) -
VAULT: Vigilant Adversarial Updates via LLM-Driven Retrieval-Augmented Generation for NLI
por: Kazoom, Roie, et al.
Publicado: (2025)