Agent Safety Alignment via Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sha, Zeyang, Tian, Hanling, Xu, Zhuoer, Cui, Shiwen, Meng, Changhua, Wang, Weiqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
von: Sun, Yuhao, et al.
Veröffentlicht: (2025)
von: Sun, Yuhao, et al.
Veröffentlicht: (2025)
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats
von: Deng, Xinhao, et al.
Veröffentlicht: (2026)
von: Deng, Xinhao, et al.
Veröffentlicht: (2026)
Measuring Safety Alignment Effects in Autonomous Security Agents
von: David, Isaac, et al.
Veröffentlicht: (2026)
von: David, Isaac, et al.
Veröffentlicht: (2026)
SEM: Reinforcement Learning for Search-Efficient Large Language Models
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
von: Sha, Zeyang, et al.
Veröffentlicht: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
von: Fang, Xianya, et al.
Veröffentlicht: (2026)
von: Fang, Xianya, et al.
Veröffentlicht: (2026)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
Can VLMs Detect and Localize Fine-Grained AI-Edited Images?
von: Sun, Zhen, et al.
Veröffentlicht: (2025)
von: Sun, Zhen, et al.
Veröffentlicht: (2025)
Reimagining Safety Alignment with An Image
von: Xia, Yifan, et al.
Veröffentlicht: (2025)
von: Xia, Yifan, et al.
Veröffentlicht: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
von: Wang, Yanbo, et al.
Veröffentlicht: (2026)
von: Wang, Yanbo, et al.
Veröffentlicht: (2026)
TroubleLLM: Align to Red Team Expert
von: Xu, Zhuoer, et al.
Veröffentlicht: (2024)
von: Xu, Zhuoer, et al.
Veröffentlicht: (2024)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
von: Kim, Jaehan, et al.
Veröffentlicht: (2025)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
von: Ferrand, Jean-Charles Noirot, et al.
Veröffentlicht: (2025)
von: Ferrand, Jean-Charles Noirot, et al.
Veröffentlicht: (2025)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
von: Li, MingSheng, et al.
Veröffentlicht: (2025)
von: Li, MingSheng, et al.
Veröffentlicht: (2025)
FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
von: Kuznetsov, Daniel, et al.
Veröffentlicht: (2026)
von: Kuznetsov, Daniel, et al.
Veröffentlicht: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
von: Yin, Qingyu, et al.
Veröffentlicht: (2025)
von: Yin, Qingyu, et al.
Veröffentlicht: (2025)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
von: Guo, Weiyang, et al.
Veröffentlicht: (2025)
von: Guo, Weiyang, et al.
Veröffentlicht: (2025)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
von: Domico, Kyle, et al.
Veröffentlicht: (2025)
von: Domico, Kyle, et al.
Veröffentlicht: (2025)
FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
von: Yang, Zhi, et al.
Veröffentlicht: (2026)
von: Yang, Zhi, et al.
Veröffentlicht: (2026)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
von: Yang, Xianglin, et al.
Veröffentlicht: (2026)
von: Yang, Xianglin, et al.
Veröffentlicht: (2026)
Matching Ranks Over Probability Yields Truly Deep Safety Alignment
von: Vega, Jason, et al.
Veröffentlicht: (2025)
von: Vega, Jason, et al.
Veröffentlicht: (2025)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
von: Li, Nanxi, et al.
Veröffentlicht: (2025)
von: Li, Nanxi, et al.
Veröffentlicht: (2025)
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
von: David, Isaac, et al.
Veröffentlicht: (2026)
von: David, Isaac, et al.
Veröffentlicht: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
von: Campbell, David, et al.
Veröffentlicht: (2026)
von: Campbell, David, et al.
Veröffentlicht: (2026)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
von: Li, Xurui, et al.
Veröffentlicht: (2025)
von: Li, Xurui, et al.
Veröffentlicht: (2025)
AgentWall: A Runtime Safety Layer for Local AI Agents
von: Aravind, Ashwin
Veröffentlicht: (2026)
von: Aravind, Ashwin
Veröffentlicht: (2026)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
AgentTrust: Runtime Safety Evaluation and Interception for AI Agent Tool Use
von: Yang, Chenglin
Veröffentlicht: (2026)
von: Yang, Chenglin
Veröffentlicht: (2026)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
Safeguarding AI Agents: Developing and Analyzing Safety Architectures
von: Domkundwar, Ishaan, et al.
Veröffentlicht: (2024)
von: Domkundwar, Ishaan, et al.
Veröffentlicht: (2024)
Safety Alignment Should Be Made More Than Just a Few Tokens Deep
von: Qi, Xiangyu, et al.
Veröffentlicht: (2024)
von: Qi, Xiangyu, et al.
Veröffentlicht: (2024)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
von: Nawal, Aditya, et al.
Veröffentlicht: (2026)
von: Nawal, Aditya, et al.
Veröffentlicht: (2026)
CheatAgent: Attacking LLM-Empowered Recommender Systems via LLM Agent
von: Ning, Liang-bo, et al.
Veröffentlicht: (2025)
von: Ning, Liang-bo, et al.
Veröffentlicht: (2025)
What Matters For Safety Alignment?
von: Li, Xing, et al.
Veröffentlicht: (2026)
von: Li, Xing, et al.
Veröffentlicht: (2026)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services
von: Wang, Longxiang, et al.
Veröffentlicht: (2026)
von: Wang, Longxiang, et al.
Veröffentlicht: (2026)
Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution
von: Shi, Guoxin, et al.
Veröffentlicht: (2026)
von: Shi, Guoxin, et al.
Veröffentlicht: (2026)
AdaDoS: Adaptive DoS Attack via Deep Adversarial Reinforcement Learning in SDN
von: Shao, Wei, et al.
Veröffentlicht: (2025)
von: Shao, Wei, et al.
Veröffentlicht: (2025)
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jinchuan, et al.
Veröffentlicht: (2025)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
von: Liu, Songyang, et al.
Veröffentlicht: (2026)
von: Liu, Songyang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
von: Sun, Yuhao, et al.
Veröffentlicht: (2025) -
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats
von: Deng, Xinhao, et al.
Veröffentlicht: (2026) -
Measuring Safety Alignment Effects in Autonomous Security Agents
von: David, Isaac, et al.
Veröffentlicht: (2026) -
SEM: Reinforcement Learning for Search-Efficient Large Language Models
von: Sha, Zeyang, et al.
Veröffentlicht: (2025) -
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
von: Fang, Xianya, et al.
Veröffentlicht: (2026)