Safety Training Persists Through Helpfulness Optimization in LLM Agents
Fuente:
arXiv
Salvato in:
| Autore principale: | Plaut, Benjamin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
di: Hubinger, Evan, et al.
Pubblicazione: (2024)
di: Hubinger, Evan, et al.
Pubblicazione: (2024)
Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A
di: Plaut, Benjamin, et al.
Pubblicazione: (2024)
di: Plaut, Benjamin, et al.
Pubblicazione: (2024)
Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety
di: Bonagiri, Vamshi Krishna, et al.
Pubblicazione: (2025)
di: Bonagiri, Vamshi Krishna, et al.
Pubblicazione: (2025)
Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
di: Talokar, Nivya, et al.
Pubblicazione: (2026)
di: Talokar, Nivya, et al.
Pubblicazione: (2026)
Avoiding Catastrophe in Online Learning by Asking for Help
di: Plaut, Benjamin, et al.
Pubblicazione: (2024)
di: Plaut, Benjamin, et al.
Pubblicazione: (2024)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhang, Wenxuan, et al.
Pubblicazione: (2024)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
Enhancing LLM Safety via Constrained Direct Preference Optimization
di: Liu, Zixuan, et al.
Pubblicazione: (2024)
di: Liu, Zixuan, et al.
Pubblicazione: (2024)
Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
di: Liu, Qiang, et al.
Pubblicazione: (2025)
di: Liu, Qiang, et al.
Pubblicazione: (2025)
Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M
di: Pant, Piyush
Pubblicazione: (2025)
di: Pant, Piyush
Pubblicazione: (2025)
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
di: Wang, Kun, et al.
Pubblicazione: (2025)
di: Wang, Kun, et al.
Pubblicazione: (2025)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
di: Li, Jiaqian, et al.
Pubblicazione: (2026)
di: Li, Jiaqian, et al.
Pubblicazione: (2026)
Induced Model Matching: Restricted Models Help Train Full-Featured Models
di: Muneeb, Usama, et al.
Pubblicazione: (2024)
di: Muneeb, Usama, et al.
Pubblicazione: (2024)
Improving LLM Safety Alignment with Dual-Objective Optimization
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
Enhancing LLM Agent Safety via Causal Influence Prompting
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2025)
EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
di: Xu, Wujiang, et al.
Pubblicazione: (2025)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
di: Guo, Taicheng, et al.
Pubblicazione: (2026)
di: Guo, Taicheng, et al.
Pubblicazione: (2026)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
di: Lee, Juyong, et al.
Pubblicazione: (2024)
di: Lee, Juyong, et al.
Pubblicazione: (2024)
AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning
di: Wu, Shirley, et al.
Pubblicazione: (2024)
di: Wu, Shirley, et al.
Pubblicazione: (2024)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
di: Hadeliya, Tsimur, et al.
Pubblicazione: (2025)
Safe Learning Under Irreversible Dynamics via Asking for Help
di: Plaut, Benjamin, et al.
Pubblicazione: (2025)
di: Plaut, Benjamin, et al.
Pubblicazione: (2025)
Advancing LLM Safe Alignment with Safety Representation Ranking
di: Du, Tianqi, et al.
Pubblicazione: (2025)
di: Du, Tianqi, et al.
Pubblicazione: (2025)
MPO: Boosting LLM Agents with Meta Plan Optimization
di: Xiong, Weimin, et al.
Pubblicazione: (2025)
di: Xiong, Weimin, et al.
Pubblicazione: (2025)
Can Stories Help LLMs Reason? Curating Information Space Through Narrative
di: Javadi, Vahid Sadiri, et al.
Pubblicazione: (2024)
di: Javadi, Vahid Sadiri, et al.
Pubblicazione: (2024)
CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer
di: Bansal, Lavish, et al.
Pubblicazione: (2025)
di: Bansal, Lavish, et al.
Pubblicazione: (2025)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
di: Song, Yifan, et al.
Pubblicazione: (2024)
di: Song, Yifan, et al.
Pubblicazione: (2024)
Evaluating Memory Structure in LLM Agents
di: Shutova, Alina, et al.
Pubblicazione: (2026)
di: Shutova, Alina, et al.
Pubblicazione: (2026)
Consolidating Rewarded Perturbations for LLM Post-Training
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming
di: Kavumba, Pride, et al.
Pubblicazione: (2026)
di: Kavumba, Pride, et al.
Pubblicazione: (2026)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
di: Hui, Zheng, et al.
Pubblicazione: (2025)
di: Hui, Zheng, et al.
Pubblicazione: (2025)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
LLM Circuit Analyses Are Consistent Across Training and Scale
di: Tigges, Curt, et al.
Pubblicazione: (2024)
di: Tigges, Curt, et al.
Pubblicazione: (2024)
Prompt Curriculum Learning for Efficient LLM Post-Training
di: Gao, Zhaolin, et al.
Pubblicazione: (2025)
di: Gao, Zhaolin, et al.
Pubblicazione: (2025)
ZClip: Adaptive Spike Mitigation for LLM Pre-Training
di: Kumar, Abhay, et al.
Pubblicazione: (2025)
di: Kumar, Abhay, et al.
Pubblicazione: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Synthetic Sandbox for Training Machine Learning Engineering Agents
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
Getting By Goal Misgeneralization With a Little Help From a Mentor
di: Trinh, Tu, et al.
Pubblicazione: (2024)
di: Trinh, Tu, et al.
Pubblicazione: (2024)
MinionsLLM: a Task-adaptive Framework For The Training and Control of Multi-Agent Systems Through Natural Language
di: Rincon, Andres Garcia, et al.
Pubblicazione: (2025)
di: Rincon, Andres Garcia, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
di: Hubinger, Evan, et al.
Pubblicazione: (2024) -
Probabilities of Chat LLMs Are Miscalibrated but Still Predict Correctness on Multiple-Choice Q&A
di: Plaut, Benjamin, et al.
Pubblicazione: (2024) -
Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety
di: Bonagiri, Vamshi Krishna, et al.
Pubblicazione: (2025) -
Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
di: Talokar, Nivya, et al.
Pubblicazione: (2026) -
Avoiding Catastrophe in Online Learning by Asking for Help
di: Plaut, Benjamin, et al.
Pubblicazione: (2024)