Beware of Your Po! Measuring and Mitigating AI Safety Risks in Role-Play Fine-Tuning of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Weixiang, Hu, Yulin, Deng, Yang, Guo, Jiahe, Sui, Xingyu, Han, Xinyang, Zhang, An, Zhao, Yanyan, Qin, Bing, Chua, Tat-Seng, Liu, Ting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents
di: Hu, Yulin, et al.
Pubblicazione: (2026)
di: Hu, Yulin, et al.
Pubblicazione: (2026)
Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Lens: Rethinking Multilingual Enhancement for Large Language Models
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
di: Guo, Jiahe, et al.
Pubblicazione: (2026)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
Learning to Learn from Multimodal Experience
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
di: Sui, Xingyu, et al.
Pubblicazione: (2026)
Toward Secure Tuning: Mitigating Security Risks from Instruction Fine-Tuning
di: Du, Yanrui, et al.
Pubblicazione: (2024)
di: Du, Yanrui, et al.
Pubblicazione: (2024)
We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
di: Fang, Junfeng, et al.
Pubblicazione: (2025)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
di: Wang, Zhaoxin, et al.
Pubblicazione: (2026)
di: Wang, Zhaoxin, et al.
Pubblicazione: (2026)
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
di: Zhang, Xianhui, et al.
Pubblicazione: (2026)
di: Zhang, Xianhui, et al.
Pubblicazione: (2026)
On Safety Risks in Experience-Driven Self-Evolving Agents
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
di: Zhao, Weixiang, et al.
Pubblicazione: (2026)
Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
di: Du, Yanrui, et al.
Pubblicazione: (2025)
di: Du, Yanrui, et al.
Pubblicazione: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
On Reasoning Strength Planning in Large Reasoning Models
di: Sheng, Leheng, et al.
Pubblicazione: (2025)
di: Sheng, Leheng, et al.
Pubblicazione: (2025)
IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation
di: Lin, Zijie, et al.
Pubblicazione: (2025)
di: Lin, Zijie, et al.
Pubblicazione: (2025)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
di: Deng, Yang, et al.
Pubblicazione: (2023)
di: Deng, Yang, et al.
Pubblicazione: (2023)
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
di: Fu, Xing, et al.
Pubblicazione: (2026)
di: Fu, Xing, et al.
Pubblicazione: (2026)
Both Matter: Enhancing the Emotional Intelligence of Large Language Models without Compromising the General Intelligence
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
di: Zhao, Weixiang, et al.
Pubblicazione: (2024)
Self-Prompt Tuning: Enable Autonomous Role-Playing in LLMs
di: Kong, Aobo, et al.
Pubblicazione: (2024)
di: Kong, Aobo, et al.
Pubblicazione: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
di: Zhao, Yong, et al.
Pubblicazione: (2025)
di: Zhao, Yong, et al.
Pubblicazione: (2025)
RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
di: Zheng, Jingnan, et al.
Pubblicazione: (2025)
di: Zheng, Jingnan, et al.
Pubblicazione: (2025)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
di: Sheng, Leheng, et al.
Pubblicazione: (2025)
di: Sheng, Leheng, et al.
Pubblicazione: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Learning to Ask Critical Questions for Assisting Product Search
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
MobileFineTuner: A Unified End-to-End Framework for Fine-Tuning LLMs on Mobile Phones
di: Geng, Jiaxiang, et al.
Pubblicazione: (2025)
di: Geng, Jiaxiang, et al.
Pubblicazione: (2025)
Length Controlled Generation for Black-box LLMs
di: Gu, Yuxuan, et al.
Pubblicazione: (2024)
di: Gu, Yuxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025) -
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
di: Zhao, Weixiang, et al.
Pubblicazione: (2024) -
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
di: Zhao, Weixiang, et al.
Pubblicazione: (2025) -
When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
di: Zhao, Weixiang, et al.
Pubblicazione: (2025) -
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
di: Sui, Xingyu, et al.
Pubblicazione: (2026)