Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiajia, Wen, Xiaoyu, Ma, Zhongtian, Hu, Shuyue, Zhang, Qiaosheng, Wang, Zhen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
par: Wen, Xiaoyu, et autres
Publié: (2026)
par: Wen, Xiaoyu, et autres
Publié: (2026)
TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
par: Tan, Zhewen, et autres
Publié: (2026)
par: Tan, Zhewen, et autres
Publié: (2026)
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
par: Hu, Zizhao, et autres
Publié: (2026)
par: Hu, Zizhao, et autres
Publié: (2026)
Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents
par: Liao, Mingyang, et autres
Publié: (2026)
par: Liao, Mingyang, et autres
Publié: (2026)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
par: Yang, Qishun, et autres
Publié: (2026)
par: Yang, Qishun, et autres
Publié: (2026)
From Persona to Personalization: A Survey on Role-Playing Language Agents
par: Chen, Jiangjie, et autres
Publié: (2024)
par: Chen, Jiangjie, et autres
Publié: (2024)
Adaptive Theory of Mind for LLM-based Multi-Agent Coordination
par: Mu, Chunjiang, et autres
Publié: (2026)
par: Mu, Chunjiang, et autres
Publié: (2026)
Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMs
par: Wang, Kai, et autres
Publié: (2026)
par: Wang, Kai, et autres
Publié: (2026)
Towards Context-Invariant Safety Alignment for Large Language Models
par: Wang, Yixu, et autres
Publié: (2026)
par: Wang, Yixu, et autres
Publié: (2026)
PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models
par: Shi, Wenlong, et autres
Publié: (2026)
par: Shi, Wenlong, et autres
Publié: (2026)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
par: Ji, Xiang, et autres
Publié: (2024)
par: Ji, Xiang, et autres
Publié: (2024)
Enhancing Persona Following at Decoding Time via Dynamic Importance Estimation for Role-Playing Agents
par: Liu, Yuxin, et autres
Publié: (2026)
par: Liu, Yuxin, et autres
Publié: (2026)
Graph Attention is Not Always Beneficial: A Theoretical Analysis of Graph Attention Mechanisms via Contextual Stochastic Block Models
par: Ma, Zhongtian, et autres
Publié: (2024)
par: Ma, Zhongtian, et autres
Publié: (2024)
Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning
par: Zhang, Chi, et autres
Publié: (2026)
par: Zhang, Chi, et autres
Publié: (2026)
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents
par: Lai, Huayi, et autres
Publié: (2026)
par: Lai, Huayi, et autres
Publié: (2026)
Character is Destiny: Can Role-Playing Language Agents Make Persona-Driven Decisions?
par: Xu, Rui, et autres
Publié: (2024)
par: Xu, Rui, et autres
Publié: (2024)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
par: Bao, Yicheng, et autres
Publié: (2026)
par: Bao, Yicheng, et autres
Publié: (2026)
Matrix Completion with Hypergraphs:Sharp Thresholds and Efficient Algorithms
par: Ma, Zhongtian, et autres
Publié: (2024)
par: Ma, Zhongtian, et autres
Publié: (2024)
DPRF: A Generalizable Dynamic Persona Refinement Framework for Optimizing Behavior Alignment Between Personalized LLM Role-Playing Agents and Humans
par: Yao, Bingsheng, et autres
Publié: (2025)
par: Yao, Bingsheng, et autres
Publié: (2025)
Persona-Aware Alignment Framework for Personalized Dialogue Generation
par: Li, Guanrong, et autres
Publié: (2025)
par: Li, Guanrong, et autres
Publié: (2025)
LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences
par: Wen, Ming, et autres
Publié: (2026)
par: Wen, Ming, et autres
Publié: (2026)
Large Language Models are Near-Optimal Decision-Makers with a Non-Human Learning Behavior
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)
par: Qin, Ruiyang, et autres
Publié: (2026)
CharacterGPT: A Persona Reconstruction Framework for Role-Playing Agents
par: Park, Jeiyoon, et autres
Publié: (2024)
par: Park, Jeiyoon, et autres
Publié: (2024)
ICL-Router: In-Context Learned Model Representations for LLM Routing
par: Wang, Chenxu, et autres
Publié: (2025)
par: Wang, Chenxu, et autres
Publié: (2025)
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
par: Chen, Jiaqi, et autres
Publié: (2025)
par: Chen, Jiaqi, et autres
Publié: (2025)
PerPilot: Personalizing VLM-based Mobile Agents via Memory and Exploration
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Learning Robust Reasoning through Guided Adversarial Self-Play
par: Li, Shuozhe, et autres
Publié: (2026)
par: Li, Shuozhe, et autres
Publié: (2026)
Role-Augmented Intent-Driven Generative Search Engine Optimization
par: Chen, Xiaolu, et autres
Publié: (2025)
par: Chen, Xiaolu, et autres
Publié: (2025)
ELITE: Experiential Learning and Intent-Aware Transfer for Self-improving Embodied Agents
par: Wei, Bingqing, et autres
Publié: (2026)
par: Wei, Bingqing, et autres
Publié: (2026)
Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment
par: Vega, Jason, et autres
Publié: (2024)
par: Vega, Jason, et autres
Publié: (2024)
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
par: Yin, Bo, et autres
Publié: (2026)
par: Yin, Bo, et autres
Publié: (2026)
CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation
par: Wang, Xintao, et autres
Publié: (2025)
par: Wang, Xintao, et autres
Publié: (2025)
Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
par: Zhang, Yangshijie, et autres
Publié: (2025)
par: Zhang, Yangshijie, et autres
Publié: (2025)
Balancing the AI Strength of Roles in Self-Play Training with Regret Matching+
par: Wang, Xiaoxi
Publié: (2024)
par: Wang, Xiaoxi
Publié: (2024)
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning
par: Wang, Changhong, et autres
Publié: (2024)
par: Wang, Changhong, et autres
Publié: (2024)
MINDECHO: Role-Playing Language Agents for Key Opinion Leaders
par: Xu, Rui, et autres
Publié: (2024)
par: Xu, Rui, et autres
Publié: (2024)
Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time Compute
par: Chen, Jianhao, et autres
Publié: (2025)
par: Chen, Jianhao, et autres
Publié: (2025)
Documents similaires
-
MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
par: Wen, Xiaoyu, et autres
Publié: (2026) -
TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
par: Tan, Zhewen, et autres
Publié: (2026) -
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
par: Hu, Zizhao, et autres
Publié: (2026) -
Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents
par: Liao, Mingyang, et autres
Publié: (2026) -
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
par: Yang, Qishun, et autres
Publié: (2026)