Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xuying, Li, Zhuo, Kosuga, Yuji, Bian, Victor |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
par: Li, Xuying, et autres
Publié: (2025)
par: Li, Xuying, et autres
Publié: (2025)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
par: Li, Xuying, et autres
Publié: (2024)
par: Li, Xuying, et autres
Publié: (2024)
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
par: Shu, Huizhen, et autres
Publié: (2025)
par: Shu, Huizhen, et autres
Publié: (2025)
Targeting the Core: A Simple and Effective Method to Attack RAG-based Agents via Direct LLM Manipulation
par: Li, Xuying, et autres
Publié: (2024)
par: Li, Xuying, et autres
Publié: (2024)
LIONs: An Empirically Optimized Approach to Align Language Models
par: Yu, Xiao, et autres
Publié: (2024)
par: Yu, Xiao, et autres
Publié: (2024)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
par: Zhong, Haitian, et autres
Publié: (2026)
par: Zhong, Haitian, et autres
Publié: (2026)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
UniPoll: A Unified Social Media Poll Generation Framework via Multi-Objective Optimization
par: Li, Yixia, et autres
Publié: (2023)
par: Li, Yixia, et autres
Publié: (2023)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
par: Song, Junjie, et autres
Publié: (2025)
par: Song, Junjie, et autres
Publié: (2025)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
par: Cang, Yueyang, et autres
Publié: (2026)
par: Cang, Yueyang, et autres
Publié: (2026)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
par: Li, Peiji, et autres
Publié: (2026)
par: Li, Peiji, et autres
Publié: (2026)
Mitigating Social Bias in Large Language Models: A Multi-Objective Approach within a Multi-Agent Framework
par: Xu, Zhenjie, et autres
Publié: (2024)
par: Xu, Zhenjie, et autres
Publié: (2024)
MOPO: Multi-Objective Prompt Optimization for Affective Text Generation
par: Resendiz, Yarik Menchaca, et autres
Publié: (2024)
par: Resendiz, Yarik Menchaca, et autres
Publié: (2024)
GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models
par: Zhang, Jixiao, et autres
Publié: (2025)
par: Zhang, Jixiao, et autres
Publié: (2025)
OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization
par: Rahman, Mizanur, et autres
Publié: (2026)
par: Rahman, Mizanur, et autres
Publié: (2026)
$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
par: Wang, Yining, et autres
Publié: (2025)
par: Wang, Yining, et autres
Publié: (2025)
Aligning Language Models with Human Preferences via a Bayesian Approach
par: Wang, Jiashuo, et autres
Publié: (2023)
par: Wang, Jiashuo, et autres
Publié: (2023)
Topic Modeling as Multi-Objective Contrastive Optimization
par: Nguyen, Thong, et autres
Publié: (2024)
par: Nguyen, Thong, et autres
Publié: (2024)
InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating
par: Wang, Fuyu, et autres
Publié: (2025)
par: Wang, Fuyu, et autres
Publié: (2025)
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
par: Zhao, Songwen, et autres
Publié: (2025)
par: Zhao, Songwen, et autres
Publié: (2025)
GCRE-GPT: A Generative Model for Comparative Relation Extraction
par: Wang, Yequan, et autres
Publié: (2023)
par: Wang, Yequan, et autres
Publié: (2023)
CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI
par: Ali, Hasin Jawad, et autres
Publié: (2025)
par: Ali, Hasin Jawad, et autres
Publié: (2025)
Open-domain Implicit Format Control for Large Language Model Generation
par: Yao, Yiqun, et autres
Publié: (2024)
par: Yao, Yiqun, et autres
Publié: (2024)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
par: Ji, Wence, et autres
Publié: (2025)
par: Ji, Wence, et autres
Publié: (2025)
Learning to Align, Aligning to Learn: A Unified Approach for Self-Optimized Alignment
par: Wang, Haowen, et autres
Publié: (2025)
par: Wang, Haowen, et autres
Publié: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
par: Li, Chengao, et autres
Publié: (2025)
par: Li, Chengao, et autres
Publié: (2025)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
par: Chen, Xiwen, et autres
Publié: (2025)
par: Chen, Xiwen, et autres
Publié: (2025)
RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline
par: Duarte, André V., et autres
Publié: (2025)
par: Duarte, André V., et autres
Publié: (2025)
UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization
par: Yuan, Peiwen, et autres
Publié: (2025)
par: Yuan, Peiwen, et autres
Publié: (2025)
Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO
par: Tian, Yu, et autres
Publié: (2026)
par: Tian, Yu, et autres
Publié: (2026)
Multi-Objective Large Language Model Unlearning
par: Pan, Zibin, et autres
Publié: (2024)
par: Pan, Zibin, et autres
Publié: (2024)
Aligning the Spectrum: Hybrid Graph Pre-training and Prompt Tuning across Homophily and Heterophily
par: Luo, Haitong, et autres
Publié: (2025)
par: Luo, Haitong, et autres
Publié: (2025)
Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning
par: Wang, Kaiwen, et autres
Publié: (2024)
par: Wang, Kaiwen, et autres
Publié: (2024)
MOA: Multi-Objective Alignment for Role-Playing Agents
par: Liao, Chonghua, et autres
Publié: (2025)
par: Liao, Chonghua, et autres
Publié: (2025)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
par: Deng, Jingcheng, et autres
Publié: (2026)
par: Deng, Jingcheng, et autres
Publié: (2026)
Direct Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models
par: Higuchi, Rei, et autres
Publié: (2025)
par: Higuchi, Rei, et autres
Publié: (2025)
Aligning Translation-Specific Understanding to General Understanding in Large Language Models
par: Huang, Yichong, et autres
Publié: (2024)
par: Huang, Yichong, et autres
Publié: (2024)
Documents similaires
-
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
par: Li, Xuying, et autres
Publié: (2025) -
Precision Knowledge Editing: Enhancing Safety in Large Language Models
par: Li, Xuying, et autres
Publié: (2024) -
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
par: Shu, Huizhen, et autres
Publié: (2025) -
Targeting the Core: A Simple and Effective Method to Attack RAG-based Agents via Direct LLM Manipulation
par: Li, Xuying, et autres
Publié: (2024) -
LIONs: An Empirically Optimized Approach to Align Language Models
par: Yu, Xiao, et autres
Publié: (2024)