Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Qiyuan, Bai, Xuefeng, Chen, Kehai, Wang, Yaowei, Nie, Liqiang, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey on Human Preference Learning for Large Language Models
par: Jiang, Ruili, et autres
Publié: (2024)
par: Jiang, Ruili, et autres
Publié: (2024)
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
Agentic Tool Use in Large Language Models
par: Hu, Jinchao, et autres
Publié: (2026)
par: Hu, Jinchao, et autres
Publié: (2026)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Exploring the Translation Mechanism of Large Language Models
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
Paying More Attention to Source Context: Mitigating Unfaithful Translations from Large Language Model
par: Zhang, Hongbin, et autres
Publié: (2024)
par: Zhang, Hongbin, et autres
Publié: (2024)
ORPP: Self-Optimizing Role-playing Prompts to Enhance Language Model Capabilities
par: Duan, Yifan, et autres
Publié: (2025)
par: Duan, Yifan, et autres
Publié: (2025)
Generator-Assistant Stepwise Rollback Framework for Large Language Model Agent
par: Li, Xingzuo, et autres
Publié: (2025)
par: Li, Xingzuo, et autres
Publié: (2025)
The Power of Personality: A Human Simulation Perspective to Investigate Large Language Model Agents
par: Duan, Yifan, et autres
Publié: (2025)
par: Duan, Yifan, et autres
Publié: (2025)
TF-Attack: Transferable and Fast Adversarial Attacks on Large Language Models
par: Li, Zelin, et autres
Publié: (2024)
par: Li, Zelin, et autres
Publié: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
par: Xu, Mufan, et autres
Publié: (2026)
par: Xu, Mufan, et autres
Publié: (2026)
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
par: Li, Zhenyu, et autres
Publié: (2025)
par: Li, Zhenyu, et autres
Publié: (2025)
HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track
par: Wei, Xuchen, et autres
Publié: (2025)
par: Wei, Xuchen, et autres
Publié: (2025)
Question-guided Knowledge Graph Re-scoring and Injection for Knowledge Graph Question Answering
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning
par: Zhang, Hongbin, et autres
Publié: (2024)
par: Zhang, Hongbin, et autres
Publié: (2024)
DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback Mechanisms
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
par: Yue, Liang, et autres
Publié: (2025)
par: Yue, Liang, et autres
Publié: (2025)
The Rise of Darkness: Safety-Utility Trade-Offs in Role-Playing Dialogue Agents
par: Tang, Yihong, et autres
Publié: (2025)
par: Tang, Yihong, et autres
Publié: (2025)
Learning to Route Queries to Heads for Attention-based Re-ranking with Large Language Models
par: Tian, Yuxing, et autres
Publié: (2026)
par: Tian, Yuxing, et autres
Publié: (2026)
LLM-based Discriminative Reasoning for Knowledge Graph Question Answering
par: Xu, Mufan, et autres
Publié: (2024)
par: Xu, Mufan, et autres
Publié: (2024)
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
par: Qu, Bingzheng, et autres
Publié: (2026)
par: Qu, Bingzheng, et autres
Publié: (2026)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
par: Zhu, Yingjie, et autres
Publié: (2025)
par: Zhu, Yingjie, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
par: Liu, Qiyuan, et autres
Publié: (2025)
par: Liu, Qiyuan, et autres
Publié: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Mitigating Multimodal Hallucination via Phase-wise Self-reward
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
par: Qi, Yupeng, et autres
Publié: (2025)
par: Qi, Yupeng, et autres
Publié: (2025)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
par: Zhao, Weixiang, et autres
Publié: (2024)
par: Zhao, Weixiang, et autres
Publié: (2024)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
par: Zhang, Jianfei, et autres
Publié: (2024)
par: Zhang, Jianfei, et autres
Publié: (2024)
Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR
par: Tang, Yihong, et autres
Publié: (2026)
par: Tang, Yihong, et autres
Publié: (2026)
ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting
par: Tian, Yuxing, et autres
Publié: (2026)
par: Tian, Yuxing, et autres
Publié: (2026)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
par: Tao, Leitian, et autres
Publié: (2025)
par: Tao, Leitian, et autres
Publié: (2025)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
par: Ji, Yixin, et autres
Publié: (2024)
par: Ji, Yixin, et autres
Publié: (2024)
MPO: Multilingual Safety Alignment via Reward Gap Optimization
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
NILE: Internal Consistency Alignment in Large Language Models
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Constituency Parsing using LLMs
par: Bai, Xuefeng, et autres
Publié: (2023)
par: Bai, Xuefeng, et autres
Publié: (2023)
Documents similaires
-
A Survey on Human Preference Learning for Large Language Models
par: Jiang, Ruili, et autres
Publié: (2024) -
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
par: Zhang, Hongbin, et autres
Publié: (2025) -
Agentic Tool Use in Large Language Models
par: Hu, Jinchao, et autres
Publié: (2026) -
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
par: Zhang, Yu, et autres
Publié: (2025) -
Exploring the Translation Mechanism of Large Language Models
par: Zhang, Hongbin, et autres
Publié: (2025)