Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tan, Yingshui, Jiang, Yilei, Li, Yanshi, Liu, Jiaheng, Bu, Xingyuan, Su, Wenbo, Yue, Xiangyu, Zhu, Xiaoyong, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
von: Yang, Yiliu, et al.
Veröffentlicht: (2025)
von: Yang, Yiliu, et al.
Veröffentlicht: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
von: Li, Yanshi, et al.
Veröffentlicht: (2024)
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
von: Ma, Ruize, et al.
Veröffentlicht: (2025)
von: Ma, Ruize, et al.
Veröffentlicht: (2025)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
Safety Alignment for Vision Language Models
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
von: Zheng, Baihui, et al.
Veröffentlicht: (2025)
von: Zheng, Baihui, et al.
Veröffentlicht: (2025)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
von: Zheng, Baolin, et al.
Veröffentlicht: (2025)
von: Zheng, Baolin, et al.
Veröffentlicht: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
von: He, Yancheng, et al.
Veröffentlicht: (2024)
von: He, Yancheng, et al.
Veröffentlicht: (2024)
ProgCo: Program Helps Self-Correction of Large Language Models
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2025)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2025)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
von: He, Yancheng, et al.
Veröffentlicht: (2025)
von: He, Yancheng, et al.
Veröffentlicht: (2025)
Balancing the Blend: An Experimental Analysis of Trade-offs in Hybrid Search
von: Wang, Mengzhao, et al.
Veröffentlicht: (2025)
von: Wang, Mengzhao, et al.
Veröffentlicht: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)
von: Bai, Ge, et al.
Veröffentlicht: (2024)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
von: Tuan, Yi-Lin, et al.
Veröffentlicht: (2024)
von: Tuan, Yi-Lin, et al.
Veröffentlicht: (2024)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
von: Wu, Yanan, et al.
Veröffentlicht: (2024)
The Unintended Trade-off of AI Alignment:Balancing Hallucination Mitigation and Safety in LLMs
von: Mahmoud, Omar, et al.
Veröffentlicht: (2025)
von: Mahmoud, Omar, et al.
Veröffentlicht: (2025)
MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration
von: Chang, Da, et al.
Veröffentlicht: (2026)
von: Chang, Da, et al.
Veröffentlicht: (2026)
Enhancing Trade-offs in Privacy, Utility, and Computational Efficiency through MUltistage Sampling Technique (MUST)
von: Zhao, Xingyuan, et al.
Veröffentlicht: (2023)
von: Zhao, Xingyuan, et al.
Veröffentlicht: (2023)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
von: Chen, Haibin, et al.
Veröffentlicht: (2025)
von: Chen, Haibin, et al.
Veröffentlicht: (2025)
Towards a Theoretical Understanding to the Generalization of RLHF
von: Li, Zhaochun, et al.
Veröffentlicht: (2026)
von: Li, Zhaochun, et al.
Veröffentlicht: (2026)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
von: Ji, Jiaming, et al.
Veröffentlicht: (2024)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
Giant Merkel cell carcinoma of the scalp
von: Junyou Zheng, et al.
Veröffentlicht: (2026)
von: Junyou Zheng, et al.
Veröffentlicht: (2026)
IoT Software Engineering: Balancing Trade-offs
von: Al-Qalam Al-Moner Journal for Humanities and Applied Sciences
Veröffentlicht: (2026)
von: Al-Qalam Al-Moner Journal for Humanities and Applied Sciences
Veröffentlicht: (2026)
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
FairGen: Enhancing Fairness in Text-to-Image Diffusion Models via Self-Discovering Latent Directions
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
von: Chen, Pin-Yu, et al.
Veröffentlicht: (2025)
Towards Federated RLHF with Aggregated Client Preference for LLMs
von: Wu, Feijie, et al.
Veröffentlicht: (2024)
von: Wu, Feijie, et al.
Veröffentlicht: (2024)
Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization
von: Ma, Liyuan, et al.
Veröffentlicht: (2026)
von: Ma, Liyuan, et al.
Veröffentlicht: (2026)
Balancing Enhancement, Harmlessness, and General Capabilities: Enhancing Conversational LLMs with Direct RLHF
von: Zheng, Chen, et al.
Veröffentlicht: (2024)
von: Zheng, Chen, et al.
Veröffentlicht: (2024)
Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
von: Zheng, Chen, et al.
Veröffentlicht: (2025)
von: Zheng, Chen, et al.
Veröffentlicht: (2025)
Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs
von: Fonseca, Joao, et al.
Veröffentlicht: (2025)
von: Fonseca, Joao, et al.
Veröffentlicht: (2025)
Exploring Accuracy-Fairness Trade-off in Large Language Models
von: Zhang, Qingquan, et al.
Veröffentlicht: (2024)
von: Zhang, Qingquan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025) -
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
von: Jiang, Yilei, et al.
Veröffentlicht: (2024) -
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
von: Jiang, Yilei, et al.
Veröffentlicht: (2025) -
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
von: Yang, Yiliu, et al.
Veröffentlicht: (2025) -
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
von: Li, Yanshi, et al.
Veröffentlicht: (2024)