Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Duan, Ranjie, Liu, Jiexi, Jia, Xiaojun, Zhao, Shiji, Cheng, Ruoxi, Wang, Fengxiang, Wei, Cheng, Xie, Yong, Liu, Chang, Li, Defeng, Dong, Yinpeng, Zhang, Yichi, Chen, Yuefeng, Wang, Chongwen, Ma, Xingjun, Wei, Xingxing, Liu, Yang, Su, Hang, Zhu, Jun, Li, Xinfeng, Sun, Yitong, Zhang, Jie, Hu, Jinzhao, Xu, Sha, Yang, Wenchao, Yang, Yitong, Zhang, Xingyao, Tan, Yingshui, Tao, Jialing, Xue, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
MESA: Improving MoE Safety Alignment via Decentralized Expertise
di: Sun, Yitong, et al.
Pubblicazione: (2026)
di: Sun, Yitong, et al.
Pubblicazione: (2026)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
di: Wang, Fengxiang, et al.
Pubblicazione: (2024)
di: Wang, Fengxiang, et al.
Pubblicazione: (2024)
Improving Adversarial Robust Fairness via Anti-Bias Soft Label Distillation
di: Zhao, Shiji, et al.
Pubblicazione: (2023)
di: Zhao, Shiji, et al.
Pubblicazione: (2023)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
DoubleCCA: Improving Foundation Model Group Robustness with Random Sentence Embeddings
di: Liu, Hong, et al.
Pubblicazione: (2024)
di: Liu, Hong, et al.
Pubblicazione: (2024)
DiffuTester: Accelerating Unit Test Generation for Diffusion LLMs via Mining Structural Pattern
di: Yang, Lekang, et al.
Pubblicazione: (2025)
di: Yang, Lekang, et al.
Pubblicazione: (2025)
STAIR: Improving Safety Alignment with Introspective Reasoning
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Work-Efficient Parallel Counting via Sampling
di: Liu, Hongyang, et al.
Pubblicazione: (2024)
di: Liu, Hongyang, et al.
Pubblicazione: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models
di: Zhang, Yitong, et al.
Pubblicazione: (2026)
di: Zhang, Yitong, et al.
Pubblicazione: (2026)
Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink
di: Wang, Yining, et al.
Pubblicazione: (2025)
di: Wang, Yining, et al.
Pubblicazione: (2025)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models
di: Lin, Junyu, et al.
Pubblicazione: (2026)
di: Lin, Junyu, et al.
Pubblicazione: (2026)
Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation
di: Cheng, Ruoxi, et al.
Pubblicazione: (2026)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2026)
Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization
di: Zhang, Siyuan, et al.
Pubblicazione: (2025)
di: Zhang, Siyuan, et al.
Pubblicazione: (2025)
Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models
di: Zhang, Siyuan, et al.
Pubblicazione: (2026)
di: Zhang, Siyuan, et al.
Pubblicazione: (2026)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
DGoT: Dynamic Graph of Thoughts for Scientific Abstract Generation
di: Ning, Xinyu, et al.
Pubblicazione: (2024)
di: Ning, Xinyu, et al.
Pubblicazione: (2024)
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
di: Sun, Yitong, et al.
Pubblicazione: (2025)
di: Sun, Yitong, et al.
Pubblicazione: (2025)
Improving Sampling for Masked Diffusion Models via Information Gain
di: Yang, Kaisen, et al.
Pubblicazione: (2026)
di: Yang, Kaisen, et al.
Pubblicazione: (2026)
From Production Envelopes to Executable Schedules: Sound Constructive Refinement for High-Mix Manufacturing
di: Liu, Runhao, et al.
Pubblicazione: (2025)
di: Liu, Runhao, et al.
Pubblicazione: (2025)
Surveying Attitudinal Alignment Between Large Language Models Vs. Humans Towards 17 Sustainable Development Goals
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
Every Part Matters: Integrity Verification of Scientific Figures Based on Multimodal Large Language Models
di: Shi, Xiang, et al.
Pubblicazione: (2024)
di: Shi, Xiang, et al.
Pubblicazione: (2024)
Towards Class-wise Fair Adversarial Training via Anti-Bias Soft Label Distillation
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
SemiSAM: Enhancing Semi-Supervised Medical Image Segmentation via SAM-Assisted Consistency Regularization
di: Zhang, Yichi, et al.
Pubblicazione: (2023)
di: Zhang, Yichi, et al.
Pubblicazione: (2023)
Evaluating LLM-Contaminated Crowdsourcing Data Without Ground Truth
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Scaling Laws for Black box Adversarial Attacks
di: Liu, Chuan, et al.
Pubblicazione: (2024)
di: Liu, Chuan, et al.
Pubblicazione: (2024)
A Turn Toward Better Alignment: Few-Shot Generative Adaptation with Equivariant Feature Rotation
di: Xu, Chenghao, et al.
Pubblicazione: (2025)
di: Xu, Chenghao, et al.
Pubblicazione: (2025)
Let's Learn Step by Step: Enhancing In-Context Learning Ability with Curriculum Learning
di: Liu, Yinpeng, et al.
Pubblicazione: (2024)
di: Liu, Yinpeng, et al.
Pubblicazione: (2024)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
di: Chen, Huanran, et al.
Pubblicazione: (2023)
di: Chen, Huanran, et al.
Pubblicazione: (2023)
The Path to Reconciling Quality and Safety in Text-to-Image Generation: Dataset, Method, and Evaluation
di: Ruan, Shouwei, et al.
Pubblicazione: (2025)
di: Ruan, Shouwei, et al.
Pubblicazione: (2025)
Universal Segmentation at Arbitrary Granularity with Language Instruction
di: Liu, Yong, et al.
Pubblicazione: (2023)
di: Liu, Yong, et al.
Pubblicazione: (2023)
Multimodal Forecasting of Sparse Intraoperative Hypotension Events Powered by Language Model
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
di: Zhang, Jintao, et al.
Pubblicazione: (2025)
SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG
di: Si, Xiaonan, et al.
Pubblicazione: (2025)
di: Si, Xiaonan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions
di: Zhao, Shiji, et al.
Pubblicazione: (2025) -
MESA: Improving MoE Safety Alignment via Decentralized Expertise
di: Sun, Yitong, et al.
Pubblicazione: (2026) -
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
di: Huang, Yao, et al.
Pubblicazione: (2025) -
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025) -
MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
di: Zhao, Shiji, et al.
Pubblicazione: (2025)