Weiter zum Inhalt
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Login
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Erweitert
  • Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
Buchumschlag

Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Duan, Ranjie, Liu, Jiexi, Jia, Xiaojun, Zhao, Shiji, Cheng, Ruoxi, Wang, Fengxiang, Wei, Cheng, Xie, Yong, Liu, Chang, Li, Defeng, Dong, Yinpeng, Zhang, Yichi, Chen, Yuefeng, Wang, Chongwen, Ma, Xingjun, Wei, Xingxing, Liu, Yang, Su, Hang, Zhu, Jun, Li, Xinfeng, Sun, Yitong, Zhang, Jie, Hu, Jinzhao, Xu, Sha, Yang, Wenchao, Yang, Yitong, Zhang, Xingyao, Tan, Yingshui, Tao, Jialing, Xue, Hui
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Artificial Intelligence
Computation and Language
Computers and Society
Human-Computer Interaction
Symbolic Computation
Online-Zugang:
Acceder al recurso
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
  • Zitieren
  • SMS versenden
  • Als E-Mail versenden
  • Drucken
  • Datensatz exportieren
    • Exportieren nach RefWorks
    • Exportieren nach EndNoteWeb
    • Exportieren nach EndNote
  • Zu den Favoriten
  • Persistenter Link
  • Exemplare
  • Beschreibung
  • Kommentare
  • Ähnliche Einträge
  • Internformat
Beschreibung
Keine Beschreibung verfügbar.

Ähnliche Einträge

  • Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions
    von: Zhao, Shiji, et al.
    Veröffentlicht: (2025)
  • MESA: Improving MoE Safety Alignment via Decentralized Expertise
    von: Sun, Yitong, et al.
    Veröffentlicht: (2026)
  • DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
    von: Huang, Yao, et al.
    Veröffentlicht: (2025)
  • Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
    von: Huang, Yao, et al.
    Veröffentlicht: (2025)
  • MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models
    von: Zhao, Shiji, et al.
    Veröffentlicht: (2025)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar