AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhexin, Lei, Leqi, Yang, Junxiao, Huang, Xijie, Lu, Yida, Cui, Shiyao, Chen, Renmiao, Zhang, Qinglin, Wang, Xinyuan, Wang, Hao, Li, Hao, Lei, Xianqi, Pan, Chengwei, Sha, Lei, Wang, Hongning, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
di: Chen, Renmiao, et al.
Pubblicazione: (2026)
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Harnessing the Plug-and-Play Controller by Prompting
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Seeker: Towards Exception Safety Code Generation with Intermediate Language Agents Framework
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
Language Model Decoding as Direct Metrics Optimization
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
di: Tu, Jinzhe, et al.
Pubblicazione: (2026)
di: Tu, Jinzhe, et al.
Pubblicazione: (2026)
Editorial: Launching Safety Science and Technology
di: Hao Wang, et al.
Pubblicazione: (2026)
di: Hao Wang, et al.
Pubblicazione: (2026)
Trust-Region Adaptive Policy Optimization
di: Su, Mingyu, et al.
Pubblicazione: (2025)
di: Su, Mingyu, et al.
Pubblicazione: (2025)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
Data Selection via Optimal Control for Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
Grounding LLMs in Scientific Discovery via Embodied Actions
di: Zhang, Bo, et al.
Pubblicazione: (2026)
di: Zhang, Bo, et al.
Pubblicazione: (2026)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
The Superalignment of Superhuman Intelligence with Large Language Models
di: Huang, Minlie, et al.
Pubblicazione: (2024)
di: Huang, Minlie, et al.
Pubblicazione: (2024)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
Discovery of a new species of Zophoessa Doubleday, 1849 from NW Yunnan, China (Lepidoptera: Nymphalidae)
di: Huang, Hao, et al.
Pubblicazione: (2025)
di: Huang, Hao, et al.
Pubblicazione: (2025)
Learning Task Decomposition to Assist Humans in Competitive Programming
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback
di: Guan, Jian, et al.
Pubblicazione: (2024)
di: Guan, Jian, et al.
Pubblicazione: (2024)
Bayesian Estimation of Partial Functional Tobit Censored Quantile Regression Model
di: Chunjie Wang, et al.
Pubblicazione: (2025)
di: Chunjie Wang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024) -
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025) -
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025) -
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2024) -
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)