Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wanying, Ma, Zeyu, Zheng, Han, Tan, Xin, Chen, Mingang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios
di: Yu, Qiucheng, et al.
Pubblicazione: (2026)
di: Yu, Qiucheng, et al.
Pubblicazione: (2026)
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
di: Wang, Wanying, et al.
Pubblicazione: (2024)
di: Wang, Wanying, et al.
Pubblicazione: (2024)
Internalizing Safety Understanding in Large Reasoning Models via Verification
di: Zhang, Yi, et al.
Pubblicazione: (2026)
di: Zhang, Yi, et al.
Pubblicazione: (2026)
Safety Alignment for Vision Language Models
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
Internal Safety Collapse in Frontier Large Language Models
di: Wu, Yutao, et al.
Pubblicazione: (2026)
di: Wu, Yutao, et al.
Pubblicazione: (2026)
SIA: Enhancing Safety via Intent Awareness for Vision-Language Models
di: Na, Youngjin, et al.
Pubblicazione: (2025)
di: Na, Youngjin, et al.
Pubblicazione: (2025)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
di: Wang, Mengxuan, et al.
Pubblicazione: (2026)
di: Wang, Mengxuan, et al.
Pubblicazione: (2026)
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
di: Liu, Zhendong, et al.
Pubblicazione: (2024)
The Safety Reminder: A Soft Prompt to Reactivate Delayed Safety Awareness in Vision-Language Models
di: Tang, Peiyuan, et al.
Pubblicazione: (2025)
di: Tang, Peiyuan, et al.
Pubblicazione: (2025)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
di: Cai, Wei, et al.
Pubblicazione: (2025)
di: Cai, Wei, et al.
Pubblicazione: (2025)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
di: Qu, Yansong, et al.
Pubblicazione: (2025)
di: Qu, Yansong, et al.
Pubblicazione: (2025)
Learning Safety Constraints for Large Language Models
di: Chen, Xin, et al.
Pubblicazione: (2025)
di: Chen, Xin, et al.
Pubblicazione: (2025)
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
di: Han, Tessa, et al.
Pubblicazione: (2024)
di: Han, Tessa, et al.
Pubblicazione: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
Lifelong Safety Alignment for Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
di: Wang, Yixu, et al.
Pubblicazione: (2026)
di: Wang, Yixu, et al.
Pubblicazione: (2026)
Evo-MARL: Co-Evolutionary Multi-Agent Reinforcement Learning for Internalized Safety
di: Pan, Zhenyu, et al.
Pubblicazione: (2025)
di: Pan, Zhenyu, et al.
Pubblicazione: (2025)
INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation
di: Chen, Dianwei, et al.
Pubblicazione: (2025)
di: Chen, Dianwei, et al.
Pubblicazione: (2025)
Safety-Aware Fine-Tuning of Large Language Models
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
di: Yang, Junxiao, et al.
Pubblicazione: (2026)
LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion
di: Zhou, Guanghao, et al.
Pubblicazione: (2026)
di: Zhou, Guanghao, et al.
Pubblicazione: (2026)
Unraveling and Mitigating Safety Alignment Degradation of Vision-Language Models
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications
di: Rahman, Ben
Pubblicazione: (2025)
di: Rahman, Ben
Pubblicazione: (2025)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
di: Hinojosa, Carlos, et al.
Pubblicazione: (2026)
di: Hinojosa, Carlos, et al.
Pubblicazione: (2026)
Understanding the Effects of Safety Unalignment on Large Language Models
di: Halloran, John T.
Pubblicazione: (2026)
di: Halloran, John T.
Pubblicazione: (2026)
Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers
di: Xue, Zihao, et al.
Pubblicazione: (2026)
di: Xue, Zihao, et al.
Pubblicazione: (2026)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026)
di: Wu, Di, et al.
Pubblicazione: (2026)
Safety Aware Task Planning via Large Language Models in Robotics
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2025)
di: Khan, Azal Ahmad, et al.
Pubblicazione: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
di: Lu, Haoran, et al.
Pubblicazione: (2025)
di: Lu, Haoran, et al.
Pubblicazione: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
di: Diao, Muxi, et al.
Pubblicazione: (2024)
di: Diao, Muxi, et al.
Pubblicazione: (2024)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
di: Feng, Duanyu, et al.
Pubblicazione: (2024)
di: Feng, Duanyu, et al.
Pubblicazione: (2024)
Enhancing Safety of Large Language Models via Embedding Space Separation
di: Zhao, Xu, et al.
Pubblicazione: (2026)
di: Zhao, Xu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios
di: Yu, Qiucheng, et al.
Pubblicazione: (2026) -
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
di: Wang, Wanying, et al.
Pubblicazione: (2024) -
Internalizing Safety Understanding in Large Reasoning Models via Verification
di: Zhang, Yi, et al.
Pubblicazione: (2026) -
Safety Alignment for Vision Language Models
di: Liu, Zhendong, et al.
Pubblicazione: (2024) -
Internal Safety Collapse in Frontier Large Language Models
di: Wu, Yutao, et al.
Pubblicazione: (2026)