Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chi, Jianfeng, Karn, Ujjwal, Zhan, Hongyuan, Smith, Eric, Rando, Javier, Zhang, Yiming, Plawiak, Kate, Coudert, Zacharie Delpierre, Upasani, Kartikeya, Pasupuleti, Mahesh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations
par: Fedorov, Igor, et autres
Publié: (2024)
par: Fedorov, Igor, et autres
Publié: (2024)
Backtracking Improves Generation Safety
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Self-Guard: Empower the LLM to Safeguard Itself
par: Wang, Zezhong, et autres
Publié: (2023)
par: Wang, Zezhong, et autres
Publié: (2023)
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
ProGuard: Towards Proactive Multimodal Safeguard
par: Yu, Shaohan, et autres
Publié: (2025)
par: Yu, Shaohan, et autres
Publié: (2025)
LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models
par: Helff, Lukas, et autres
Publié: (2024)
par: Helff, Lukas, et autres
Publié: (2024)
Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles
par: Bugaud, Zacharie
Publié: (2026)
par: Bugaud, Zacharie
Publié: (2026)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
par: Tasawong, Panuthep, et autres
Publié: (2026)
par: Tasawong, Panuthep, et autres
Publié: (2026)
GLiGuard: Schema-Conditioned Classification for LLM Safeguard
par: Zaratiana, Urchade, et autres
Publié: (2026)
par: Zaratiana, Urchade, et autres
Publié: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
From Representational Harms to Quality-of-Service Harms: A Case Study on Llama 2 Safety Safeguards
par: Chehbouni, Khaoula, et autres
Publié: (2024)
par: Chehbouni, Khaoula, et autres
Publié: (2024)
GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety
par: Fan, Changxuan, et autres
Publié: (2026)
par: Fan, Changxuan, et autres
Publié: (2026)
GuardDoor: Safeguarding Against Malicious Diffusion Editing via Protective Backdoors
par: Zeng, Yaopei, et autres
Publié: (2025)
par: Zeng, Yaopei, et autres
Publié: (2025)
The Llama 3 Herd of Models
par: Grattafiori, Aaron, et autres
Publié: (2024)
par: Grattafiori, Aaron, et autres
Publié: (2024)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
par: Jiang, Yilei, et autres
Publié: (2024)
par: Jiang, Yilei, et autres
Publié: (2024)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
par: Wang, Yuquan, et autres
Publié: (2025)
par: Wang, Yuquan, et autres
Publié: (2025)
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
par: Lu, Xiaoya, et autres
Publié: (2026)
par: Lu, Xiaoya, et autres
Publié: (2026)
TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems
par: Wang, Kai, et autres
Publié: (2026)
par: Wang, Kai, et autres
Publié: (2026)
CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment
par: Li, Qinfeng, et autres
Publié: (2024)
par: Li, Qinfeng, et autres
Publié: (2024)
ChocoLlama: Lessons Learned From Teaching Llamas Dutch
par: Meeus, Matthieu, et autres
Publié: (2024)
par: Meeus, Matthieu, et autres
Publié: (2024)
Llama-Mob: Instruction-Tuning Llama-3-8B Excels in City-Scale Mobility Prediction
par: Tang, Peizhi, et autres
Publié: (2024)
par: Tang, Peizhi, et autres
Publié: (2024)
NegVQA: Can Vision Language Models Understand Negation?
par: Zhang, Yuhui, et autres
Publié: (2025)
par: Zhang, Yuhui, et autres
Publié: (2025)
FaceSwapGuard: Safeguarding Facial Privacy from DeepFake Threats through Identity Obfuscation
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs
par: Niu, Jingcheng, et autres
Publié: (2025)
par: Niu, Jingcheng, et autres
Publié: (2025)
Large Reasoning Models Learn Better Alignment from Flawed Thinking
par: Peng, ShengYun, et autres
Publié: (2025)
par: Peng, ShengYun, et autres
Publié: (2025)
SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems
par: Shan, Wenliang, et autres
Publié: (2025)
par: Shan, Wenliang, et autres
Publié: (2025)
MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
Guarding Terrains with Guards on a Line
par: Kang, Byeonguk, et autres
Publié: (2025)
par: Kang, Byeonguk, et autres
Publié: (2025)
MGH Radiology Llama: A Llama 3 70B Model for Radiology
par: Shi, Yucheng, et autres
Publié: (2024)
par: Shi, Yucheng, et autres
Publié: (2024)
VisionGuard: Synergistic Framework for Helmet Violation Detection
par: Nguyen, Lam-Huy, et autres
Publié: (2025)
par: Nguyen, Lam-Huy, et autres
Publié: (2025)
Internal Activation Revision: Safeguarding Vision Language Models Without Parameter Update
par: Li, Qing, et autres
Publié: (2025)
par: Li, Qing, et autres
Publié: (2025)
BadLlama: cheaply removing safety fine-tuning from Llama 2-Chat 13B
par: Gade, Pranav, et autres
Publié: (2023)
par: Gade, Pranav, et autres
Publié: (2023)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
BayTTA: Uncertainty-aware medical image classification with optimized test-time augmentation using Bayesian model averaging
par: Sherkatghanad, Zeinab, et autres
Publié: (2024)
par: Sherkatghanad, Zeinab, et autres
Publié: (2024)
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
par: Wendler, Chris, et autres
Publié: (2024)
par: Wendler, Chris, et autres
Publié: (2024)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)
par: Ngong, Ivoline, et autres
Publié: (2025)
Towards Better Health Conversations: The Benefits of Context-seeking
par: Sayres, Rory, et autres
Publié: (2025)
par: Sayres, Rory, et autres
Publié: (2025)
HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models
par: Lee, Junhee, et autres
Publié: (2026)
par: Lee, Junhee, et autres
Publié: (2026)
Creating Open Source Conversation
par: Sheehan, Kate
Publié: (2009)
par: Sheehan, Kate
Publié: (2009)
Computer Security-Risks, Threats, and Safeguards.
par: Ekhaml, Leticia
Publié: (2001)
par: Ekhaml, Leticia
Publié: (2001)
Documents similaires
-
Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations
par: Fedorov, Igor, et autres
Publié: (2024) -
Backtracking Improves Generation Safety
par: Zhang, Yiming, et autres
Publié: (2024) -
Self-Guard: Empower the LLM to Safeguard Itself
par: Wang, Zezhong, et autres
Publié: (2023) -
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
par: Zhang, Jingyu, et autres
Publié: (2025) -
ProGuard: Towards Proactive Multimodal Safeguard
par: Yu, Shaohan, et autres
Publié: (2025)