Cross-Modal Safety Alignment: Is textual unlearning all you need?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chakraborty, Trishna, Shayegani, Erfan, Cai, Zikui, Abu-Ghazaleh, Nael, Asif, M. Salman, Dong, Yue, Roy-Chowdhury, Amit K., Song, Chengyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
par: Bachu, Saketh, et autres
Publié: (2024)
par: Bachu, Saketh, et autres
Publié: (2024)
Modeling Hierarchical Thinking in Large Reasoning Models
par: Shahariar, G M, et autres
Publié: (2025)
par: Shahariar, G M, et autres
Publié: (2025)
Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
par: Shayegani, Erfan, et autres
Publié: (2025)
par: Shayegani, Erfan, et autres
Publié: (2025)
That Doesn't Go There: Attacks on Shared State in Multi-User Augmented Reality Applications
par: Slocum, Carter, et autres
Publié: (2023)
par: Slocum, Carter, et autres
Publié: (2023)
Evil Vizier: Vulnerabilities of LLM-Integrated XR Systems
par: Zhang, Yicheng, et autres
Publié: (2025)
par: Zhang, Yicheng, et autres
Publié: (2025)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
par: Shahgir, Haz Sameen, et autres
Publié: (2026)
Co(ve)rtex: ML Models as storage channels and their (mis-)applications
par: Mamun, Md Abdullah Al, et autres
Publié: (2023)
par: Mamun, Md Abdullah Al, et autres
Publié: (2023)
Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness
par: Shayegani, Erfan, et autres
Publié: (2025)
par: Shayegani, Erfan, et autres
Publié: (2025)
Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models
par: Tan, Yaoteng, et autres
Publié: (2026)
par: Tan, Yaoteng, et autres
Publié: (2026)
Targeted Unlearning with Single Layer Unlearning Gradient
par: Cai, Zikui, et autres
Publié: (2024)
par: Cai, Zikui, et autres
Publié: (2024)
Transform-Dependent Adversarial Attacks
par: Tan, Yaoteng, et autres
Publié: (2024)
par: Tan, Yaoteng, et autres
Publié: (2024)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
par: Zaree, Pedram, et autres
Publié: (2025)
par: Zaree, Pedram, et autres
Publié: (2025)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
par: Chakraborty, Trishna, et autres
Publié: (2026)
par: Chakraborty, Trishna, et autres
Publié: (2026)
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs
par: Mamun, Md Abdullah Al, et autres
Publié: (2025)
par: Mamun, Md Abdullah Al, et autres
Publié: (2025)
I Know What You Sync: Covert and Side Channel Attacks on File Systems via syncfs
par: Gu, Cheng, et autres
Publié: (2024)
par: Gu, Cheng, et autres
Publié: (2024)
GPUVM: GPU-driven Unified Virtual Memory
par: Nazaraliyev, Nurlan, et autres
Publié: (2024)
par: Nazaraliyev, Nurlan, et autres
Publié: (2024)
HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models
par: Chakraborty, Trishna, et autres
Publié: (2025)
par: Chakraborty, Trishna, et autres
Publié: (2025)
PRACtical: Subarray-Level Counter Update and Bank-Level Recovery Isolation for Efficient PRAC Rowhammer Mitigation
par: Nazaraliyev, Ravan, et autres
Publié: (2025)
par: Nazaraliyev, Ravan, et autres
Publié: (2025)
aim_is_all_you_need
par: Katz, Seth
Publié: (2025)
par: Katz, Seth
Publié: (2025)
Discernment is all you need
par: Fuenmayor, David
Publié: (2026)
par: Fuenmayor, David
Publié: (2026)
Propaganda is all you need
par: Kronlund-Drouault, Paul
Publié: (2024)
par: Kronlund-Drouault, Paul
Publié: (2024)
AttenMIA: LLM Membership Inference Attack through Attention Signals
par: Zaree, Pedram, et autres
Publié: (2026)
par: Zaree, Pedram, et autres
Publié: (2026)
Experts are all you need: A Composable Framework for Large Language Model Inference
par: Sridharan, Shrihari, et autres
Publié: (2025)
par: Sridharan, Shrihari, et autres
Publié: (2025)
Siren Song: Manipulating Pose Estimation in XR Headsets Using Acoustic Attacks
par: Huang, Zijian, et autres
Publié: (2025)
par: Huang, Zijian, et autres
Publié: (2025)
One protein is all you need
par: Bushuiev, Anton, et autres
Publié: (2024)
par: Bushuiev, Anton, et autres
Publié: (2024)
Token-based Vehicular Security System (TVSS): Scalable, Secure, Low-latency Public Key Infrastructure for Connected Vehicles
par: Rabiah, Abdulrahman Bin, et autres
Publié: (2024)
par: Rabiah, Abdulrahman Bin, et autres
Publié: (2024)
REL: Working out is all you need
par: Simonds, Toby, et autres
Publié: (2024)
par: Simonds, Toby, et autres
Publié: (2024)
Filtered Rayleigh-Ritz is all you need
par: Abbott, Ryan, et autres
Publié: (2025)
par: Abbott, Ryan, et autres
Publié: (2025)
Kolmogorov GAM Networks are all you need!
par: Polson, Sarah, et autres
Publié: (2025)
par: Polson, Sarah, et autres
Publié: (2025)
Anti-concentration is (almost) all you need
par: Heinrich, Markus, et autres
Publié: (2025)
par: Heinrich, Markus, et autres
Publié: (2025)
Downstream bias mitigation is all you need
par: Baksi, Arkadeep, et autres
Publié: (2024)
par: Baksi, Arkadeep, et autres
Publié: (2024)
Compression is all you need: Modeling Mathematics
par: Aksenov, Vitaly, et autres
Publié: (2026)
par: Aksenov, Vitaly, et autres
Publié: (2026)
Analysis of Stable Vertex Values: Fast Query Evaluation Over An Evolving Graph
par: Afarin, Mahbod, et autres
Publié: (2025)
par: Afarin, Mahbod, et autres
Publié: (2025)
KV-weights are all you need for skipless transformers
par: Graef, Nils
Publié: (2024)
par: Graef, Nils
Publié: (2024)
Tabular Data: Is Deep Learning all you need?
par: Zabërgja, Guri, et autres
Publié: (2024)
par: Zabërgja, Guri, et autres
Publié: (2024)
Attention is all you need to solve chiral superconductivity
par: Li, Chun-Tse, et autres
Publié: (2025)
par: Li, Chun-Tse, et autres
Publié: (2025)
Reddit is all you need: Authorship profiling for Romanian
par: Ştefănescu, Ecaterina, et autres
Publié: (2024)
par: Ştefănescu, Ecaterina, et autres
Publié: (2024)
Five parameters are all you need (in $Λ$CDM)
par: Montero-Camacho, Paulo, et autres
Publié: (2024)
par: Montero-Camacho, Paulo, et autres
Publié: (2024)
Regression is all you need for medical image translation
par: Rassmann, Sebastian, et autres
Publié: (2025)
par: Rassmann, Sebastian, et autres
Publié: (2025)
Image compositing is all you need for data augmentation
par: Shermaine, Ang Jia Ning, et autres
Publié: (2025)
par: Shermaine, Ang Jia Ning, et autres
Publié: (2025)
Documents similaires
-
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
par: Bachu, Saketh, et autres
Publié: (2024) -
Modeling Hierarchical Thinking in Large Reasoning Models
par: Shahariar, G M, et autres
Publié: (2025) -
Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
par: Shayegani, Erfan, et autres
Publié: (2025) -
That Doesn't Go There: Attacks on Shared State in Multi-User Augmented Reality Applications
par: Slocum, Carter, et autres
Publié: (2023) -
Evil Vizier: Vulnerabilities of LLM-Integrated XR Systems
par: Zhang, Yicheng, et autres
Publié: (2025)