The Great Contradiction Showdown: How Jailbreak and Stealth Wrestle in Vision-Language Models?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kao, Ching-Chia, Yu, Chia-Mu, Lu, Chun-Shien, Chen, Chu-Song |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Safety Alignment Depth in Large Language Models: A Markov Chain Perspective
von: Kao, Ching-Chia, et al.
Veröffentlicht: (2025)
von: Kao, Ching-Chia, et al.
Veröffentlicht: (2025)
Defending Against Repetitive Backdoor Attacks on Semi-supervised Learning through Lens of Rate-Distortion-Perception Trade-off
von: Lee, Cheng-Yi, et al.
Veröffentlicht: (2024)
von: Lee, Cheng-Yi, et al.
Veröffentlicht: (2024)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2024)
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2024)
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024)
Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?
von: Tsai, Yu-Lin, et al.
Veröffentlicht: (2023)
von: Tsai, Yu-Lin, et al.
Veröffentlicht: (2023)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2026)
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2026)
Counter-Current Learning: A Biologically Plausible Dual Network Approach for Deep Learning
von: Kao, Chia-Hsiang, et al.
Veröffentlicht: (2024)
von: Kao, Chia-Hsiang, et al.
Veröffentlicht: (2024)
Test-time Adversarial Defense with Opposite Adversarial Path and High Attack Time Cost
von: Yeh, Cheng-Han, et al.
Veröffentlicht: (2024)
von: Yeh, Cheng-Han, et al.
Veröffentlicht: (2024)
The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training
von: Sahoo, Subramanyam
Veröffentlicht: (2025)
von: Sahoo, Subramanyam
Veröffentlicht: (2025)
Minimal Cascade Gradient Smoothing for Fast Transferable Preemptive Adversarial Defense
von: Wang, Hanrui, et al.
Veröffentlicht: (2024)
von: Wang, Hanrui, et al.
Veröffentlicht: (2024)
GreedyPixel: Fine-Grained Black-Box Adversarial Attack Via Greedy Algorithm
von: Wang, Hanrui, et al.
Veröffentlicht: (2025)
von: Wang, Hanrui, et al.
Veröffentlicht: (2025)
Blog Data Showdown: Machine Learning vs Neuro-Symbolic Models for Gender Classification
von: Sinshaw, Natnael Tilahun, et al.
Veröffentlicht: (2025)
von: Sinshaw, Natnael Tilahun, et al.
Veröffentlicht: (2025)
VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2025)
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2025)
BADTV: Unveiling Backdoor Threats in Third-Party Task Vectors
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2025)
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
From Rattle to Roar: Optimizer Showdown for MambaStock on S&P 500
von: Chan, Alena, et al.
Veröffentlicht: (2025)
von: Chan, Alena, et al.
Veröffentlicht: (2025)
Visual Attention Exploration in Vision-Based Mamba Models
von: Wang, Junpeng, et al.
Veröffentlicht: (2025)
von: Wang, Junpeng, et al.
Veröffentlicht: (2025)
Layer-Aware Task Arithmetic: Disentangling Task-Specific and Instruction-Following Knowledge
von: Chen, Yan-Lun, et al.
Veröffentlicht: (2025)
von: Chen, Yan-Lun, et al.
Veröffentlicht: (2025)
Caduceus: Bi-Directional Equivariant Long-Range DNA Sequence Modeling
von: Schiff, Yair, et al.
Veröffentlicht: (2024)
von: Schiff, Yair, et al.
Veröffentlicht: (2024)
DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion
von: Wang, Hanrui, et al.
Veröffentlicht: (2025)
von: Wang, Hanrui, et al.
Veröffentlicht: (2025)
Rethinking How to Evaluate Language Model Jailbreak
von: Cai, Hongyu, et al.
Veröffentlicht: (2024)
von: Cai, Hongyu, et al.
Veröffentlicht: (2024)
Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models
von: Wang, Zhaoxin, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoxin, et al.
Veröffentlicht: (2025)
Evaluating Frontier Models for Stealth and Situational Awareness
von: Phuong, Mary, et al.
Veröffentlicht: (2025)
von: Phuong, Mary, et al.
Veröffentlicht: (2025)
Poisoning Attacks to Local Differential Privacy Protocols for Trajectory Data
von: Hsu, I-Jung, et al.
Veröffentlicht: (2025)
von: Hsu, I-Jung, et al.
Veröffentlicht: (2025)
A Survey of Research in Large Language Models for Electronic Design Automation
von: Pan, Jingyu, et al.
Veröffentlicht: (2025)
von: Pan, Jingyu, et al.
Veröffentlicht: (2025)
Airway Tree Modeling Using Dual-channel 3D UNet 3+ with Vesselness Prior
von: Chien, Hsiang-Chin, et al.
Veröffentlicht: (2022)
von: Chien, Hsiang-Chin, et al.
Veröffentlicht: (2022)
Prompting the Unseen: Detecting Hidden Backdoors in Black-Box Models
von: Huang, Zi-Xuan, et al.
Veröffentlicht: (2024)
von: Huang, Zi-Xuan, et al.
Veröffentlicht: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
Bridging Compressed Image Latents and Multimodal Large Language Models
von: Kao, Chia-Hao, et al.
Veröffentlicht: (2024)
von: Kao, Chia-Hao, et al.
Veröffentlicht: (2024)
Optimal Spatio-Temporal Decoupling for Bayesian Conformal Prediction
von: Fang, Yu-Hsueh, et al.
Veröffentlicht: (2026)
von: Fang, Yu-Hsueh, et al.
Veröffentlicht: (2026)
A Modularized Framework for Piecewise-Stationary Restless Bandits
von: Li, Kuan-Ta, et al.
Veröffentlicht: (2026)
von: Li, Kuan-Ta, et al.
Veröffentlicht: (2026)
Robustness Verification of Graph Neural Networks Via Lightweight Satisfiability Testing
von: Lu, Chia-Hsuan, et al.
Veröffentlicht: (2025)
von: Lu, Chia-Hsuan, et al.
Veröffentlicht: (2025)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
von: Hua, Peichun, et al.
Veröffentlicht: (2025)
von: Hua, Peichun, et al.
Veröffentlicht: (2025)
Matrix Profile for Time-Series Anomaly Detection: A Reproducible Open-Source Benchmark on TSB-AD
von: Yeh, Chin-Chia Michael
Veröffentlicht: (2026)
von: Yeh, Chin-Chia Michael
Veröffentlicht: (2026)
AI TrackMate: Finally, Someone Who Will Give Your Music More Than Just "Sounds Great!"
von: Jiang, Yi-Lin, et al.
Veröffentlicht: (2024)
von: Jiang, Yi-Lin, et al.
Veröffentlicht: (2024)
On Optimizing Multimodal Jailbreaks for Spoken Language Models
von: Krishnan, Aravind, et al.
Veröffentlicht: (2026)
von: Krishnan, Aravind, et al.
Veröffentlicht: (2026)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
von: Peng, Benji, et al.
Veröffentlicht: (2024)
von: Peng, Benji, et al.
Veröffentlicht: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Safety Alignment Depth in Large Language Models: A Markov Chain Perspective
von: Kao, Ching-Chia, et al.
Veröffentlicht: (2025) -
Defending Against Repetitive Backdoor Attacks on Semi-supervised Learning through Lens of Rate-Distortion-Perception Trade-off
von: Lee, Cheng-Yi, et al.
Veröffentlicht: (2024) -
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
von: Hsu, Chia-Yi, et al.
Veröffentlicht: (2024) -
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
von: Chen, Yi-Chia, et al.
Veröffentlicht: (2024) -
Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?
von: Tsai, Yu-Lin, et al.
Veröffentlicht: (2023)