Can Large Language Models Automatically Jailbreak GPT-4V?
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Yuanwei, Huang, Yue, Liu, Yixin, Li, Xiang, Zhou, Pan, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
von: Wu, Yuanwei, et al.
Veröffentlicht: (2023)
von: Wu, Yuanwei, et al.
Veröffentlicht: (2023)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2023)
von: Huang, Yue, et al.
Veröffentlicht: (2023)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
von: Sun, Hanchi, et al.
Veröffentlicht: (2026)
von: Sun, Hanchi, et al.
Veröffentlicht: (2026)
Multilingual Jailbreak Challenges in Large Language Models
von: Deng, Yue, et al.
Veröffentlicht: (2023)
von: Deng, Yue, et al.
Veröffentlicht: (2023)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
von: Huang, Yue, et al.
Veröffentlicht: (2023)
von: Huang, Yue, et al.
Veröffentlicht: (2023)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
von: Li, Yuan, et al.
Veröffentlicht: (2024)
von: Li, Yuan, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models with Psychometrics
von: Li, Yuan, et al.
Veröffentlicht: (2024)
von: Li, Yuan, et al.
Veröffentlicht: (2024)
Radiology-GPT: A Large Language Model for Radiology
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
von: Liu, Yanjiang, et al.
Veröffentlicht: (2025)
von: Liu, Yanjiang, et al.
Veröffentlicht: (2025)
DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
von: Liu, Zhengliang, et al.
Veröffentlicht: (2023)
Weak-to-Strong Jailbreaking on Large Language Models
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
AceGPT, Localizing Large Language Models in Arabic
von: Huang, Huang, et al.
Veröffentlicht: (2023)
von: Huang, Huang, et al.
Veröffentlicht: (2023)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
von: Zhang, Qihui, et al.
Veröffentlicht: (2024)
von: Zhang, Qihui, et al.
Veröffentlicht: (2024)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
von: Sun, Xiaobing, et al.
Veröffentlicht: (2026)
von: Sun, Xiaobing, et al.
Veröffentlicht: (2026)
Self-Cognition in Large Language Models: An Exploratory Study
von: Chen, Dongping, et al.
Veröffentlicht: (2024)
von: Chen, Dongping, et al.
Veröffentlicht: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks
von: Zhang, Kai, et al.
Veröffentlicht: (2023)
von: Zhang, Kai, et al.
Veröffentlicht: (2023)
EfficientLLM: Efficiency in Large Language Models
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2025)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2025)
DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning
von: Qian, Yanyu, et al.
Veröffentlicht: (2026)
von: Qian, Yanyu, et al.
Veröffentlicht: (2026)
Agentic AutoSurvey: Let LLMs Survey LLMs
von: Liu, Yixin, et al.
Veröffentlicht: (2025)
von: Liu, Yixin, et al.
Veröffentlicht: (2025)
Enhancing Systematic Reviews with Large Language Models: Using GPT-4 and Kimi
von: Kaptur, Dandan Chen, et al.
Veröffentlicht: (2025)
von: Kaptur, Dandan Chen, et al.
Veröffentlicht: (2025)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
von: Lyu, Yanjun, et al.
Veröffentlicht: (2024)
von: Lyu, Yanjun, et al.
Veröffentlicht: (2024)
CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Code
von: Guan, Batu, et al.
Veröffentlicht: (2024)
von: Guan, Batu, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models with Morality Attacks
von: Su, Ying, et al.
Veröffentlicht: (2026)
von: Su, Ying, et al.
Veröffentlicht: (2026)
Low-Resource Languages Jailbreak GPT-4
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2023)
von: Yong, Zheng-Xin, et al.
Veröffentlicht: (2023)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
von: Li, Tianlong, et al.
Veröffentlicht: (2024)
von: Li, Tianlong, et al.
Veröffentlicht: (2024)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
von: Zhang, Kang, et al.
Veröffentlicht: (2024)
von: Zhang, Kang, et al.
Veröffentlicht: (2024)
Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?
von: Chen, Shuo, et al.
Veröffentlicht: (2024)
von: Chen, Shuo, et al.
Veröffentlicht: (2024)
Persona Jailbreaking in Large Language Models
von: Sandhan, Jivnesh, et al.
Veröffentlicht: (2026)
von: Sandhan, Jivnesh, et al.
Veröffentlicht: (2026)
HonestLLM: Toward an Honest and Helpful Large Language Model
von: Gao, Chujie, et al.
Veröffentlicht: (2024)
von: Gao, Chujie, et al.
Veröffentlicht: (2024)
Can Large Language Models Detect Rumors on Social Media?
von: Liu, Qiang, et al.
Veröffentlicht: (2024)
von: Liu, Qiang, et al.
Veröffentlicht: (2024)
AutoSurvey: Large Language Models Can Automatically Write Surveys
von: Wang, Yidong, et al.
Veröffentlicht: (2024)
von: Wang, Yidong, et al.
Veröffentlicht: (2024)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
von: Zhu, Junda, et al.
Veröffentlicht: (2025)
von: Zhu, Junda, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
von: Wu, Yuanwei, et al.
Veröffentlicht: (2023) -
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2023) -
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2023) -
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
von: Huang, Yue, et al.
Veröffentlicht: (2024) -
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
von: Huang, Yue, et al.
Veröffentlicht: (2024)