Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Songze, Cheng, Jiameng, Li, Yiming, Jia, Xiaojun, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
por: Li, Songze, et al.
Publicado: (2026)
por: Li, Songze, et al.
Publicado: (2026)
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
por: Yang, Wenyuan, et al.
Publicado: (2025)
por: Yang, Wenyuan, et al.
Publicado: (2025)
TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
por: Nguyen, Quang Duc, et al.
Publicado: (2026)
por: Nguyen, Quang Duc, et al.
Publicado: (2026)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
por: Wu, Yuanwei, et al.
Publicado: (2023)
por: Wu, Yuanwei, et al.
Publicado: (2023)
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
por: Lin, Shuyi, et al.
Publicado: (2025)
por: Lin, Shuyi, et al.
Publicado: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
por: Hossain, Ismail, et al.
Publicado: (2026)
por: Hossain, Ismail, et al.
Publicado: (2026)
MPC-Minimized Secure LLM Inference
por: Rathee, Deevashwer, et al.
Publicado: (2024)
por: Rathee, Deevashwer, et al.
Publicado: (2024)
Learning to Watermark LLM-generated Text via Reinforcement Learning
por: Xu, Xiaojun, et al.
Publicado: (2024)
por: Xu, Xiaojun, et al.
Publicado: (2024)
Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks
por: Wang, Zi, et al.
Publicado: (2024)
por: Wang, Zi, et al.
Publicado: (2024)
DATABench: Evaluating Dataset Auditing in Deep Learning from an Adversarial Perspective
por: Shao, Shuo, et al.
Publicado: (2025)
por: Shao, Shuo, et al.
Publicado: (2025)
Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
por: Dong, Yingkai, et al.
Publicado: (2024)
por: Dong, Yingkai, et al.
Publicado: (2024)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
por: Nikolić, Kristina, et al.
Publicado: (2025)
por: Nikolić, Kristina, et al.
Publicado: (2025)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
por: Teng, Ma, et al.
Publicado: (2024)
por: Teng, Ma, et al.
Publicado: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks
por: Ren, Zhiyao, et al.
Publicado: (2025)
por: Ren, Zhiyao, et al.
Publicado: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
por: Chen, Wenyu, et al.
Publicado: (2026)
por: Chen, Wenyu, et al.
Publicado: (2026)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
por: Galinkin, Erick, et al.
Publicado: (2024)
por: Galinkin, Erick, et al.
Publicado: (2024)
Mitigating Many-Shot Jailbreaking
por: Ackerman, Christopher M., et al.
Publicado: (2025)
por: Ackerman, Christopher M., et al.
Publicado: (2025)
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
por: Liu, Xiaogeng, et al.
Publicado: (2024)
por: Liu, Xiaogeng, et al.
Publicado: (2024)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
CBW: Towards Dataset Ownership Verification for Speaker Verification via Clustering-based Backdoor Watermarking
por: Li, Yiming, et al.
Publicado: (2025)
por: Li, Yiming, et al.
Publicado: (2025)
LLM Jailbreak Detection for (Almost) Free!
por: Chen, Guorui, et al.
Publicado: (2025)
por: Chen, Guorui, et al.
Publicado: (2025)
OD-Stega: LLM-Based Relatively Secure Steganography via Optimized Distributions
por: Huang, Yu-Shin, et al.
Publicado: (2024)
por: Huang, Yu-Shin, et al.
Publicado: (2024)
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
por: Jia, Hengrui, et al.
Publicado: (2025)
por: Jia, Hengrui, et al.
Publicado: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
por: Chen, Zhuowei, et al.
Publicado: (2025)
por: Chen, Zhuowei, et al.
Publicado: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Jailbreaking LLMs via Calibration
por: Lu, Yuxuan, et al.
Publicado: (2026)
por: Lu, Yuxuan, et al.
Publicado: (2026)
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
por: Li, Jing-Jing, et al.
Publicado: (2025)
por: Li, Jing-Jing, et al.
Publicado: (2025)
CertDW: Towards Certified Dataset Ownership Verification via Conformal Prediction
por: Qiao, Ting, et al.
Publicado: (2025)
por: Qiao, Ting, et al.
Publicado: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
KnowGraph: Knowledge-Enabled Anomaly Detection via Logical Reasoning on Graph Data
por: Zhou, Andy, et al.
Publicado: (2024)
por: Zhou, Andy, et al.
Publicado: (2024)
MOVE: Effective and Harmless Ownership Verification via Embedded External Features
por: Li, Yiming, et al.
Publicado: (2022)
por: Li, Yiming, et al.
Publicado: (2022)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
por: Nurlanov, Zhakshylyk, et al.
Publicado: (2026)
por: Nurlanov, Zhakshylyk, et al.
Publicado: (2026)
FIT-Print: Towards False-claim-resistant Model Ownership Verification via Targeted Fingerprint
por: Shao, Shuo, et al.
Publicado: (2025)
por: Shao, Shuo, et al.
Publicado: (2025)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
por: Shao, Shuo, et al.
Publicado: (2024)
por: Shao, Shuo, et al.
Publicado: (2024)
OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
por: Wang, Kaixiang, et al.
Publicado: (2026)
por: Wang, Kaixiang, et al.
Publicado: (2026)
Ejemplares similares
-
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
por: Li, Songze, et al.
Publicado: (2026) -
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
por: Li, Songze, et al.
Publicado: (2024) -
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
por: Yang, Wenyuan, et al.
Publicado: (2025) -
TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
por: Nguyen, Quang Duc, et al.
Publicado: (2026) -
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
por: Wu, Yuanwei, et al.
Publicado: (2023)