Jailbreaking? One Step Is Enough!
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Weixiong, Zeng, Peijian, Li, Yiwei, Wu, Hongyan, Lin, Nankai, Chen, Junhao, Yang, Aimin, Zhou, Yongmei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLASS: Enhancing Cross-Modal Text-Molecule Retrieval Performance and Training Efficiency
por: Wu, Hongyan, et al.
Publicado: (2025)
por: Wu, Hongyan, et al.
Publicado: (2025)
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
por: Wu, Hongyan, et al.
Publicado: (2024)
por: Wu, Hongyan, et al.
Publicado: (2024)
Multiple-Debias: A Full-process Debiasing Method for Multilingual Pre-trained Language Models
por: Liang, Haoyu, et al.
Publicado: (2026)
por: Liang, Haoyu, et al.
Publicado: (2026)
A Simple Yet Effective Corpus Construction Framework for Indonesian Grammatical Error Correction
por: Lin, Nankai, et al.
Publicado: (2024)
por: Lin, Nankai, et al.
Publicado: (2024)
Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA
por: Li, Fengyu, et al.
Publicado: (2026)
por: Li, Fengyu, et al.
Publicado: (2026)
DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data
por: Chen, Zhuowei, et al.
Publicado: (2025)
por: Chen, Zhuowei, et al.
Publicado: (2025)
Composited-Nested-Learning with Data Augmentation for Nested Named Entity Recognition
por: Liao, Xingming, et al.
Publicado: (2024)
por: Liao, Xingming, et al.
Publicado: (2024)
DLM-One: Diffusion Language Models for One-Step Sequence Generation
por: Chen, Tianqi, et al.
Publicado: (2025)
por: Chen, Tianqi, et al.
Publicado: (2025)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
por: Han, Tianyang, et al.
Publicado: (2026)
por: Han, Tianyang, et al.
Publicado: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
por: Ji, Haoxuan, et al.
Publicado: (2024)
por: Ji, Haoxuan, et al.
Publicado: (2024)
LR-IAD:Mask-Free Industrial Anomaly Detection with Logical Reasoning
por: Zeng, Peijian, et al.
Publicado: (2025)
por: Zeng, Peijian, et al.
Publicado: (2025)
Chameleon: Benchmarking Detection and Backtracking on Commercial-Grade AI-Generated Videos
por: Liao, Xingming, et al.
Publicado: (2025)
por: Liao, Xingming, et al.
Publicado: (2025)
Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
por: Zhou, Yao, et al.
Publicado: (2026)
por: Zhou, Yao, et al.
Publicado: (2026)
One Word Is Not Enough: Simple Prompts Improve Word Embeddings
por: Ranjan, Rajeev
Publicado: (2025)
por: Ranjan, Rajeev
Publicado: (2025)
ProRAC: A Neuro-symbolic Method for Reasoning about Actions with LLM-based Progression
por: Wu, Haoyong, et al.
Publicado: (2025)
por: Wu, Haoyong, et al.
Publicado: (2025)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
por: Xu, Nan, et al.
Publicado: (2023)
por: Xu, Nan, et al.
Publicado: (2023)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
por: Wu, Yu-Hang, et al.
Publicado: (2025)
por: Wu, Yu-Hang, et al.
Publicado: (2025)
"Not Aligned" is Not "Malicious": Being Careful about Hallucinations of Large Language Models' Jailbreak
por: Mei, Lingrui, et al.
Publicado: (2024)
por: Mei, Lingrui, et al.
Publicado: (2024)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
por: Sun, Bowen, et al.
Publicado: (2026)
por: Sun, Bowen, et al.
Publicado: (2026)
One Task Vector is not Enough: A Large-Scale Study for In-Context Learning
por: Tikhonov, Pavel, et al.
Publicado: (2025)
por: Tikhonov, Pavel, et al.
Publicado: (2025)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
por: Guo, Ziyu, et al.
Publicado: (2026)
por: Guo, Ziyu, et al.
Publicado: (2026)
From Metaphor to Mechanism: How LLMs Decode Traditional Chinese Medicine Symbolic Language for Modern Clinical Relevance
por: Tang, Jiacheng, et al.
Publicado: (2025)
por: Tang, Jiacheng, et al.
Publicado: (2025)
Jailbreaking Large Language Models with Morality Attacks
por: Su, Ying, et al.
Publicado: (2026)
por: Su, Ying, et al.
Publicado: (2026)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
por: Han, Seungju, et al.
Publicado: (2024)
por: Han, Seungju, et al.
Publicado: (2024)
Instruct Large Language Models to Generate Scientific Literature Survey Step by Step
por: Lai, Yuxuan, et al.
Publicado: (2024)
por: Lai, Yuxuan, et al.
Publicado: (2024)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
por: Zhang, Zihou, et al.
Publicado: (2026)
por: Zhang, Zihou, et al.
Publicado: (2026)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
por: Li, Linbao, et al.
Publicado: (2025)
por: Li, Linbao, et al.
Publicado: (2025)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
por: Lu, Jinghui, et al.
Publicado: (2026)
por: Lu, Jinghui, et al.
Publicado: (2026)
Can Large Language Models Automatically Jailbreak GPT-4V?
por: Wu, Yuanwei, et al.
Publicado: (2024)
por: Wu, Yuanwei, et al.
Publicado: (2024)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
por: Wang, Wenxuan, et al.
Publicado: (2024)
por: Wang, Wenxuan, et al.
Publicado: (2024)
Don't Say No: Jailbreaking LLM by Suppressing Refusal
por: Zhou, Yukai, et al.
Publicado: (2024)
por: Zhou, Yukai, et al.
Publicado: (2024)
xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning
por: Guo, Jiaxing, et al.
Publicado: (2025)
por: Guo, Jiaxing, et al.
Publicado: (2025)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoning
por: Wang, Mengyu, et al.
Publicado: (2025)
por: Wang, Mengyu, et al.
Publicado: (2025)
Jailbreaking to Jailbreak
por: Kritz, Jeremy, et al.
Publicado: (2025)
por: Kritz, Jeremy, et al.
Publicado: (2025)
One Prompt is not Enough: Automated Construction of a Mixture-of-Expert Prompts
por: Wang, Ruochen, et al.
Publicado: (2024)
por: Wang, Ruochen, et al.
Publicado: (2024)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
por: Lu, Weikai, et al.
Publicado: (2024)
por: Lu, Weikai, et al.
Publicado: (2024)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
por: Xu, Huimin, et al.
Publicado: (2025)
por: Xu, Huimin, et al.
Publicado: (2025)
Ejemplares similares
-
CLASS: Enhancing Cross-Modal Text-Molecule Retrieval Performance and Training Efficiency
por: Wu, Hongyan, et al.
Publicado: (2025) -
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
por: Wu, Hongyan, et al.
Publicado: (2024) -
Multiple-Debias: A Full-process Debiasing Method for Multilingual Pre-trained Language Models
por: Liang, Haoyu, et al.
Publicado: (2026) -
A Simple Yet Effective Corpus Construction Framework for Indonesian Grammatical Error Correction
por: Lin, Nankai, et al.
Publicado: (2024) -
Replacing Multi-Step Assembly of Data Preparation Pipelines with One-Step LLM Pipeline Generation for Table QA
por: Li, Fengyu, et al.
Publicado: (2026)