Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mu, Honglin, He, Han, Zhou, Yuxin, Feng, Yunlong, Xu, Yang, Qin, Libo, Shi, Xiaoming, Liu, Zeming, Han, Xudong, Shi, Qi, Zhu, Qingfu, Che, Wanxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReF Decompile: Relabeling and Function Call Enhanced Decompile
par: Feng, Yunlong, et autres
Publié: (2025)
par: Feng, Yunlong, et autres
Publié: (2025)
Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
Exploring Hybrid Question Answering via Program-based Prompting
par: Shi, Qi, et autres
Publié: (2024)
par: Shi, Qi, et autres
Publié: (2024)
Beyond Static Evaluation: A Dynamic Approach to Assessing AI Assistants' API Invocation Capabilities
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
Improving Language Model Reasoning with Self-motivated Learning
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
A Two-Stage Framework with Self-Supervised Distillation For Cross-Domain Text Classification
par: Feng, Yunlong, et autres
Publié: (2023)
par: Feng, Yunlong, et autres
Publié: (2023)
ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring
par: Niu, Tianhao, et autres
Publié: (2026)
par: Niu, Tianhao, et autres
Publié: (2026)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
Boosting Jailbreak Attack with Momentum
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
A Survey of Table Reasoning with Large Language Models
par: Zhang, Xuanliang, et autres
Publié: (2024)
par: Zhang, Xuanliang, et autres
Publié: (2024)
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
Concise and Precise Context Compression for Tool-Using Language Models
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
Python is Not Always the Best Choice: Embracing Multilingual Program of Thoughts
par: Luo, Xianzhen, et autres
Publié: (2024)
par: Luo, Xianzhen, et autres
Publié: (2024)
ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling
par: Teng, Dechuan, et autres
Publié: (2026)
par: Teng, Dechuan, et autres
Publié: (2026)
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
par: Ding, Renhua, et autres
Publié: (2025)
par: Ding, Renhua, et autres
Publié: (2025)
OneBit: Towards Extremely Low-bit Large Language Models
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
Automated Snippet-Alignment Data Augmentation for Code Translation
par: Zhang, Zhiming, et autres
Publié: (2025)
par: Zhang, Zhiming, et autres
Publié: (2025)
Improving Grammatical Error Correction via Contextual Data Augmentation
par: Wang, Yixuan, et autres
Publié: (2024)
par: Wang, Yixuan, et autres
Publié: (2024)
Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs
par: Xu, Xiao, et autres
Publié: (2025)
par: Xu, Xiao, et autres
Publié: (2025)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
When Does Context Help? Error Dynamics of Contextual Information in Large Language Models
par: Wang, Dingzirui, et autres
Publié: (2026)
par: Wang, Dingzirui, et autres
Publié: (2026)
Semantic-Guided Generative Image Augmentation Method with Diffusion Models for Image Classification
par: Li, Bohan, et autres
Publié: (2023)
par: Li, Bohan, et autres
Publié: (2023)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
par: Ji, Shiyu, et autres
Publié: (2025)
par: Ji, Shiyu, et autres
Publié: (2025)
Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQL
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
Scaling Laws for Agent Harnesses via Effective Feedback Compute
par: Zhang, Xuanliang, et autres
Publié: (2026)
par: Zhang, Xuanliang, et autres
Publié: (2026)
Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning Processes
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
DAC: Decomposed Automation Correction for Text-to-SQL
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
MURRE: Multi-Hop Table Retrieval with Removal for Open-Domain Text-to-SQL
par: Zhang, Xuanliang, et autres
Publié: (2024)
par: Zhang, Xuanliang, et autres
Publié: (2024)
How Do Language Models Understand Tables? A Mechanistic Analysis of Cell Location
par: Zhang, Xuanliang, et autres
Publié: (2026)
par: Zhang, Xuanliang, et autres
Publié: (2026)
Abacus-SQL: A Text-to-SQL System Empowering Cross-Domain and Open-Domain Database Retrieval
par: Xu, Keyan, et autres
Publié: (2025)
par: Xu, Keyan, et autres
Publié: (2025)
RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversals
par: Zhang, Xuanliang, et autres
Publié: (2025)
par: Zhang, Xuanliang, et autres
Publié: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
par: Zhang, Xuanliang, et autres
Publié: (2025)
par: Zhang, Xuanliang, et autres
Publié: (2025)
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
Can Large Language Models Understand You Better? An MBTI Personality Detection Dataset Aligned with Population Traits
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
par: Ji, Yiyan, et autres
Publié: (2025)
par: Ji, Yiyan, et autres
Publié: (2025)
SCALAR: Scientific Citation-based Live Assessment of Long-context Academic Reasoning
par: Wang, Renxi, et autres
Publié: (2025)
par: Wang, Renxi, et autres
Publié: (2025)
AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought
par: Zhang, Yongheng, et autres
Publié: (2024)
par: Zhang, Yongheng, et autres
Publié: (2024)
Documents similaires
-
ReF Decompile: Relabeling and Function Call Enhanced Decompile
par: Feng, Yunlong, et autres
Publié: (2025) -
Self-Constructed Context Decompilation with Fined-grained Alignment Enhancement
par: Feng, Yunlong, et autres
Publié: (2024) -
Exploring Hybrid Question Answering via Program-based Prompting
par: Shi, Qi, et autres
Publié: (2024) -
Beyond Static Evaluation: A Dynamic Approach to Assessing AI Assistants' API Invocation Capabilities
par: Mu, Honglin, et autres
Publié: (2024) -
Improving Language Model Reasoning with Self-motivated Learning
par: Feng, Yunlong, et autres
Publié: (2024)