Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Rongwu, Qi, Zehan, Xu, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents
par: Xu, Rongwu, et autres
Publié: (2025)
par: Xu, Rongwu, et autres
Publié: (2025)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
par: Liu, Junhao, et autres
Publié: (2025)
par: Liu, Junhao, et autres
Publié: (2025)
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
par: Green, Tommaso, et autres
Publié: (2025)
par: Green, Tommaso, et autres
Publié: (2025)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
par: Xu, Rongwu, et autres
Publié: (2023)
par: Xu, Rongwu, et autres
Publié: (2023)
HauntAttack: When Attack Follows Reasoning as a Shadow
par: Ma, Jingyuan, et autres
Publié: (2025)
par: Ma, Jingyuan, et autres
Publié: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
par: Qu, Yubin, et autres
Publié: (2026)
par: Qu, Yubin, et autres
Publié: (2026)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Atoxia: Red-teaming Large Language Models with Target Toxic Answers
par: Du, Yuhao, et autres
Publié: (2024)
par: Du, Yuhao, et autres
Publié: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
par: Batra, Shourya, et autres
Publié: (2025)
par: Batra, Shourya, et autres
Publié: (2025)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
par: Liu, Shuaitong, et autres
Publié: (2025)
par: Liu, Shuaitong, et autres
Publié: (2025)
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
par: Liang, Zi, et autres
Publié: (2025)
par: Liang, Zi, et autres
Publié: (2025)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
par: Li, Xingyu, et autres
Publié: (2025)
par: Li, Xingyu, et autres
Publié: (2025)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
par: Yi, Sibo, et autres
Publié: (2025)
par: Yi, Sibo, et autres
Publié: (2025)
FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks
par: Xu, Naen, et autres
Publié: (2026)
par: Xu, Naen, et autres
Publié: (2026)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
par: Fang, Zhicheng, et autres
Publié: (2026)
par: Fang, Zhicheng, et autres
Publié: (2026)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
par: Du, Wei, et autres
Publié: (2023)
par: Du, Wei, et autres
Publié: (2023)
On the Role of Attention Heads in Large Language Model Safety
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
par: Ran, Delong, et autres
Publié: (2025)
par: Ran, Delong, et autres
Publié: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
par: Wei, Jiali, et autres
Publié: (2026)
par: Wei, Jiali, et autres
Publié: (2026)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
par: Zou, Qingsong, et autres
Publié: (2025)
par: Zou, Qingsong, et autres
Publié: (2025)
GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation
par: Ramesh, Govind, et autres
Publié: (2024)
par: Ramesh, Govind, et autres
Publié: (2024)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
par: Huang, Yao, et autres
Publié: (2025)
par: Huang, Yao, et autres
Publié: (2025)
Emoti-Attack: Zero-Perturbation Adversarial Attacks on NLP Systems via Emoji Sequences
par: Zhang, Yangshijie
Publié: (2025)
par: Zhang, Yangshijie
Publié: (2025)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
par: Cheng, Pengzhou, et autres
Publié: (2024)
par: Cheng, Pengzhou, et autres
Publié: (2024)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
An Investigation on Group Query Hallucination Attacks
par: Miao, Kehao, et autres
Publié: (2025)
par: Miao, Kehao, et autres
Publié: (2025)
Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings
par: Zhang, Yuanhe, et autres
Publié: (2024)
par: Zhang, Yuanhe, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Attacks on Third-Party APIs of Large Language Models
par: Zhao, Wanru, et autres
Publié: (2024)
par: Zhao, Wanru, et autres
Publié: (2024)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
Documents similaires
-
Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents
par: Xu, Rongwu, et autres
Publié: (2025) -
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
par: Liu, Junhao, et autres
Publié: (2025) -
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
par: Green, Tommaso, et autres
Publié: (2025) -
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
par: Zhou, Zhenhong, et autres
Publié: (2024) -
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
par: Xu, Rongwu, et autres
Publié: (2023)