Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yuansen, Tang, Yixuan, Tun, Anthony Kum Hoe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
por: Liang, Jiacheng, et al.
Publicado: (2025)
por: Liang, Jiacheng, et al.
Publicado: (2025)
TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
por: Huang, Zhengxian, et al.
Publicado: (2026)
por: Huang, Zhengxian, et al.
Publicado: (2026)
Towards Action Hijacking of Large Language Model-based Agent
por: Zhang, Yuyang, et al.
Publicado: (2024)
por: Zhang, Yuyang, et al.
Publicado: (2024)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
por: Yuan, Zenghui, et al.
Publicado: (2025)
por: Yuan, Zenghui, et al.
Publicado: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
por: Cui, Yu, et al.
Publicado: (2025)
por: Cui, Yu, et al.
Publicado: (2025)
ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
por: Zhao, Gejian, et al.
Publicado: (2025)
por: Zhao, Gejian, et al.
Publicado: (2025)
HijackRAG: Hijacking Attacks against Retrieval-Augmented Large Language Models
por: Zhang, Yucheng, et al.
Publicado: (2024)
por: Zhang, Yucheng, et al.
Publicado: (2024)
On The Fragility of Benchmark Contamination Detection in Reasoning Models
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
por: Chen, Jianhao, et al.
Publicado: (2025)
por: Chen, Jianhao, et al.
Publicado: (2025)
Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models
por: Lu, Li, et al.
Publicado: (2026)
por: Lu, Li, et al.
Publicado: (2026)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Crimson: Empowering Strategic Reasoning in Cybersecurity through Large Language Models
por: Jin, Jiandong, et al.
Publicado: (2024)
por: Jin, Jiandong, et al.
Publicado: (2024)
DeepTx: Real-Time Transaction Risk Analysis via Multi-Modal Features and LLM Reasoning
por: Liu, Yixuan, et al.
Publicado: (2025)
por: Liu, Yixuan, et al.
Publicado: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
por: Zou, Quanchen, et al.
Publicado: (2026)
por: Zou, Quanchen, et al.
Publicado: (2026)
Hijacking Large Language Models via Adversarial In-Context Learning
por: Zhou, Xiangyu, et al.
Publicado: (2023)
por: Zhou, Xiangyu, et al.
Publicado: (2023)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
por: Zhao, Zhengyue, et al.
Publicado: (2025)
por: Zhao, Zhengyue, et al.
Publicado: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
CAMH: Advancing Model Hijacking Attack in Machine Learning
por: He, Xing, et al.
Publicado: (2024)
por: He, Xing, et al.
Publicado: (2024)
TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
por: Guo, Zhen, et al.
Publicado: (2026)
por: Guo, Zhen, et al.
Publicado: (2026)
Osmosis Distillation: Model Hijacking with the Fewest Samples
por: Shi, Yuchen, et al.
Publicado: (2026)
por: Shi, Yuchen, et al.
Publicado: (2026)
When Reasoning Leaks Membership: Membership Inference Attack on Black-box Large Reasoning Models
por: Hu, Ruihan, et al.
Publicado: (2026)
por: Hu, Ruihan, et al.
Publicado: (2026)
Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
por: Yang, Jirui, et al.
Publicado: (2025)
por: Yang, Jirui, et al.
Publicado: (2025)
Vocabulary Attack to Hijack Large Language Model Applications
por: Levi, Patrick, et al.
Publicado: (2024)
por: Levi, Patrick, et al.
Publicado: (2024)
RHINO: Guided Reasoning for Mapping Network Logs to Adversarial Tactics and Techniques with Large Language Models
por: Meng, Fanchao, et al.
Publicado: (2025)
por: Meng, Fanchao, et al.
Publicado: (2025)
Model Hijacking Attack in Federated Learning
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
Universal Jailbreak Suffixes Are Strong Attention Hijackers
por: Ben-Tov, Matan, et al.
Publicado: (2025)
por: Ben-Tov, Matan, et al.
Publicado: (2025)
CryptoX : Compositional Reasoning Evaluation of Large Language Models
por: Shi, Jiajun, et al.
Publicado: (2025)
por: Shi, Jiajun, et al.
Publicado: (2025)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
por: Liu, Shuaitong, et al.
Publicado: (2025)
por: Liu, Shuaitong, et al.
Publicado: (2025)
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
por: Chen, Meng, et al.
Publicado: (2026)
por: Chen, Meng, et al.
Publicado: (2026)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
por: Zhang, Ziming, et al.
Publicado: (2026)
por: Zhang, Ziming, et al.
Publicado: (2026)
Can LLM Infer Risk Information From MCP Server System Logs?
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
Inception Attacks: Immersive Hijacking in Virtual Reality Systems
por: Yang, Zhuolin, et al.
Publicado: (2024)
por: Yang, Zhuolin, et al.
Publicado: (2024)
Exploring Jamming and Hijacking Attacks for Micro Aerial Drones
por: Mekdad, Yassine, et al.
Publicado: (2024)
por: Mekdad, Yassine, et al.
Publicado: (2024)
Make Split, not Hijack: Preventing Feature-Space Hijacking Attacks in Split Learning
por: Khan, Tanveer, et al.
Publicado: (2024)
por: Khan, Tanveer, et al.
Publicado: (2024)
Red Teaming Large Reasoning Models
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
Hijacking Attacks against Neural Networks by Analyzing Training Data
por: Ge, Yunjie, et al.
Publicado: (2024)
por: Ge, Yunjie, et al.
Publicado: (2024)
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
por: Zhang, Jiawei, et al.
Publicado: (2025)
por: Zhang, Jiawei, et al.
Publicado: (2025)
Conflicts Make Large Reasoning Models Vulnerable to Attacks
por: Liu, Honghao, et al.
Publicado: (2026)
por: Liu, Honghao, et al.
Publicado: (2026)
Ejemplares similares
-
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
por: Liang, Jiacheng, et al.
Publicado: (2025) -
TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
por: Huang, Zhengxian, et al.
Publicado: (2026) -
Towards Action Hijacking of Large Language Model-based Agent
por: Zhang, Yuyang, et al.
Publicado: (2024) -
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
por: Yuan, Zenghui, et al.
Publicado: (2025) -
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
por: Cui, Yu, et al.
Publicado: (2025)