Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Zehao, Wang, Lanjun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
Adversarial Reasoning at Jailbreaking Time
von: Sabbaghi, Mahdi, et al.
Veröffentlicht: (2025)
von: Sabbaghi, Mahdi, et al.
Veröffentlicht: (2025)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
von: Yao, Yang, et al.
Veröffentlicht: (2025)
von: Yao, Yang, et al.
Veröffentlicht: (2025)
Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
von: Qu, Xingwei, et al.
Veröffentlicht: (2025)
von: Qu, Xingwei, et al.
Veröffentlicht: (2025)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
von: Cao, Chentao, et al.
Veröffentlicht: (2025)
von: Cao, Chentao, et al.
Veröffentlicht: (2025)
The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models
von: Rahman, Md. Hasib Ur
Veröffentlicht: (2025)
von: Rahman, Md. Hasib Ur
Veröffentlicht: (2025)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
von: Li, Yawei, et al.
Veröffentlicht: (2026)
von: Li, Yawei, et al.
Veröffentlicht: (2026)
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
von: Kwon, Yongchan, et al.
Veröffentlicht: (2025)
von: Kwon, Yongchan, et al.
Veröffentlicht: (2025)
A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning
von: Wang, Zhe, et al.
Veröffentlicht: (2025)
von: Wang, Zhe, et al.
Veröffentlicht: (2025)
Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis
von: Jiao, Zhengbo, et al.
Veröffentlicht: (2026)
von: Jiao, Zhengbo, et al.
Veröffentlicht: (2026)
Are Large-Language Models Graph Algorithmic Reasoners?
von: Taylor, Alexander K, et al.
Veröffentlicht: (2024)
von: Taylor, Alexander K, et al.
Veröffentlicht: (2024)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
von: Yang, Wang, et al.
Veröffentlicht: (2026)
von: Yang, Wang, et al.
Veröffentlicht: (2026)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
von: Zhang, Nan, et al.
Veröffentlicht: (2026)
von: Zhang, Nan, et al.
Veröffentlicht: (2026)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
von: Li, Yuangang, et al.
Veröffentlicht: (2025)
von: Li, Yuangang, et al.
Veröffentlicht: (2025)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
von: Shen, Wei, et al.
Veröffentlicht: (2025)
von: Shen, Wei, et al.
Veröffentlicht: (2025)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
von: Shen, Yi, et al.
Veröffentlicht: (2025)
von: Shen, Yi, et al.
Veröffentlicht: (2025)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
von: He, Qianxi, et al.
Veröffentlicht: (2025)
von: He, Qianxi, et al.
Veröffentlicht: (2025)
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
von: Liu, Zehao, et al.
Veröffentlicht: (2026)
von: Liu, Zehao, et al.
Veröffentlicht: (2026)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
von: Wang, Yuanfu, et al.
Veröffentlicht: (2026)
von: Wang, Yuanfu, et al.
Veröffentlicht: (2026)
FEVO: Financial Knowledge Expansion and Reasoning Evolution for Large Language Models
von: Pang, Bo, et al.
Veröffentlicht: (2025)
von: Pang, Bo, et al.
Veröffentlicht: (2025)
Towards Large Reasoning Models for Agriculture
von: Zaremehrjerdi, Hossein, et al.
Veröffentlicht: (2025)
von: Zaremehrjerdi, Hossein, et al.
Veröffentlicht: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
von: Zhou, Yuyan, et al.
Veröffentlicht: (2026)
Training Large Language Models to Reason via EM Policy Gradient
von: Xu, Tianbing
Veröffentlicht: (2025)
von: Xu, Tianbing
Veröffentlicht: (2025)
Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models
von: Phan, Hoang, et al.
Veröffentlicht: (2025)
von: Phan, Hoang, et al.
Veröffentlicht: (2025)
Can Large Reasoning Models do Analogical Reasoning under Perceptual Uncertainty?
von: Camposampiero, Giacomo, et al.
Veröffentlicht: (2025)
von: Camposampiero, Giacomo, et al.
Veröffentlicht: (2025)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
von: Mao, Yixiu, et al.
Veröffentlicht: (2026)
NK-GAD: Neighbor Knowledge-Enhanced Unsupervised Graph Anomaly Detection
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
von: Wang, Zehao, et al.
Veröffentlicht: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
von: Chen, Kaiwen, et al.
Veröffentlicht: (2025)
von: Chen, Kaiwen, et al.
Veröffentlicht: (2025)
ReasoningWeekly: A General Knowledge and Verbal Reasoning Challenge for Large Language Models
von: Wu, Zixuan, et al.
Veröffentlicht: (2025)
von: Wu, Zixuan, et al.
Veröffentlicht: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
von: Zhang, Nan, et al.
Veröffentlicht: (2025)
von: Zhang, Nan, et al.
Veröffentlicht: (2025)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
von: Sui, Yuan, et al.
Veröffentlicht: (2025)
von: Sui, Yuan, et al.
Veröffentlicht: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
Quantifying and Understanding Uncertainty in Large Reasoning Models
von: Li, Yangyi, et al.
Veröffentlicht: (2026)
von: Li, Yangyi, et al.
Veröffentlicht: (2026)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
von: Wan, Qian, et al.
Veröffentlicht: (2026)
von: Wan, Qian, et al.
Veröffentlicht: (2026)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks
von: Wang, Zi, et al.
Veröffentlicht: (2024)
von: Wang, Zi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
von: Wang, Zehao, et al.
Veröffentlicht: (2026) -
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025) -
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024) -
Adversarial Reasoning at Jailbreaking Time
von: Sabbaghi, Mahdi, et al.
Veröffentlicht: (2025) -
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
von: Yao, Yang, et al.
Veröffentlicht: (2025)