Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Chengda, Fan, Xiaoyu, Huang, Yu, Xu, Rongwu, Li, Jijie, Xu, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory
por: Lu, Chengda, et al.
Publicado: (2026)
por: Lu, Chengda, et al.
Publicado: (2026)
Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study
por: Zhang, Li, et al.
Publicado: (2025)
por: Zhang, Li, et al.
Publicado: (2025)
Reason from Future: Reverse Thought Chain Enhances LLM Reasoning
por: Xu, Yinlong, et al.
Publicado: (2025)
por: Xu, Yinlong, et al.
Publicado: (2025)
Exploring Chinese Humor Generation: A Study on Two-Part Allegorical Sayings
por: Xu, Rongwu
Publicado: (2024)
por: Xu, Rongwu
Publicado: (2024)
SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment
por: Jeung, Wonje, et al.
Publicado: (2025)
por: Jeung, Wonje, et al.
Publicado: (2025)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
por: Tan, Xiaoyu, et al.
Publicado: (2024)
por: Tan, Xiaoyu, et al.
Publicado: (2024)
Guess What I am Thinking: A Benchmark for Inner Thought Reasoning of Role-Playing Language Agents
por: Xu, Rui, et al.
Publicado: (2025)
por: Xu, Rui, et al.
Publicado: (2025)
Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
por: Zaman, Kerem, et al.
Publicado: (2025)
por: Zaman, Kerem, et al.
Publicado: (2025)
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning
por: Wang, Zhuo, et al.
Publicado: (2026)
por: Wang, Zhuo, et al.
Publicado: (2026)
Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
por: Shao, Yifei, et al.
Publicado: (2026)
por: Shao, Yifei, et al.
Publicado: (2026)
Markov Chain of Thought for Efficient Mathematical Reasoning
por: Yang, Wen, et al.
Publicado: (2024)
por: Yang, Wen, et al.
Publicado: (2024)
Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
por: Wen, Xiangyu, et al.
Publicado: (2025)
por: Wen, Xiangyu, et al.
Publicado: (2025)
Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought
por: Chua, James, et al.
Publicado: (2024)
por: Chua, James, et al.
Publicado: (2024)
MemeMind: A Large-Scale Multimodal Dataset with Chain-of-Thought Reasoning for Harmful Meme Detection
por: Gu, Hexiang, et al.
Publicado: (2025)
por: Gu, Hexiang, et al.
Publicado: (2025)
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
LaRS: Latent Reasoning Skills for Chain-of-Thought Reasoning
por: Xu, Zifan, et al.
Publicado: (2023)
por: Xu, Zifan, et al.
Publicado: (2023)
Streaming Hallucination Detection in Long Chain-of-Thought Reasoning
por: Lu, Haolang, et al.
Publicado: (2026)
por: Lu, Haolang, et al.
Publicado: (2026)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
AI Awareness
por: Li, Xiaojian, et al.
Publicado: (2025)
por: Li, Xiaojian, et al.
Publicado: (2025)
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
por: Shen, Xu, et al.
Publicado: (2025)
por: Shen, Xu, et al.
Publicado: (2025)
What Makes a Good Reasoning Chain? Uncovering Structural Patterns in Long Chain-of-Thought Reasoning
por: Jiang, Gangwei, et al.
Publicado: (2025)
por: Jiang, Gangwei, et al.
Publicado: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
por: Khalifa, Muhammad, et al.
Publicado: (2023)
por: Khalifa, Muhammad, et al.
Publicado: (2023)
Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning
por: Luo, Yihong, et al.
Publicado: (2025)
por: Luo, Yihong, et al.
Publicado: (2025)
LLMs can Find Mathematical Reasoning Mistakes by Pedagogical Chain-of-Thought
por: Jiang, Zhuoxuan, et al.
Publicado: (2024)
por: Jiang, Zhuoxuan, et al.
Publicado: (2024)
LLM Reasoning Is Latent, Not the Chain of Thought
por: Wang, Wenshuo
Publicado: (2026)
por: Wang, Wenshuo
Publicado: (2026)
ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning
por: Hu, Minda, et al.
Publicado: (2026)
por: Hu, Minda, et al.
Publicado: (2026)
Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning
por: Yu, Qifan, et al.
Publicado: (2025)
por: Yu, Qifan, et al.
Publicado: (2025)
Reasoning Topology Matters: Network-of-Thought for Complex Reasoning Tasks
por: Huang, Fan
Publicado: (2026)
por: Huang, Fan
Publicado: (2026)
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
por: Huang, Chenxi, et al.
Publicado: (2025)
por: Huang, Chenxi, et al.
Publicado: (2025)
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
por: Wen, Yibin, et al.
Publicado: (2025)
por: Wen, Yibin, et al.
Publicado: (2025)
Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents
por: Xu, Rongwu, et al.
Publicado: (2025)
por: Xu, Rongwu, et al.
Publicado: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
por: Dai, Chengwei, et al.
Publicado: (2024)
por: Dai, Chengwei, et al.
Publicado: (2024)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
por: Xu, Ancheng, et al.
Publicado: (2024)
por: Xu, Ancheng, et al.
Publicado: (2024)
Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought
por: Huang, Yu Ti
Publicado: (2025)
por: Huang, Yu Ti
Publicado: (2025)
POEX: Towards Policy Executable Jailbreak Attacks Against the LLM-based Robots
por: Lu, Xuancun, et al.
Publicado: (2024)
por: Lu, Xuancun, et al.
Publicado: (2024)
Ejemplares similares
-
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
por: Xu, Rongwu, et al.
Publicado: (2024) -
HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory
por: Lu, Chengda, et al.
Publicado: (2026) -
Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study
por: Zhang, Li, et al.
Publicado: (2025) -
Reason from Future: Reverse Thought Chain Enhances LLM Reasoning
por: Xu, Yinlong, et al.
Publicado: (2025) -
Exploring Chinese Humor Generation: A Study on Two-Part Allegorical Sayings
por: Xu, Rongwu
Publicado: (2024)