ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Changyi, Wang, Jiayi, Pan, Xudong, Hong, Geng, Yang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
por: Wang, Yuquan, et al.
Publicado: (2025)
por: Wang, Yuquan, et al.
Publicado: (2025)
The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning
por: Zhang, Xudong, et al.
Publicado: (2026)
por: Zhang, Xudong, et al.
Publicado: (2026)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
por: Luo, Linhao, et al.
Publicado: (2023)
por: Luo, Linhao, et al.
Publicado: (2023)
RAG over Thinking Traces Can Improve Reasoning Tasks
por: Arabzadeh, Negar, et al.
Publicado: (2026)
por: Arabzadeh, Negar, et al.
Publicado: (2026)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models
por: Wang, Yuhui, et al.
Publicado: (2025)
por: Wang, Yuhui, et al.
Publicado: (2025)
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
por: Pathak, Manas, et al.
Publicado: (2026)
por: Pathak, Manas, et al.
Publicado: (2026)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
por: Xu, Fengli, et al.
Publicado: (2025)
por: Xu, Fengli, et al.
Publicado: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
por: Wang, Yiqi, et al.
Publicado: (2024)
por: Wang, Yiqi, et al.
Publicado: (2024)
ReasonOps: Operator Segmentation for LLM Reasoning Traces
por: Lee, Daniel, et al.
Publicado: (2026)
por: Lee, Daniel, et al.
Publicado: (2026)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2026)
por: Xu, Qiancheng, et al.
Publicado: (2026)
Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
TimelineReasoner: Advancing Timeline Summarization with Large Reasoning Models
por: Zhang, Liancheng, et al.
Publicado: (2026)
por: Zhang, Liancheng, et al.
Publicado: (2026)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
por: Wang, Jingyuan, et al.
Publicado: (2025)
por: Wang, Jingyuan, et al.
Publicado: (2025)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
Safety Reasoning with Guidelines
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
por: Tian, Shi-Yu, et al.
Publicado: (2025)
por: Tian, Shi-Yu, et al.
Publicado: (2025)
Learning Adaptive Parallel Reasoning with Language Models
por: Pan, Jiayi, et al.
Publicado: (2025)
por: Pan, Jiayi, et al.
Publicado: (2025)
Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
Agentic Reasoning for Large Language Models
por: Wei, Tianxin, et al.
Publicado: (2026)
por: Wei, Tianxin, et al.
Publicado: (2026)
Route-and-Reason: Scaling Large Language Model Reasoning with Reinforced Model Router
por: Shao, Chenyang, et al.
Publicado: (2025)
por: Shao, Chenyang, et al.
Publicado: (2025)
RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models
por: Han, Yunseok, et al.
Publicado: (2026)
por: Han, Yunseok, et al.
Publicado: (2026)
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
por: Li, Junyi, et al.
Publicado: (2025)
por: Li, Junyi, et al.
Publicado: (2025)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
por: Li, Yanda, et al.
Publicado: (2024)
por: Li, Yanda, et al.
Publicado: (2024)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
por: Guan, Weixin, et al.
Publicado: (2026)
por: Guan, Weixin, et al.
Publicado: (2026)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
por: Mao, Yingzhi, et al.
Publicado: (2025)
por: Mao, Yingzhi, et al.
Publicado: (2025)
PRISON: Unmasking the Criminal Potential of Large Language Models
por: Wu, Xinyi, et al.
Publicado: (2025)
por: Wu, Xinyi, et al.
Publicado: (2025)
Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
por: Fu, Tingchen, et al.
Publicado: (2025)
por: Fu, Tingchen, et al.
Publicado: (2025)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
por: Ki, Dayeon, et al.
Publicado: (2026)
por: Ki, Dayeon, et al.
Publicado: (2026)
Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost
por: Zhan, Runzhe, et al.
Publicado: (2025)
por: Zhan, Runzhe, et al.
Publicado: (2025)
SEAL: Steerable Reasoning Calibration of Large Language Models for Free
por: Chen, Runjin, et al.
Publicado: (2025)
por: Chen, Runjin, et al.
Publicado: (2025)
Tracing Uncertainty in Language Model "Reasoning"
por: Grünefeld, Nils, et al.
Publicado: (2026)
por: Grünefeld, Nils, et al.
Publicado: (2026)
Exploring the Role of Reasoning Structures for Constructing Proofs in Multi-Step Natural Language Reasoning with Large Language Models
por: Zheng, Zi'ou, et al.
Publicado: (2024)
por: Zheng, Zi'ou, et al.
Publicado: (2024)
Accelerating Large Language Model Reasoning via Speculative Search
por: Wang, Zhihai, et al.
Publicado: (2025)
por: Wang, Zhihai, et al.
Publicado: (2025)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
por: Xu, Ancheng, et al.
Publicado: (2024)
por: Xu, Ancheng, et al.
Publicado: (2024)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
por: Chen, Bin, et al.
Publicado: (2025)
por: Chen, Bin, et al.
Publicado: (2025)
Benchmarking Chinese Commonsense Reasoning with a Multi-hop Reasoning Perspective
por: You, Wangjie, et al.
Publicado: (2025)
por: You, Wangjie, et al.
Publicado: (2025)
Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
ARS: Adaptive Reasoning Suppression for Efficient Large Reasoning Language Models
por: Zheng, Dongqi
Publicado: (2025)
por: Zheng, Dongqi
Publicado: (2025)
Ejemplares similares
-
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
por: Wang, Yuquan, et al.
Publicado: (2025) -
The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning
por: Zhang, Xudong, et al.
Publicado: (2026) -
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
por: Luo, Linhao, et al.
Publicado: (2023) -
RAG over Thinking Traces Can Improve Reasoning Tasks
por: Arabzadeh, Negar, et al.
Publicado: (2026) -
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)