Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Jingnan, Xu, Jingjun, Luo, Yanzhen, Cui, Chenhang, Deng, Gelei, Liang, Zhenkai, Wang, Xiang, Zhang, An, Chua, Tat-Seng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
por: Cui, Chenhang, et al.
Publicado: (2026)
por: Cui, Chenhang, et al.
Publicado: (2026)
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
por: Zheng, Jingnan, et al.
Publicado: (2026)
por: Zheng, Jingnan, et al.
Publicado: (2026)
RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
por: Zheng, Jingnan, et al.
Publicado: (2025)
por: Zheng, Jingnan, et al.
Publicado: (2025)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
Transport and Merge: Cross-Architecture Merging for Large Language Models
por: Cui, Chenhang, et al.
Publicado: (2026)
por: Cui, Chenhang, et al.
Publicado: (2026)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
por: Cui, Chenhang, et al.
Publicado: (2024)
por: Cui, Chenhang, et al.
Publicado: (2024)
MASKDROID: Robust Android Malware Detection with Masked Graph Representations
por: Zheng, Jingnan, et al.
Publicado: (2024)
por: Zheng, Jingnan, et al.
Publicado: (2024)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
por: Zheng, Jingnan, et al.
Publicado: (2024)
por: Zheng, Jingnan, et al.
Publicado: (2024)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
por: Sheng, Leheng, et al.
Publicado: (2026)
por: Sheng, Leheng, et al.
Publicado: (2026)
On Reasoning Strength Planning in Large Reasoning Models
por: Sheng, Leheng, et al.
Publicado: (2025)
por: Sheng, Leheng, et al.
Publicado: (2025)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
por: Deng, Yang, et al.
Publicado: (2024)
por: Deng, Yang, et al.
Publicado: (2024)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
por: Jin, Zhe, et al.
Publicado: (2025)
por: Jin, Zhe, et al.
Publicado: (2025)
Temporal Relational Reasoning of Large Language Models for Detecting Stock Portfolio Crashes
por: Koa, Kelvin J. L., et al.
Publicado: (2024)
por: Koa, Kelvin J. L., et al.
Publicado: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
por: Zhao, Yong, et al.
Publicado: (2025)
por: Zhao, Yong, et al.
Publicado: (2025)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
por: Shi, Enyi, et al.
Publicado: (2026)
por: Shi, Enyi, et al.
Publicado: (2026)
NExT-Guard: Training-Free Streaming Safeguard without Token-Level Labels
por: Fang, Junfeng, et al.
Publicado: (2026)
por: Fang, Junfeng, et al.
Publicado: (2026)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
por: Xu, Shicheng, et al.
Publicado: (2023)
por: Xu, Shicheng, et al.
Publicado: (2023)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
por: Sheng, Leheng, et al.
Publicado: (2025)
por: Sheng, Leheng, et al.
Publicado: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
Towards Goal-oriented Intelligent Tutoring Systems in Online Education
por: Deng, Yang, et al.
Publicado: (2023)
por: Deng, Yang, et al.
Publicado: (2023)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
por: Zhang, An, et al.
Publicado: (2024)
por: Zhang, An, et al.
Publicado: (2024)
Learning to Generate Explainable Stock Predictions using Self-Reflective Large Language Models
por: Koa, Kelvin J. L., et al.
Publicado: (2024)
por: Koa, Kelvin J. L., et al.
Publicado: (2024)
A Study of Implicit Ranking Unfairness in Large Language Models
por: Xu, Chen, et al.
Publicado: (2023)
por: Xu, Chen, et al.
Publicado: (2023)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
A Picture Is Worth a Graph: A Blueprint Debate Paradigm for Multimodal Reasoning
por: Zheng, Changmeng, et al.
Publicado: (2024)
por: Zheng, Changmeng, et al.
Publicado: (2024)
DRAFT: Task Decoupled Latent Reasoning for Agent Safety
por: Wang, Lin, et al.
Publicado: (2026)
por: Wang, Lin, et al.
Publicado: (2026)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Reasoning on Time-Series for Financial Technical Analysis
por: Koa, Kelvin J. L., et al.
Publicado: (2025)
por: Koa, Kelvin J. L., et al.
Publicado: (2025)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
por: Deng, Yang, et al.
Publicado: (2023)
por: Deng, Yang, et al.
Publicado: (2023)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
por: Chen, Yiyang, et al.
Publicado: (2022)
por: Chen, Yiyang, et al.
Publicado: (2022)
3D-TAFS: A Training-free Framework for 3D Affordance Segmentation
por: Chu, Meng, et al.
Publicado: (2024)
por: Chu, Meng, et al.
Publicado: (2024)
LightPROF: A Lightweight Reasoning Framework for Large Language Model on Knowledge Graph
por: Ao, Tu, et al.
Publicado: (2025)
por: Ao, Tu, et al.
Publicado: (2025)
Universal Scene Graph Generation
por: Wu, Shengqiong, et al.
Publicado: (2025)
por: Wu, Shengqiong, et al.
Publicado: (2025)
Learning to Ask Critical Questions for Assisting Product Search
por: Li, Zixuan, et al.
Publicado: (2024)
por: Li, Zixuan, et al.
Publicado: (2024)
Towards Human-centered Proactive Conversational Agents
por: Deng, Yang, et al.
Publicado: (2024)
por: Deng, Yang, et al.
Publicado: (2024)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
por: Zheng, Zhedong, et al.
Publicado: (2022)
por: Zheng, Zhedong, et al.
Publicado: (2022)
Ejemplares similares
-
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
por: Cui, Chenhang, et al.
Publicado: (2026) -
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
por: Zheng, Jingnan, et al.
Publicado: (2026) -
RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
por: Zheng, Jingnan, et al.
Publicado: (2025) -
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
por: Cui, Chenhang, et al.
Publicado: (2024) -
Transport and Merge: Cross-Architecture Merging for Large Language Models
por: Cui, Chenhang, et al.
Publicado: (2026)