RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Jingnan, Ji, Xiangtian, Lu, Yijun, Cui, Chenhang, Zhao, Weixiang, Deng, Gelei, Liang, Zhenkai, Zhang, An, Chua, Tat-Seng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
par: Cui, Chenhang, et autres
Publié: (2026)
par: Cui, Chenhang, et autres
Publié: (2026)
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
par: Zheng, Jingnan, et autres
Publié: (2026)
par: Zheng, Jingnan, et autres
Publié: (2026)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
par: Cui, Chenhang, et autres
Publié: (2024)
par: Cui, Chenhang, et autres
Publié: (2024)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
par: Cui, Chenhang, et autres
Publié: (2024)
par: Cui, Chenhang, et autres
Publié: (2024)
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
par: Zheng, Jingnan, et autres
Publié: (2026)
par: Zheng, Jingnan, et autres
Publié: (2026)
MASKDROID: Robust Android Malware Detection with Masked Graph Representations
par: Zheng, Jingnan, et autres
Publié: (2024)
par: Zheng, Jingnan, et autres
Publié: (2024)
Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering
par: Chen, Yuxin, et autres
Publié: (2026)
par: Chen, Yuxin, et autres
Publié: (2026)
Transport and Merge: Cross-Architecture Merging for Large Language Models
par: Cui, Chenhang, et autres
Publié: (2026)
par: Cui, Chenhang, et autres
Publié: (2026)
AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
par: Zheng, Jingnan, et autres
Publié: (2024)
par: Zheng, Jingnan, et autres
Publié: (2024)
Enhancing Spectral Graph Neural Networks with LLM-Predicted Homophily
par: Lu, Kangkang, et autres
Publié: (2025)
par: Lu, Kangkang, et autres
Publié: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
par: Chu, Meng, et autres
Publié: (2025)
par: Chu, Meng, et autres
Publié: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
NExT-GPT: Any-to-Any Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2023)
par: Wu, Shengqiong, et autres
Publié: (2023)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
par: Shi, Enyi, et autres
Publié: (2026)
par: Shi, Enyi, et autres
Publié: (2026)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
par: Lan, Xing, et autres
Publié: (2024)
par: Lan, Xing, et autres
Publié: (2024)
Towards Goal-oriented Intelligent Tutoring Systems in Online Education
par: Deng, Yang, et autres
Publié: (2023)
par: Deng, Yang, et autres
Publié: (2023)
SafeNeuron: Neuron-Level Safety Alignment for Large Language Models
par: Wang, Zhaoxin, et autres
Publié: (2026)
par: Wang, Zhaoxin, et autres
Publié: (2026)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
par: Wang, Tingyu, et autres
Publié: (2022)
par: Wang, Tingyu, et autres
Publié: (2022)
Hello Again! LLM-powered Personalized Agent for Long-term Dialogue
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
par: Chen, Yiyang, et autres
Publié: (2022)
par: Chen, Yiyang, et autres
Publié: (2022)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
par: Zheng, Zhedong, et autres
Publié: (2022)
par: Zheng, Zhedong, et autres
Publié: (2022)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
3D-TAFS: A Training-free Framework for 3D Affordance Segmentation
par: Chu, Meng, et autres
Publié: (2024)
par: Chu, Meng, et autres
Publié: (2024)
LLM2Rec: Large Language Models Are Powerful Embedding Models for Sequential Recommendation
par: He, Yingzhi, et autres
Publié: (2025)
par: He, Yingzhi, et autres
Publié: (2025)
Universal Scene Graph Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Learning to Ask Critical Questions for Assisting Product Search
par: Li, Zixuan, et autres
Publié: (2024)
par: Li, Zixuan, et autres
Publié: (2024)
Towards Human-centered Proactive Conversational Agents
par: Deng, Yang, et autres
Publié: (2024)
par: Deng, Yang, et autres
Publié: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
par: Zhao, Yong, et autres
Publié: (2025)
par: Zhao, Yong, et autres
Publié: (2025)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
A Federated Framework for LLM-based Recommendation
par: Zhao, Jujia, et autres
Publié: (2024)
par: Zhao, Jujia, et autres
Publié: (2024)
On Reasoning Strength Planning in Large Reasoning Models
par: Sheng, Leheng, et autres
Publié: (2025)
par: Sheng, Leheng, et autres
Publié: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
par: Zhang, An, et autres
Publié: (2024)
par: Zhang, An, et autres
Publié: (2024)
Beyond Persuasion: Towards Conversational Recommender System with Credible Explanations
par: Qin, Peixin, et autres
Publié: (2024)
par: Qin, Peixin, et autres
Publié: (2024)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
par: Fei, Hao, et autres
Publié: (2023)
par: Fei, Hao, et autres
Publié: (2023)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
par: Xu, Shicheng, et autres
Publié: (2023)
par: Xu, Shicheng, et autres
Publié: (2023)
FashionReGen: LLM-Empowered Fashion Report Generation
par: Ding, Yujuan, et autres
Publié: (2024)
par: Ding, Yujuan, et autres
Publié: (2024)
Documents similaires
-
Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer
par: Cui, Chenhang, et autres
Publié: (2026) -
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
par: Zheng, Jingnan, et autres
Publié: (2026) -
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
par: Cui, Chenhang, et autres
Publié: (2024) -
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
par: Cui, Chenhang, et autres
Publié: (2024) -
Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment
par: Zheng, Jingnan, et autres
Publié: (2026)