YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Junyu, Liu, Meizhen, Huang, Xiufeng, Li, Jinfeng, Hong, Haiwen, Yuan, Xiaohan, Chen, Yuefeng, Huang, Longtao, Xue, Hui, Duan, Ranjie, Chen, Zhikai, Fu, Yuchuan, Li, Defeng, Gao, Lingyao, Yang, Yitong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
fairBERTs: Erasing Sensitive Information Through Semantic and Fairness-aware Perturbations
by: Li, Jinfeng, et al.
Published: (2024)
by: Li, Jinfeng, et al.
Published: (2024)
Sycacantha camarata Feng & Yu 2019
by: Muadsub, Sopita, et al.
Published: (2023)
by: Muadsub, Sopita, et al.
Published: (2023)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
by: Yuan, Xiaohan, et al.
Published: (2024)
by: Yuan, Xiaohan, et al.
Published: (2024)
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
by: Sun, Yitong, et al.
Published: (2025)
by: Sun, Yitong, et al.
Published: (2025)
Blockchain‐Enabled Integrated Energy System Trading Model for CCS‐P2G‐Coupled Operation: Enhancing Energy Trading Efficiency and Carbon Emission Reduction
by: Meizhen Gao
Published: (2024)
by: Meizhen Gao
Published: (2024)
Trust-Oriented Adaptive Guardrails for Large Language Models
by: Hu, Jinwei, et al.
Published: (2024)
by: Hu, Jinwei, et al.
Published: (2024)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
by: Wang, Thomas, et al.
Published: (2025)
by: Wang, Thomas, et al.
Published: (2025)
ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails
by: Wang, Yan, et al.
Published: (2026)
by: Wang, Yan, et al.
Published: (2026)
DAFNet: Dynamic Auxiliary Fusion for Sequential Model Editing in Large Language Models
by: Zhang, Taolin, et al.
Published: (2024)
by: Zhang, Taolin, et al.
Published: (2024)
YuLan: An Open-source Large Language Model
by: Zhu, Yutao, et al.
Published: (2024)
by: Zhu, Yutao, et al.
Published: (2024)
Building Guardrails for Large Language Models
by: Dong, Yi, et al.
Published: (2024)
by: Dong, Yi, et al.
Published: (2024)
MESA: Improving MoE Safety Alignment via Decentralized Expertise
by: Sun, Yitong, et al.
Published: (2026)
by: Sun, Yitong, et al.
Published: (2026)
SUPQA: LLM‐based Geo‐Visualization for Subjective Urban Performance Question‐Answering
by: Haiwen Huang, et al.
Published: (2025)
by: Haiwen Huang, et al.
Published: (2025)
QExplorer: Large Language Model Based Query Extraction for Toxic Content Exploration
by: Ren, Shaola, et al.
Published: (2025)
by: Ren, Shaola, et al.
Published: (2025)
R4: Reinforced Retriever-Reorder-Responder for Retrieval-Augmented Large Language Models
by: Zhang, Taolin, et al.
Published: (2024)
by: Zhang, Taolin, et al.
Published: (2024)
Editorial for “Significance of Normalized Apparent Diffusion Coefficient in the Vesical Imaging‐Reporting and Data System for Diagnosing Muscle‐Invasive Bladder Cancer”
by: Xiufeng Li
Published: (2024)
by: Xiufeng Li
Published: (2024)
How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
A Guide to Using Social Media as a Geospatial Lens for Studying Public Opinion and Behavior
by: Li, Lingyao
Published: (2026)
by: Li, Lingyao
Published: (2026)
SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations
by: Chen, Zhaorun, et al.
Published: (2024)
by: Chen, Zhaorun, et al.
Published: (2024)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
by: Fu, Yuchuan, et al.
Published: (2025)
by: Fu, Yuchuan, et al.
Published: (2025)
Lifelong Reinforcement Learning with Similarity-Driven Weighting by Large Models
by: Huang, Zhiyi, et al.
Published: (2025)
by: Huang, Zhiyi, et al.
Published: (2025)
Predictive Models of Arteriovenous Endovascular Fistula Deterioration in Maintenance Haemodialysis Patients: A Systematic Review
by: Xuhui Dong, et al.
Published: (2025)
by: Xuhui Dong, et al.
Published: (2025)
Across Time and (Product) Space: A Capability-Centric Model of Relatedness and Economic Complexity
by: Huang, Ziang, et al.
Published: (2025)
by: Huang, Ziang, et al.
Published: (2025)
How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
by: Zhang, Zhikai, et al.
Published: (2024)
by: Zhang, Zhikai, et al.
Published: (2024)
VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing
by: Xu, Jiacheng, et al.
Published: (2026)
by: Xu, Jiacheng, et al.
Published: (2026)
LoftUp: Learning a Coordinate-Based Feature Upsampler for Vision Foundation Models
by: Huang, Haiwen, et al.
Published: (2025)
by: Huang, Haiwen, et al.
Published: (2025)
Error analysis of 900 sample sentences for chinese learners from english speaking countries / Meizhen Cheng; Zhu Li
by: Meizhen, Cheng
by: Meizhen, Cheng
Diffusion Probe: Generated Image Result Prediction Using CNN Probes
by: Cui, Benlei, et al.
Published: (2026)
by: Cui, Benlei, et al.
Published: (2026)
Modewise Additive Factor Model for Matrix Time Series
by: Chen, Elynn, et al.
Published: (2025)
by: Chen, Elynn, et al.
Published: (2025)
Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
Dunhuang / Jiao Feng
by: Jiao Feng
by: Jiao Feng
Dual-TSST: A Dual-Branch Temporal-Spectral-Spatial Transformer Model for EEG Decoding
by: Li, Hongqi, et al.
Published: (2024)
by: Li, Hongqi, et al.
Published: (2024)
A Causal Explainable Guardrails for Large Language Models
by: Chu, Zhixuan, et al.
Published: (2024)
by: Chu, Zhixuan, et al.
Published: (2024)
Institutionalisation and Institutional Evolution: A Model of Selecting Government Officials in Ancient China
by: Haiwen Zhou
Published: (2025)
by: Haiwen Zhou
Published: (2025)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
by: Zhao, Yunhan, et al.
Published: (2026)
by: Zhao, Yunhan, et al.
Published: (2026)
Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
by: Duan, Ranjie, et al.
Published: (2025)
by: Duan, Ranjie, et al.
Published: (2025)
simpleposter: a simple baseline for product poster generation
by: Cui, Benlei, et al.
Published: (2026)
by: Cui, Benlei, et al.
Published: (2026)
Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
by: Jiang, Longtao, et al.
Published: (2025)
by: Jiang, Longtao, et al.
Published: (2025)
Estimation and Inference for CP Tensor Factor Models
by: Chen, Bin, et al.
Published: (2024)
by: Chen, Bin, et al.
Published: (2024)
Similar Items
-
fairBERTs: Erasing Sensitive Information Through Semantic and Fairness-aware Perturbations
by: Li, Jinfeng, et al.
Published: (2024) -
Sycacantha camarata Feng & Yu 2019
by: Muadsub, Sopita, et al.
Published: (2023) -
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
by: Yuan, Xiaohan, et al.
Published: (2024) -
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
by: Sun, Yitong, et al.
Published: (2025) -
Blockchain‐Enabled Integrated Energy System Trading Model for CCS‐P2G‐Coupled Operation: Enhancing Energy Trading Efficiency and Carbon Emission Reduction
by: Meizhen Gao
Published: (2024)