Building Guardrails for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Yi, Mu, Ronghui, Jin, Gaojie, Qi, Yi, Hu, Jinwei, Zhao, Xingyu, Meng, Jie, Ruan, Wenjie, Huang, Xiaowei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Trust-Oriented Adaptive Guardrails for Large Language Models
by: Hu, Jinwei, et al.
Published: (2024)
by: Hu, Jinwei, et al.
Published: (2024)
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
by: Hu, Jinwei, et al.
Published: (2025)
by: Hu, Jinwei, et al.
Published: (2025)
Safeguarding Large Language Models: A Survey
by: Dong, Yi, et al.
Published: (2024)
by: Dong, Yi, et al.
Published: (2024)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
by: Yin, Xiangyu, et al.
Published: (2025)
by: Yin, Xiangyu, et al.
Published: (2025)
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
by: Qi, Yi, et al.
Published: (2023)
by: Qi, Yi, et al.
Published: (2023)
Invariant Correlation of Representation with Label: Enhancing Domain Generalization in Noisy Environments
by: Jin, Gaojie, et al.
Published: (2024)
by: Jin, Gaojie, et al.
Published: (2024)
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
by: Li, Zhuoyun, et al.
Published: (2026)
by: Li, Zhuoyun, et al.
Published: (2026)
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
by: Hu, Jinwei, et al.
Published: (2026)
by: Hu, Jinwei, et al.
Published: (2026)
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
by: Li, Zhuoyun, et al.
Published: (2026)
by: Li, Zhuoyun, et al.
Published: (2026)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
by: Li, Xinyu, et al.
Published: (2025)
by: Li, Xinyu, et al.
Published: (2025)
Responsible Agentic AI Requires Explicit Provenance
by: Hu, Jinwei, et al.
Published: (2026)
by: Hu, Jinwei, et al.
Published: (2026)
CluCERT: Certifying LLM Robustness via Clustering-Guided Denoising Smoothing
by: Wang, Zixia, et al.
Published: (2025)
by: Wang, Zixia, et al.
Published: (2025)
DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing
by: Hu, Jinwei, et al.
Published: (2026)
by: Hu, Jinwei, et al.
Published: (2026)
Reconcile Certified Robustness and Accuracy for DNN-based Smoothed Majority Vote Classifier
by: Jin, Gaojie, et al.
Published: (2025)
by: Jin, Gaojie, et al.
Published: (2025)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
by: Zhuang, Jun, et al.
Published: (2025)
by: Zhuang, Jun, et al.
Published: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
by: Yuan, Zhuowen, et al.
Published: (2024)
by: Yuan, Zhuowen, et al.
Published: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
by: Huang, Tiansheng, et al.
Published: (2025)
by: Huang, Tiansheng, et al.
Published: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
by: Lee, JoonHo, et al.
Published: (2025)
by: Lee, JoonHo, et al.
Published: (2025)
LLM4Sweat: A Trustworthy Large Language Model for Hyperhidrosis Support
by: Lin, Wenjie, et al.
Published: (2025)
by: Lin, Wenjie, et al.
Published: (2025)
Enhancing Robustness of LLM-Driven Multi-Agent Systems through Randomized Smoothing
by: Hu, Jinwei, et al.
Published: (2025)
by: Hu, Jinwei, et al.
Published: (2025)
Research on Predicting Public Opinion Event Heat Levels Based on Large Language Models
by: Ren, Yi, et al.
Published: (2024)
by: Ren, Yi, et al.
Published: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
by: Oh, Sejoon, et al.
Published: (2024)
by: Oh, Sejoon, et al.
Published: (2024)
Citation: A Key to Building Responsible and Accountable Large Language Models
by: Huang, Jie, et al.
Published: (2023)
by: Huang, Jie, et al.
Published: (2023)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
by: Shahani, Prithviraj Singh, et al.
Published: (2025)
by: Shahani, Prithviraj Singh, et al.
Published: (2025)
Generating Reading Comprehension Exercises with Large Language Models for Educational Applications
by: Huang, Xingyu, et al.
Published: (2025)
by: Huang, Xingyu, et al.
Published: (2025)
The Impact of Reasoning Step Length on Large Language Models
by: Jin, Mingyu, et al.
Published: (2024)
by: Jin, Mingyu, et al.
Published: (2024)
CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety
by: An, Heajun, et al.
Published: (2026)
by: An, Heajun, et al.
Published: (2026)
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
by: He, Wei, et al.
Published: (2024)
by: He, Wei, et al.
Published: (2024)
XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models
by: Dong, Yixin, et al.
Published: (2024)
by: Dong, Yixin, et al.
Published: (2024)
Shapley Uncertainty in Natural Language Generation
by: Zhu, Meilin, et al.
Published: (2025)
by: Zhu, Meilin, et al.
Published: (2025)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
by: Owiredu-Ashley, Harry
Published: (2026)
by: Owiredu-Ashley, Harry
Published: (2026)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
by: Liu, Mingjie, et al.
Published: (2025)
by: Liu, Mingjie, et al.
Published: (2025)
TLoRA: Task-aware Low Rank Adaptation of Large Language Models
by: Lin, Weicheng, et al.
Published: (2026)
by: Lin, Weicheng, et al.
Published: (2026)
Reachability Verification Based Reliability Assessment for Deep Reinforcement Learning Controlled Robotics and Autonomous Systems
by: Dong, Yi, et al.
Published: (2022)
by: Dong, Yi, et al.
Published: (2022)
Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
by: Huang, Yue, et al.
Published: (2025)
by: Huang, Yue, et al.
Published: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
by: Yu, Pengfei, et al.
Published: (2025)
by: Yu, Pengfei, et al.
Published: (2025)
A Survey on Collaborative Mechanisms Between Large and Small Language Models
by: Chen, Yi, et al.
Published: (2025)
by: Chen, Yi, et al.
Published: (2025)
Evaluating Ill-Defined Tasks in Large Language Models
by: Zhou, Yi, et al.
Published: (2026)
by: Zhou, Yi, et al.
Published: (2026)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
by: Elesedy, Hayder, et al.
Published: (2024)
by: Elesedy, Hayder, et al.
Published: (2024)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
by: Zou, Minghui, et al.
Published: (2024)
by: Zou, Minghui, et al.
Published: (2024)
Similar Items
-
Trust-Oriented Adaptive Guardrails for Large Language Models
by: Hu, Jinwei, et al.
Published: (2024) -
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
by: Hu, Jinwei, et al.
Published: (2025) -
Safeguarding Large Language Models: A Survey
by: Dong, Yi, et al.
Published: (2024) -
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
by: Yin, Xiangyu, et al.
Published: (2025) -
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
by: Qi, Yi, et al.
Published: (2023)