Trust-Oriented Adaptive Guardrails for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Jinwei, Dong, Yi, Huang, Xiaowei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Building Guardrails for Large Language Models
di: Dong, Yi, et al.
Pubblicazione: (2024)
di: Dong, Yi, et al.
Pubblicazione: (2024)
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
di: Hu, Jinwei, et al.
Pubblicazione: (2025)
di: Hu, Jinwei, et al.
Pubblicazione: (2025)
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
Responsible Agentic AI Requires Explicit Provenance
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context
di: Li, Victoria R., et al.
Pubblicazione: (2024)
di: Li, Victoria R., et al.
Pubblicazione: (2024)
Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
di: Zhuang, Jun, et al.
Pubblicazione: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
di: Jin, Xisen, et al.
Pubblicazione: (2026)
di: Jin, Xisen, et al.
Pubblicazione: (2026)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
di: Shahani, Prithviraj Singh, et al.
Pubblicazione: (2025)
di: Shahani, Prithviraj Singh, et al.
Pubblicazione: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
Safety Analysis in the Era of Large Language Models: A Case Study of STPA using ChatGPT
di: Qi, Yi, et al.
Pubblicazione: (2023)
di: Qi, Yi, et al.
Pubblicazione: (2023)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
di: Elesedy, Hayder, et al.
Pubblicazione: (2024)
di: Elesedy, Hayder, et al.
Pubblicazione: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
di: She, Yining, et al.
Pubblicazione: (2025)
di: She, Yining, et al.
Pubblicazione: (2025)
Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Towards Trustable Language Models: Investigating Information Quality of Large Language Models
di: Rejeleene, Rick, et al.
Pubblicazione: (2024)
di: Rejeleene, Rick, et al.
Pubblicazione: (2024)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
di: Sreedhar, Makesh Narsimhan, et al.
Pubblicazione: (2025)
di: Sreedhar, Makesh Narsimhan, et al.
Pubblicazione: (2025)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
di: Liu, Mingjie, et al.
Pubblicazione: (2025)
di: Liu, Mingjie, et al.
Pubblicazione: (2025)
Unified Multi-Task Learning & Model Fusion for Efficient Language Model Guardrailing
di: Neill, James O', et al.
Pubblicazione: (2025)
di: Neill, James O', et al.
Pubblicazione: (2025)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
di: Du, Silin, et al.
Pubblicazione: (2024)
di: Du, Silin, et al.
Pubblicazione: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
di: Wang, Libo
Pubblicazione: (2024)
di: Wang, Libo
Pubblicazione: (2024)
LLM-Oriented Token-Adaptive Knowledge Distillation
di: Xie, Xurong, et al.
Pubblicazione: (2025)
di: Xie, Xurong, et al.
Pubblicazione: (2025)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
di: Li, Wenjun, et al.
Pubblicazione: (2025)
di: Li, Wenjun, et al.
Pubblicazione: (2025)
Can Large Language Model Agents Simulate Human Trust Behavior?
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
di: Xie, Chengxing, et al.
Pubblicazione: (2024)
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
di: Cheng, Zifeng, et al.
Pubblicazione: (2025)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
di: Kazi, Taaha, et al.
Pubblicazione: (2024)
di: Kazi, Taaha, et al.
Pubblicazione: (2024)
Embedding-Informed Adaptive Retrieval-Augmented Generation of Large Language Models
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
di: Gu, Yuxian, et al.
Pubblicazione: (2023)
Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models
di: Yeo, Gerard, et al.
Pubblicazione: (2025)
di: Yeo, Gerard, et al.
Pubblicazione: (2025)
Building and Measuring Trust between Large Language Models
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
di: Buyl, Maarten, et al.
Pubblicazione: (2025)
Why Do Safety Guardrails Degrade Across Languages?
di: Zhang, Max, et al.
Pubblicazione: (2026)
di: Zhang, Max, et al.
Pubblicazione: (2026)
A Lightweight Explainable Guardrail for Prompt Safety
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Building Guardrails for Large Language Models
di: Dong, Yi, et al.
Pubblicazione: (2024) -
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
di: Hu, Jinwei, et al.
Pubblicazione: (2025) -
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
di: Li, Zhuoyun, et al.
Pubblicazione: (2026) -
Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
di: Hu, Jinwei, et al.
Pubblicazione: (2026) -
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)