Guardrails for trust, safety, and ethical development and deployment of Large Language Models (LLM)
Fuente:
arXiv
Saved in:
| Main Authors: | Biswas, Anjanava, Talukdar, Wrick |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Improving Large Language Model (LLM) fidelity through context-aware grounding: A systematic approach to reliability and veracity
by: Talukdar, Wrick, et al.
Published: (2024)
by: Talukdar, Wrick, et al.
Published: (2024)
Enhancing Clinical Documentation with Synthetic Data: Leveraging Generative Models for Improved Accuracy
by: Biswas, Anjanava, et al.
Published: (2024)
by: Biswas, Anjanava, et al.
Published: (2024)
FinEmbedDiff: A Cost-Effective Approach of Classifying Financial Documents with Vector Sampling using Multi-modal Embedding Models
by: Biswas, Anjanava, et al.
Published: (2024)
by: Biswas, Anjanava, et al.
Published: (2024)
Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation
by: Biswas, Anjanava, et al.
Published: (2024)
by: Biswas, Anjanava, et al.
Published: (2024)
Robustness of Structured Data Extraction from In-plane Rotated Documents using Multi-Modal Large Language Models (LLM)
by: Biswas, Anjanava, et al.
Published: (2024)
by: Biswas, Anjanava, et al.
Published: (2024)
Auditing Pay-Per-Token in Large Language Models
by: Velasco, Ander Artola, et al.
Published: (2025)
by: Velasco, Ander Artola, et al.
Published: (2025)
A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models
by: Tao, Zhen, et al.
Published: (2025)
by: Tao, Zhen, et al.
Published: (2025)
SGuard-v1: Safety Guardrail for Large Language Models
by: Lee, JoonHo, et al.
Published: (2025)
by: Lee, JoonHo, et al.
Published: (2025)
Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
by: Erol, Abdulkadir, et al.
Published: (2025)
by: Erol, Abdulkadir, et al.
Published: (2025)
User Privacy and Large Language Models: An Analysis of Frontier Developers' Privacy Policies
by: King, Jennifer, et al.
Published: (2025)
by: King, Jennifer, et al.
Published: (2025)
A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models
by: Pinacho-Davidson, Pedro, et al.
Published: (2025)
by: Pinacho-Davidson, Pedro, et al.
Published: (2025)
BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models
by: Sachdeva, Arush, et al.
Published: (2025)
by: Sachdeva, Arush, et al.
Published: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
by: Yuan, Zhuowen, et al.
Published: (2024)
by: Yuan, Zhuowen, et al.
Published: (2024)
Gas Station of the Future: A Perspective on AI/ML and IoT in Retail Downstream
by: Talukdar, Wrick
Published: (2025)
by: Talukdar, Wrick
Published: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
by: Wang, Xunguang, et al.
Published: (2025)
by: Wang, Xunguang, et al.
Published: (2025)
Phare: A Safety Probe for Large Language Models
by: Jeune, Pierre Le, et al.
Published: (2025)
by: Jeune, Pierre Le, et al.
Published: (2025)
Attacks on Third-Party APIs of Large Language Models
by: Zhao, Wanru, et al.
Published: (2024)
by: Zhao, Wanru, et al.
Published: (2024)
Watermarking Discrete Diffusion Language Models
by: Bagchi, Avi, et al.
Published: (2025)
by: Bagchi, Avi, et al.
Published: (2025)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
by: Owiredu-Ashley, Harry
Published: (2026)
by: Owiredu-Ashley, Harry
Published: (2026)
OneShield -- the Next Generation of LLM Guardrails
by: DeLuca, Chad, et al.
Published: (2025)
by: DeLuca, Chad, et al.
Published: (2025)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
by: Hussain, Ahmed M., et al.
Published: (2025)
by: Hussain, Ahmed M., et al.
Published: (2025)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
by: Ding, Junchen, et al.
Published: (2025)
by: Ding, Junchen, et al.
Published: (2025)
Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams
by: Gressel, Gilad, et al.
Published: (2025)
by: Gressel, Gilad, et al.
Published: (2025)
Detecting Verbatim LLM Copy-Paste in Homework
by: Aiersilan, Aizierjiang
Published: (2026)
by: Aiersilan, Aizierjiang
Published: (2026)
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
by: Das, Saswat, et al.
Published: (2026)
by: Das, Saswat, et al.
Published: (2026)
RedTeamLLM: an Agentic AI framework for offensive security
by: Challita, Brian, et al.
Published: (2025)
by: Challita, Brian, et al.
Published: (2025)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
by: Xu, Naen, et al.
Published: (2025)
by: Xu, Naen, et al.
Published: (2025)
Enforcing Cybersecurity Constraints for LLM-driven Robot Agents for Online Transactions
by: Shah, Shraddha Pradipbhai, et al.
Published: (2025)
by: Shah, Shraddha Pradipbhai, et al.
Published: (2025)
DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing
by: Qiao, Ting, et al.
Published: (2025)
by: Qiao, Ting, et al.
Published: (2025)
Synergizing Unsupervised and Supervised Learning: A Hybrid Approach for Accurate Natural Language Task Modeling
by: Talukdar, Wrick, et al.
Published: (2024)
by: Talukdar, Wrick, et al.
Published: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
by: Wang, Libo
Published: (2024)
by: Wang, Libo
Published: (2024)
The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
by: Canale, Giuseppe, et al.
Published: (2025)
by: Canale, Giuseppe, et al.
Published: (2025)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
by: Jiang, Fengqing, et al.
Published: (2025)
by: Jiang, Fengqing, et al.
Published: (2025)
Current state of LLM Risks and AI Guardrails
by: Ayyamperumal, Suriya Ganesh, et al.
Published: (2024)
by: Ayyamperumal, Suriya Ganesh, et al.
Published: (2024)
How Do Data Owners Say No? A Case Study of Data Consent Mechanisms in Web-Scraped Vision-Language AI Training Datasets
by: Lee, Chung Peng, et al.
Published: (2025)
by: Lee, Chung Peng, et al.
Published: (2025)
Governable AI: Provable Safety Under Extreme Threat Models
by: Wang, Donglin, et al.
Published: (2025)
by: Wang, Donglin, et al.
Published: (2025)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
by: Huang, Tiansheng, et al.
Published: (2025)
by: Huang, Tiansheng, et al.
Published: (2025)
On Technique Identification and Threat-Actor Attribution using LLMs and Embedding Models
by: Guru, Kyla, et al.
Published: (2025)
by: Guru, Kyla, et al.
Published: (2025)
Future-Back Threat Modeling: A Foresight-Driven Security Framework
by: Van Than, Vu
Published: (2025)
by: Van Than, Vu
Published: (2025)
Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation
by: Heiding, Fred, et al.
Published: (2025)
by: Heiding, Fred, et al.
Published: (2025)
Similar Items
-
Improving Large Language Model (LLM) fidelity through context-aware grounding: A systematic approach to reliability and veracity
by: Talukdar, Wrick, et al.
Published: (2024) -
Enhancing Clinical Documentation with Synthetic Data: Leveraging Generative Models for Improved Accuracy
by: Biswas, Anjanava, et al.
Published: (2024) -
FinEmbedDiff: A Cost-Effective Approach of Classifying Financial Documents with Vector Sampling using Multi-modal Embedding Models
by: Biswas, Anjanava, et al.
Published: (2024) -
Intelligent Clinical Documentation: Harnessing Generative AI for Patient-Centric Clinical Note Generation
by: Biswas, Anjanava, et al.
Published: (2024) -
Robustness of Structured Data Extraction from In-plane Rotated Documents using Multi-Modal Large Language Models (LLM)
by: Biswas, Anjanava, et al.
Published: (2024)