Guardrails for avoiding harmful medical product recommendations and off-label promotion in generative AI models
Fuente:
arXiv
Salvato in:
| Autore principale: | Lopez-Martinez, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Guardrails for Safe and Secure Healthcare AI
di: Gangavarapu, Ananya
Pubblicazione: (2024)
di: Gangavarapu, Ananya
Pubblicazione: (2024)
Building Effective Safety Guardrails in AI Education Tools
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
A Comparative Evaluation of AI Agent Security Guardrails
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
First, do no harm: Breaking suicidogenic echo chambers in media recommendation
di: Díaz-Álvarez, Alberto, et al.
Pubblicazione: (2026)
di: Díaz-Álvarez, Alberto, et al.
Pubblicazione: (2026)
Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents
di: Kholkar, Gauri, et al.
Pubblicazione: (2025)
di: Kholkar, Gauri, et al.
Pubblicazione: (2025)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
di: She, Yining, et al.
Pubblicazione: (2025)
di: She, Yining, et al.
Pubblicazione: (2025)
AI driven health recommender
di: Vignesh, K., et al.
Pubblicazione: (2024)
di: Vignesh, K., et al.
Pubblicazione: (2024)
From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails
di: Pandya, Ravi, et al.
Pubblicazione: (2025)
di: Pandya, Ravi, et al.
Pubblicazione: (2025)
Current state of LLM Risks and AI Guardrails
di: Ayyamperumal, Suriya Ganesh, et al.
Pubblicazione: (2024)
di: Ayyamperumal, Suriya Ganesh, et al.
Pubblicazione: (2024)
No Free Lunch with Guardrails
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
di: Jin, Xisen, et al.
Pubblicazione: (2026)
di: Jin, Xisen, et al.
Pubblicazione: (2026)
Lattice: Generative Guardrails for Conversational Agents
di: Broadhurst, Emily, et al.
Pubblicazione: (2026)
di: Broadhurst, Emily, et al.
Pubblicazione: (2026)
Breaking Guardrails, Facing Walls: Insights on Adversarial AI for Defenders & Researchers
di: Bertollo, Giacomo, et al.
Pubblicazione: (2025)
di: Bertollo, Giacomo, et al.
Pubblicazione: (2025)
Characterizing and modeling harms from interactions with design patterns in AI interfaces
di: Ibrahim, Lujain, et al.
Pubblicazione: (2024)
di: Ibrahim, Lujain, et al.
Pubblicazione: (2024)
Challenges in Guardrailing Large Language Models for Science
di: Pantha, Nishan, et al.
Pubblicazione: (2024)
di: Pantha, Nishan, et al.
Pubblicazione: (2024)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
Safety Guardrails for LLM-Enabled Robots
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
Evaluating adaptive and generative AI-based feedback and recommendations in a knowledge-graph-integrated programming learning system
di: Nongkhai, Lalita Na, et al.
Pubblicazione: (2026)
di: Nongkhai, Lalita Na, et al.
Pubblicazione: (2026)
AI Harmonics: a human-centric and harms severity-adaptive AI risk assessment framework
di: Vei, Sofia, et al.
Pubblicazione: (2025)
di: Vei, Sofia, et al.
Pubblicazione: (2025)
Semantic Integrity Constraints: Declarative Guardrails for AI-Augmented Data Processing Systems
di: Lee, Alexander W., et al.
Pubblicazione: (2025)
di: Lee, Alexander W., et al.
Pubblicazione: (2025)
Learning Efficient Guardrails for Compliance
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
Building Guardrails for Large Language Models
di: Dong, Yi, et al.
Pubblicazione: (2024)
di: Dong, Yi, et al.
Pubblicazione: (2024)
Deep learning with noisy labels in medical prediction problems: a scoping review
di: Wei, Yishu, et al.
Pubblicazione: (2024)
di: Wei, Yishu, et al.
Pubblicazione: (2024)
A global log for medical AI
di: Noori, Ayush, et al.
Pubblicazione: (2025)
di: Noori, Ayush, et al.
Pubblicazione: (2025)
Behavioral Determinants of Deployed AI Agents in Social Networks: A Multi-Factor Study of Personality, Model, and Guardrail Specification
di: Wilson, Sarah, et al.
Pubblicazione: (2026)
di: Wilson, Sarah, et al.
Pubblicazione: (2026)
Generative AI for automatic topic labelling
di: Kozlowski, Diego, et al.
Pubblicazione: (2024)
di: Kozlowski, Diego, et al.
Pubblicazione: (2024)
Test-Time Training Undermines Safety Guardrails
di: Antonelli, Simone, et al.
Pubblicazione: (2026)
di: Antonelli, Simone, et al.
Pubblicazione: (2026)
A Lightweight Explainable Guardrail for Prompt Safety
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
Generalization in medical AI: a perspective on developing scalable models
di: Zvuloni, Eran, et al.
Pubblicazione: (2023)
di: Zvuloni, Eran, et al.
Pubblicazione: (2023)
Climbing the label tree: Hierarchy-preserving contrastive learning for medical imaging
di: Khan, Alif Elham
Pubblicazione: (2025)
di: Khan, Alif Elham
Pubblicazione: (2025)
Shift-Up: A Framework for Software Engineering Guardrails in AI-native Software Development -- Initial Findings
di: Lipsanen, Petrus, et al.
Pubblicazione: (2026)
di: Lipsanen, Petrus, et al.
Pubblicazione: (2026)
PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents
di: Wu, Yaozu, et al.
Pubblicazione: (2025)
di: Wu, Yaozu, et al.
Pubblicazione: (2025)
Bridging the Safety Gap: A Guardrail Pipeline for Trustworthy LLM Inferences
di: Han, Shanshan, et al.
Pubblicazione: (2025)
di: Han, Shanshan, et al.
Pubblicazione: (2025)
AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
di: Luo, Weidi, et al.
Pubblicazione: (2025)
di: Luo, Weidi, et al.
Pubblicazione: (2025)
MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support
di: Farinhas, António, et al.
Pubblicazione: (2026)
di: Farinhas, António, et al.
Pubblicazione: (2026)
"The Diagram is like Guardrails": Structuring GenAI-assisted Hypotheses Exploration with an Interactive Shared Representation
di: Ding, Zijian, et al.
Pubblicazione: (2025)
di: Ding, Zijian, et al.
Pubblicazione: (2025)
Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains
di: Ramnauth, Rebecca, et al.
Pubblicazione: (2026)
di: Ramnauth, Rebecca, et al.
Pubblicazione: (2026)
In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b
di: Durner, Nils
Pubblicazione: (2025)
di: Durner, Nils
Pubblicazione: (2025)
Trust-Oriented Adaptive Guardrails for Large Language Models
di: Hu, Jinwei, et al.
Pubblicazione: (2024)
di: Hu, Jinwei, et al.
Pubblicazione: (2024)
CodeGuard: Improving LLM Guardrails in CS Education
di: Raihan, Nishat, et al.
Pubblicazione: (2026)
di: Raihan, Nishat, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Guardrails for Safe and Secure Healthcare AI
di: Gangavarapu, Ananya
Pubblicazione: (2024) -
Building Effective Safety Guardrails in AI Education Tools
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025) -
A Comparative Evaluation of AI Agent Security Guardrails
di: Li, Qi, et al.
Pubblicazione: (2026) -
First, do no harm: Breaking suicidogenic echo chambers in media recommendation
di: Díaz-Álvarez, Alberto, et al.
Pubblicazione: (2026) -
Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents
di: Kholkar, Gauri, et al.
Pubblicazione: (2025)