A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Pinacho-Davidson, Pedro, Gutierrez, Fernando, Zapata, Pablo, Vergara, Rodolfo, Aqueveque, Pablo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AbuseGPT: Abuse of Generative AI ChatBots to Create Smishing Campaigns
di: Shibli, Ashfak Md, et al.
Pubblicazione: (2024)
di: Shibli, Ashfak Md, et al.
Pubblicazione: (2024)
A Large-Scale Study of Telegram Bots
di: Tsuchiya, Taro, et al.
Pubblicazione: (2026)
di: Tsuchiya, Taro, et al.
Pubblicazione: (2026)
Auditing Pay-Per-Token in Large Language Models
di: Velasco, Ander Artola, et al.
Pubblicazione: (2025)
di: Velasco, Ander Artola, et al.
Pubblicazione: (2025)
Bots can Snoop: Uncovering and Mitigating Privacy Risks of Bots in Group Chats
di: Chou, Kai-Hsiang, et al.
Pubblicazione: (2024)
di: Chou, Kai-Hsiang, et al.
Pubblicazione: (2024)
A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models
di: Tao, Zhen, et al.
Pubblicazione: (2025)
di: Tao, Zhen, et al.
Pubblicazione: (2025)
Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models
di: Erol, Abdulkadir, et al.
Pubblicazione: (2025)
di: Erol, Abdulkadir, et al.
Pubblicazione: (2025)
User Privacy and Large Language Models: An Analysis of Frontier Developers' Privacy Policies
di: King, Jennifer, et al.
Pubblicazione: (2025)
di: King, Jennifer, et al.
Pubblicazione: (2025)
Guardrails for trust, safety, and ethical development and deployment of Large Language Models (LLM)
di: Biswas, Anjanava, et al.
Pubblicazione: (2026)
di: Biswas, Anjanava, et al.
Pubblicazione: (2026)
An Evaluation of Chat Safety Moderations in Roblox
di: Kaushik, Priya, et al.
Pubblicazione: (2026)
di: Kaushik, Priya, et al.
Pubblicazione: (2026)
BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models
di: Sachdeva, Arush, et al.
Pubblicazione: (2025)
di: Sachdeva, Arush, et al.
Pubblicazione: (2025)
ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI
di: Tong, Haibo, et al.
Pubblicazione: (2026)
di: Tong, Haibo, et al.
Pubblicazione: (2026)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities
di: Kouremetis, Michael, et al.
Pubblicazione: (2025)
di: Kouremetis, Michael, et al.
Pubblicazione: (2025)
ClausewitzGPT Framework: A New Frontier in Theoretical Large Language Model Enhanced Information Operations
di: Kereopa-Yorke, Benjamin
Pubblicazione: (2023)
di: Kereopa-Yorke, Benjamin
Pubblicazione: (2023)
AI Risk-Management Standards Profile for General-Purpose AI (GPAI) and Foundation Models
di: Barrett, Anthony M., et al.
Pubblicazione: (2025)
di: Barrett, Anthony M., et al.
Pubblicazione: (2025)
From Chat Control to Robot Control: Implications of the Chat Control Proposal for Human-Robot Interaction
di: Akalin, Neziha, et al.
Pubblicazione: (2026)
di: Akalin, Neziha, et al.
Pubblicazione: (2026)
Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
di: Zhang, Andy K., et al.
Pubblicazione: (2024)
di: Zhang, Andy K., et al.
Pubblicazione: (2024)
Binge, Bot, Repeat: Unpacking the Ecosystem of Video Piracy on Telegram
di: Gyawali, Sadikshya, et al.
Pubblicazione: (2026)
di: Gyawali, Sadikshya, et al.
Pubblicazione: (2026)
Watermarking Discrete Diffusion Language Models
di: Bagchi, Avi, et al.
Pubblicazione: (2025)
di: Bagchi, Avi, et al.
Pubblicazione: (2025)
Phare: A Safety Probe for Large Language Models
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
Attacks on Third-Party APIs of Large Language Models
di: Zhao, Wanru, et al.
Pubblicazione: (2024)
di: Zhao, Wanru, et al.
Pubblicazione: (2024)
ChestyBot: Detecting and Disrupting Chinese Communist Party Influence Stratagems
di: Stoffolano, Matthew, et al.
Pubblicazione: (2025)
di: Stoffolano, Matthew, et al.
Pubblicazione: (2025)
Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation
di: Heiding, Fred, et al.
Pubblicazione: (2025)
di: Heiding, Fred, et al.
Pubblicazione: (2025)
Synthetic Data: Methods, Use Cases, and Risks
di: De Cristofaro, Emiliano
Pubblicazione: (2023)
di: De Cristofaro, Emiliano
Pubblicazione: (2023)
Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts
di: Downey-Webb, Tiarnaigh, et al.
Pubblicazione: (2025)
di: Downey-Webb, Tiarnaigh, et al.
Pubblicazione: (2025)
Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams
di: Gressel, Gilad, et al.
Pubblicazione: (2025)
di: Gressel, Gilad, et al.
Pubblicazione: (2025)
Beyond Context: Large Language Models' Failure to Grasp Users' Intent
di: Hussain, Ahmed M., et al.
Pubblicazione: (2025)
di: Hussain, Ahmed M., et al.
Pubblicazione: (2025)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
di: Ding, Junchen, et al.
Pubblicazione: (2025)
di: Ding, Junchen, et al.
Pubblicazione: (2025)
AuditGPT: Auditing Smart Contracts with ChatGPT
di: Xia, Shihao, et al.
Pubblicazione: (2024)
di: Xia, Shihao, et al.
Pubblicazione: (2024)
Negotiating Privacy with Smart Voice Assistants: Risk-Benefit and Control-Acceptance Tensions
di: Campbell, Molly, et al.
Pubblicazione: (2026)
di: Campbell, Molly, et al.
Pubblicazione: (2026)
Leveraging Large Language Models for Preliminary Security Risk Analysis: A Mission-Critical Case Study
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
RLCP: A Reinforcement Learning-based Copyright Protection Method for Text-to-Image Diffusion Model
di: Shi, Zhuan, et al.
Pubblicazione: (2024)
di: Shi, Zhuan, et al.
Pubblicazione: (2024)
DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing
di: Qiao, Ting, et al.
Pubblicazione: (2025)
di: Qiao, Ting, et al.
Pubblicazione: (2025)
Evaluating the Critical Risks of Amazon's Nova Premier under the Frontier Model Safety Framework
di: Krishna, Satyapriya, et al.
Pubblicazione: (2025)
di: Krishna, Satyapriya, et al.
Pubblicazione: (2025)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
di: Shvartzshnaider, Yan, et al.
Pubblicazione: (2024)
The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
di: Canale, Giuseppe, et al.
Pubblicazione: (2025)
di: Canale, Giuseppe, et al.
Pubblicazione: (2025)
Analysing Multidisciplinary Approaches to Fight Large-Scale Digital Influence Operations
di: Arroyo, David, et al.
Pubblicazione: (2025)
di: Arroyo, David, et al.
Pubblicazione: (2025)
Can LLMs Infer Conversational Agent Users' Personality Traits from Chat History?
di: Cögendez, Derya, et al.
Pubblicazione: (2026)
di: Cögendez, Derya, et al.
Pubblicazione: (2026)
Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models
di: Westphal, Charles, et al.
Pubblicazione: (2026)
di: Westphal, Charles, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AbuseGPT: Abuse of Generative AI ChatBots to Create Smishing Campaigns
di: Shibli, Ashfak Md, et al.
Pubblicazione: (2024) -
A Large-Scale Study of Telegram Bots
di: Tsuchiya, Taro, et al.
Pubblicazione: (2026) -
Auditing Pay-Per-Token in Large Language Models
di: Velasco, Ander Artola, et al.
Pubblicazione: (2025) -
Bots can Snoop: Uncovering and Mitigating Privacy Risks of Bots in Group Chats
di: Chou, Kai-Hsiang, et al.
Pubblicazione: (2024) -
A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models
di: Tao, Zhen, et al.
Pubblicazione: (2025)