A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Huandong, Fu, Wenjie, Tang, Yingzhou, Chen, Zhilong, Huang, Yuxi, Piao, Jinghua, Gao, Chen, Xu, Fengli, Jiang, Tao, Li, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
par: Fu, Wenjie, et autres
Publié: (2025)
par: Fu, Wenjie, et autres
Publié: (2025)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation
par: Brundage, Miles, et autres
Publié: (2018)
par: Brundage, Miles, et autres
Publié: (2018)
A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak
par: Gu, Haoran, et autres
Publié: (2026)
par: Gu, Haoran, et autres
Publié: (2026)
Mitigating Cyber Risk in the Age of Open-Weight LLMs: Policy Gaps and Technical Realities
par: de Gregorio, Alfonso
Publié: (2025)
par: de Gregorio, Alfonso
Publié: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
par: Yeo, Wei Jie, et autres
Publié: (2025)
par: Yeo, Wei Jie, et autres
Publié: (2025)
On the Inherent Anonymity of Gossiping
par: Guerraoui, Rachid, et autres
Publié: (2023)
par: Guerraoui, Rachid, et autres
Publié: (2023)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
par: Shen, Xinjie, et autres
Publié: (2026)
par: Shen, Xinjie, et autres
Publié: (2026)
Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures
par: Zhou, Yukai, et autres
Publié: (2025)
par: Zhou, Yukai, et autres
Publié: (2025)
Securing Proof of Stake Blockchains: Leveraging Multi-Agent Reinforcement Learning for Detecting and Mitigating Malicious Nodes
par: Bappy, Faisal Haque, et autres
Publié: (2024)
par: Bappy, Faisal Haque, et autres
Publié: (2024)
Reformulation is All You Need: Addressing Malicious Text Features in DNNs
par: Jiang, Yi, et autres
Publié: (2025)
par: Jiang, Yi, et autres
Publié: (2025)
Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective
par: Tshimula, Jean Marie, et autres
Publié: (2024)
par: Tshimula, Jean Marie, et autres
Publié: (2024)
SoK: Privacy Risks and Mitigations in Retrieval-Augmented Generation Systems
par: Bodea, Andreea-Elena, et autres
Publié: (2026)
par: Bodea, Andreea-Elena, et autres
Publié: (2026)
A General Pseudonymization Framework for Cloud-Based LLMs: Replacing Privacy Information in Controlled Text Generation
par: Hou, Shilong, et autres
Publié: (2025)
par: Hou, Shilong, et autres
Publié: (2025)
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
par: Fu, Yu, et autres
Publié: (2024)
par: Fu, Yu, et autres
Publié: (2024)
A Comprehensive Survey of Unmanned Aerial Systems' Risks and Mitigation Strategies
par: Shrestha, Sharad, et autres
Publié: (2025)
par: Shrestha, Sharad, et autres
Publié: (2025)
Copyright in AI Pre-Training Data Filtering: Regulatory Landscape and Mitigation Strategies
par: Kyrychenko, Mariia, et autres
Publié: (2025)
par: Kyrychenko, Mariia, et autres
Publié: (2025)
Detecting Malicious Concepts without Image Generation in AI-Generated Content (AIGC)
par: Xu, Kun, et autres
Publié: (2025)
par: Xu, Kun, et autres
Publié: (2025)
Applying Pre-trained Multilingual BERT in Embeddings for Improved Malicious Prompt Injection Attacks Detection
par: Rahman, Md Abdur, et autres
Publié: (2024)
par: Rahman, Md Abdur, et autres
Publié: (2024)
Characterizing Event-themed Malicious Web Campaigns: A Case Study on War-themed Websites
par: Mia, Maraz, et autres
Publié: (2025)
par: Mia, Maraz, et autres
Publié: (2025)
SINCon: Mitigate LLM-Generated Malicious Message Injection Attack for Rumor Detection
par: Zhang, Mingqing, et autres
Publié: (2025)
par: Zhang, Mingqing, et autres
Publié: (2025)
Risks & Benefits of LLMs & GenAI for Platform Integrity, Healthcare Diagnostics, Financial Trust and Compliance, Cybersecurity, Privacy & AI Safety: A Comprehensive Survey, Roadmap & Implementation Blueprint
par: Ahi, Kiarash
Publié: (2025)
par: Ahi, Kiarash
Publié: (2025)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
par: Cao, Bochuan, et autres
Publié: (2025)
par: Cao, Bochuan, et autres
Publié: (2025)
CP-uniGuard: A Unified, Probability-Agnostic, and Adaptive Framework for Malicious Agent Detection and Defense in Multi-Agent Embodied Perception Systems
par: Hu, Senkang, et autres
Publié: (2025)
par: Hu, Senkang, et autres
Publié: (2025)
Localizing Malicious Outputs from CodeLLM
par: Borana, Mayukh, et autres
Publié: (2025)
par: Borana, Mayukh, et autres
Publié: (2025)
Mitigating Malicious Attacks in Federated Learning via Confidence-aware Defense
par: Li, Qilei, et autres
Publié: (2024)
par: Li, Qilei, et autres
Publié: (2024)
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)
par: Xiong, Alexander, et autres
Publié: (2025)
The Ethics of Interaction: Mitigating Security Threats in LLMs
par: Kumar, Ashutosh, et autres
Publié: (2024)
par: Kumar, Ashutosh, et autres
Publié: (2024)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
Can LLM Infer Risk Information From MCP Server System Logs?
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
Tracing Back the Malicious Clients in Poisoning Attacks to Federated Learning
par: Jia, Yuqi, et autres
Publié: (2024)
par: Jia, Yuqi, et autres
Publié: (2024)
Efficient Malicious UAV Detection Using Autoencoder-TSMamba Integration
par: Akhtarshenas, Azim, et autres
Publié: (2025)
par: Akhtarshenas, Azim, et autres
Publié: (2025)
TarPro: Targeted Protection against Malicious Image Editing
par: Shen, Kaixin, et autres
Publié: (2025)
par: Shen, Kaixin, et autres
Publié: (2025)
Pessimism of the Will, Optimism of the Intellect: Fair Protocols with Malicious but Rational Agents
par: Brice, Léonard, et autres
Publié: (2024)
par: Brice, Léonard, et autres
Publié: (2024)
The Midas Touch: Triggering the Capability of LLMs for RM-API Misuse Detection
par: Yang, Yi, et autres
Publié: (2024)
par: Yang, Yi, et autres
Publié: (2024)
SoK: The Privacy Paradox of Large Language Models: Advancements, Privacy Risks, and Mitigation
par: Shanmugarasa, Yashothara, et autres
Publié: (2025)
par: Shanmugarasa, Yashothara, et autres
Publié: (2025)
Documents similaires
-
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
par: Fu, Wenjie, et autres
Publié: (2025) -
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024) -
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023) -
The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation
par: Brundage, Miles, et autres
Publié: (2018) -
A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models
par: Fu, Wenjie, et autres
Publié: (2023)