AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Chen, Gong, Xueluan, Liu, Ziyao, Jiang, Weifeng, Goh, Si Qi, Lam, Kwok-Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Neutralizing Backdoors through Information Conflicts for Large Language Models
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems
di: Gao, Jiaxin, et al.
Pubblicazione: (2025)
di: Gao, Jiaxin, et al.
Pubblicazione: (2025)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
FROC: A Unified Framework with Risk-Optimized Control for Machine Unlearning in LLMs
di: Goh, Si Qi, et al.
Pubblicazione: (2025)
di: Goh, Si Qi, et al.
Pubblicazione: (2025)
Efficient Privacy-Preserving Retrieval Augmented Generation with Distance-Preserving Encryption
di: Ye, Huanyi, et al.
Pubblicazione: (2026)
di: Ye, Huanyi, et al.
Pubblicazione: (2026)
Large Language Models for Causal Discovery: Current Landscape and Future Directions
di: Wan, Guangya, et al.
Pubblicazione: (2024)
di: Wan, Guangya, et al.
Pubblicazione: (2024)
Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
di: Zhou, Kaiyu, et al.
Pubblicazione: (2026)
Graph World Models: Concepts, Taxonomy, and Future Directions
di: Liu, Jiawei, et al.
Pubblicazione: (2026)
di: Liu, Jiawei, et al.
Pubblicazione: (2026)
A Survey on Federated Unlearning: Challenges, Methods, and Future Directions
di: Liu, Ziyao, et al.
Pubblicazione: (2023)
di: Liu, Ziyao, et al.
Pubblicazione: (2023)
Theory of Mind in Large Language Models: Assessment and Enhancement
di: Chen, Ruirui, et al.
Pubblicazione: (2025)
di: Chen, Ruirui, et al.
Pubblicazione: (2025)
A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions
di: Shorinwa, Ola, et al.
Pubblicazione: (2024)
di: Shorinwa, Ola, et al.
Pubblicazione: (2024)
Federated Large Language Models: Feasibility, Robustness, Security and Future Directions
di: Jiang, Wenhao, et al.
Pubblicazione: (2025)
di: Jiang, Wenhao, et al.
Pubblicazione: (2025)
Consistency in Language Models: Current Landscape, Challenges, and Future Directions
di: Novikova, Jekaterina, et al.
Pubblicazione: (2025)
di: Novikova, Jekaterina, et al.
Pubblicazione: (2025)
Guaranteeing Data Privacy in Federated Unlearning with Dynamic User Participation
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
Deep Learning Approaches for Anti-Money Laundering on Mobile Transactions: Review, Framework, and Directions
di: Fan, Jiani, et al.
Pubblicazione: (2025)
di: Fan, Jiani, et al.
Pubblicazione: (2025)
Privacy in Fine-tuning Large Language Models: Attacks, Defenses, and Future Directions
di: Du, Hao, et al.
Pubblicazione: (2024)
di: Du, Hao, et al.
Pubblicazione: (2024)
Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities
di: Bei, Yuanchen, et al.
Pubblicazione: (2025)
di: Bei, Yuanchen, et al.
Pubblicazione: (2025)
Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
di: Chen, Chen, et al.
Pubblicazione: (2026)
di: Chen, Chen, et al.
Pubblicazione: (2026)
A Learning-based Incentive Mechanism for Mobile AIGC Service in Decentralized Internet of Vehicles
di: Fan, Jiani, et al.
Pubblicazione: (2024)
di: Fan, Jiani, et al.
Pubblicazione: (2024)
SafeRBench: Dissecting the Reasoning Safety of Large Language Models
di: Gao, Xin, et al.
Pubblicazione: (2025)
di: Gao, Xin, et al.
Pubblicazione: (2025)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
di: Xu, Yuming, et al.
Pubblicazione: (2026)
di: Xu, Yuming, et al.
Pubblicazione: (2026)
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
di: Li, Wenjuan, et al.
Pubblicazione: (2026)
di: Li, Wenjuan, et al.
Pubblicazione: (2026)
Proactive Detection of Physical Inter-rule Vulnerabilities in IoT Services Using a Deep Learning Approach
di: Huang, Bing, et al.
Pubblicazione: (2024)
di: Huang, Bing, et al.
Pubblicazione: (2024)
On the Trustworthiness Landscape of State-of-the-art Generative Models: A Survey and Outlook
di: Fan, Mingyuan, et al.
Pubblicazione: (2023)
di: Fan, Mingyuan, et al.
Pubblicazione: (2023)
Are Large Language Models a Good Replacement of Taxonomies?
di: Sun, Yushi, et al.
Pubblicazione: (2024)
di: Sun, Yushi, et al.
Pubblicazione: (2024)
Taxonomy Inference for Tabular Data Using Large Language Models
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
A Survey of Personalized Large Language Models: Progress and Future Directions
di: Liu, Jiahong, et al.
Pubblicazione: (2025)
di: Liu, Jiahong, et al.
Pubblicazione: (2025)
Survey on Large Language Model-Enhanced Reinforcement Learning: Concept, Taxonomy, and Methods
di: Cao, Yuji, et al.
Pubblicazione: (2024)
di: Cao, Yuji, et al.
Pubblicazione: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
di: Xue, Dong, et al.
Pubblicazione: (2025)
di: Xue, Dong, et al.
Pubblicazione: (2025)
SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
di: Hong, Hanbin, et al.
Pubblicazione: (2025)
Hidden Data Privacy Breaches in Federated Learning
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
RouterDC: Query-Based Router by Dual Contrastive Learning for Assembling Large Language Models
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
di: Chen, Shuhao, et al.
Pubblicazione: (2024)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
di: Li, Miles Q., et al.
Pubblicazione: (2026)
di: Li, Miles Q., et al.
Pubblicazione: (2026)
Learning Safety Constraints for Large Language Models
di: Chen, Xin, et al.
Pubblicazione: (2025)
di: Chen, Xin, et al.
Pubblicazione: (2025)
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
di: Li, Haoming, et al.
Pubblicazione: (2024)
di: Li, Haoming, et al.
Pubblicazione: (2024)
Quantum Machine Learning for Cybersecurity: A Taxonomy and Future Directions
di: Sai, Siva, et al.
Pubblicazione: (2025)
di: Sai, Siva, et al.
Pubblicazione: (2025)
Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents
di: V, Arunkumar, et al.
Pubblicazione: (2026)
di: V, Arunkumar, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Neutralizing Backdoors through Information Conflicts for Large Language Models
di: Chen, Chen, et al.
Pubblicazione: (2024) -
Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
di: Chen, Chen, et al.
Pubblicazione: (2025) -
Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems
di: Gao, Jiaxin, et al.
Pubblicazione: (2025) -
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
di: Chen, Chen, et al.
Pubblicazione: (2026) -
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
di: Gong, Xueluan, et al.
Pubblicazione: (2024)