Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Krishna, Arjun, Galinkin, Erick, Derczynski, Leon, Martin, Jeffrey |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
garak: A Framework for Security Probing Large Language Models
par: Derczynski, Leon, et autres
Publié: (2024)
par: Derczynski, Leon, et autres
Publié: (2024)
Weakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models
par: Krishna, Arjun, et autres
Publié: (2025)
par: Krishna, Arjun, et autres
Publié: (2025)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
par: Galinkin, Erick, et autres
Publié: (2024)
par: Galinkin, Erick, et autres
Publié: (2024)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
par: Price, Sara, et autres
Publié: (2024)
par: Price, Sara, et autres
Publié: (2024)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)
par: Chaudhari, Harsh, et autres
Publié: (2024)
Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming
par: Inie, Nanna, et autres
Publié: (2023)
par: Inie, Nanna, et autres
Publié: (2023)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs
par: Liu, Ruixuan, et autres
Publié: (2026)
par: Liu, Ruixuan, et autres
Publié: (2026)
How Vulnerable Are Edge LLMs?
par: Ding, Ao, et autres
Publié: (2026)
par: Ding, Ao, et autres
Publié: (2026)
Training a General Purpose Automated Red Teaming Model
par: Padmakumar, Aishwarya, et autres
Publié: (2026)
par: Padmakumar, Aishwarya, et autres
Publié: (2026)
Towards Type Agnostic Cyber Defense Agents
par: Galinkin, Erick, et autres
Publié: (2024)
par: Galinkin, Erick, et autres
Publié: (2024)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2025)
par: Liang, Buyun, et autres
Publié: (2025)
LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning
par: Spracklen, Joseph, et autres
Publié: (2026)
par: Spracklen, Joseph, et autres
Publié: (2026)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2026)
par: Liang, Buyun, et autres
Publié: (2026)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
par: Sivapiromrat, Sanhanat, et autres
Publié: (2025)
par: Sivapiromrat, Sanhanat, et autres
Publié: (2025)
Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability
par: García-Carrasco, Jorge, et autres
Publié: (2024)
par: García-Carrasco, Jorge, et autres
Publié: (2024)
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
par: Liu, Frank Weizhen, et autres
Publié: (2024)
par: Liu, Frank Weizhen, et autres
Publié: (2024)
Systematically Analyzing Prompt Injection Vulnerabilities in Diverse LLM Architectures
par: Benjamin, Victoria, et autres
Publié: (2024)
par: Benjamin, Victoria, et autres
Publié: (2024)
Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
par: Zhao, Andrew, et autres
Publié: (2025)
par: Zhao, Andrew, et autres
Publié: (2025)
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
par: Shetty, Anudeex, et autres
Publié: (2024)
par: Shetty, Anudeex, et autres
Publié: (2024)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
par: Shetty, Anudeex, et autres
Publié: (2026)
par: Shetty, Anudeex, et autres
Publié: (2026)
The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
par: Makroo, Owais, et autres
Publié: (2025)
par: Makroo, Owais, et autres
Publié: (2025)
InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy
par: Vinod, Vishnu, et autres
Publié: (2025)
par: Vinod, Vishnu, et autres
Publié: (2025)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
par: Ahmed, Mohamed, et autres
Publié: (2025)
par: Ahmed, Mohamed, et autres
Publié: (2025)
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)
par: Xiong, Alexander, et autres
Publié: (2025)
LLM Unlearning Should Be Form-Independent
par: Ye, Xiaotian, et autres
Publié: (2025)
par: Ye, Xiaotian, et autres
Publié: (2025)
GCG Attack On A Diffusion LLM
par: Neyroud, Ruben, et autres
Publié: (2025)
par: Neyroud, Ruben, et autres
Publié: (2025)
Localizing Malicious Outputs from CodeLLM
par: Borana, Mayukh, et autres
Publié: (2025)
par: Borana, Mayukh, et autres
Publié: (2025)
LLMGuard: Guarding Against Unsafe LLM Behavior
par: Goyal, Shubh, et autres
Publié: (2024)
par: Goyal, Shubh, et autres
Publié: (2024)
Sparse Autoencoders are Capable LLM Jailbreak Mitigators
par: Assogba, Yannick, et autres
Publié: (2026)
par: Assogba, Yannick, et autres
Publié: (2026)
Using Hallucinations to Bypass GPT4's Filter
par: Lemkin, Benjamin
Publié: (2024)
par: Lemkin, Benjamin
Publié: (2024)
Improving LLM Safety Alignment with Dual-Objective Optimization
par: Zhao, Xuandong, et autres
Publié: (2025)
par: Zhao, Xuandong, et autres
Publié: (2025)
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
par: Duan, Haohua, et autres
Publié: (2025)
par: Duan, Haohua, et autres
Publié: (2025)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
par: Wang, Tianchun, et autres
Publié: (2024)
par: Wang, Tianchun, et autres
Publié: (2024)
Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent
par: Zhang, Boyang, et autres
Publié: (2026)
par: Zhang, Boyang, et autres
Publié: (2026)
User Inference Attacks on Large Language Models
par: Kandpal, Nikhil, et autres
Publié: (2023)
par: Kandpal, Nikhil, et autres
Publié: (2023)
Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness
par: Shafee, Samaneh, et autres
Publié: (2024)
par: Shafee, Samaneh, et autres
Publié: (2024)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
par: Liang, Jiacheng, et autres
Publié: (2024)
par: Liang, Jiacheng, et autres
Publié: (2024)
LLM Dataset Inference: Did you train on my dataset?
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
Documents similaires
-
garak: A Framework for Security Probing Large Language Models
par: Derczynski, Leon, et autres
Publié: (2024) -
Weakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models
par: Krishna, Arjun, et autres
Publié: (2025) -
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
par: Galinkin, Erick, et autres
Publié: (2024) -
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
par: Price, Sara, et autres
Publié: (2024) -
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
par: Chaudhari, Harsh, et autres
Publié: (2024)