Confidence Elicitation: A New Attack Vector for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Formento, Brian, Foo, Chuan Sheng, Ng, See-Kiong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SemRoDe: Macro Adversarial Training to Learn Representations That are Robust to Word-Level Attacks
von: Formento, Brian, et al.
Veröffentlicht: (2024)
von: Formento, Brian, et al.
Veröffentlicht: (2024)
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
von: Liu, Renyang, et al.
Veröffentlicht: (2025)
von: Liu, Renyang, et al.
Veröffentlicht: (2025)
User Inference Attacks on Large Language Models
von: Kandpal, Nikhil, et al.
Veröffentlicht: (2023)
von: Kandpal, Nikhil, et al.
Veröffentlicht: (2023)
Composite Backdoor Attacks Against Large Language Models
von: Huang, Hai, et al.
Veröffentlicht: (2023)
von: Huang, Hai, et al.
Veröffentlicht: (2023)
TFL: Targeted Bit-Flip Attack on Large Language Model
von: Guo, Jingkai, et al.
Veröffentlicht: (2026)
von: Guo, Jingkai, et al.
Veröffentlicht: (2026)
An Early Categorization of Prompt Injection Attacks on Large Language Models
von: Rossi, Sippo, et al.
Veröffentlicht: (2024)
von: Rossi, Sippo, et al.
Veröffentlicht: (2024)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
von: Biswas, Sajib, et al.
Veröffentlicht: (2025)
von: Biswas, Sajib, et al.
Veröffentlicht: (2025)
Securing Large Language Models (LLMs) from Prompt Injection Attacks
von: Suri, Omar Farooq Khan, et al.
Veröffentlicht: (2025)
von: Suri, Omar Farooq Khan, et al.
Veröffentlicht: (2025)
SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
von: Guo, Jingkai, et al.
Veröffentlicht: (2025)
von: Guo, Jingkai, et al.
Veröffentlicht: (2025)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
von: Yang, Ziqing, et al.
Veröffentlicht: (2024)
Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
von: You, Weiqiu, et al.
Veröffentlicht: (2024)
von: You, Weiqiu, et al.
Veröffentlicht: (2024)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
von: Liang, Buyun, et al.
Veröffentlicht: (2025)
von: Liang, Buyun, et al.
Veröffentlicht: (2025)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
von: Liang, Buyun, et al.
Veröffentlicht: (2026)
von: Liang, Buyun, et al.
Veröffentlicht: (2026)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
von: He, Jiaming, et al.
Veröffentlicht: (2024)
von: He, Jiaming, et al.
Veröffentlicht: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
von: Fu, Wenjie, et al.
Veröffentlicht: (2023)
von: Fu, Wenjie, et al.
Veröffentlicht: (2023)
A Watermark for Large Language Models
von: Kirchenbauer, John, et al.
Veröffentlicht: (2023)
von: Kirchenbauer, John, et al.
Veröffentlicht: (2023)
The Resurgence of GCG Adversarial Attacks on Large Language Models
von: Tan, Yuting, et al.
Veröffentlicht: (2025)
von: Tan, Yuting, et al.
Veröffentlicht: (2025)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
von: Xue, Eric, et al.
Veröffentlicht: (2025)
von: Xue, Eric, et al.
Veröffentlicht: (2025)
Cross-Entropy Attacks to Language Models via Rare Event Simulation
von: Ni, Mingze, et al.
Veröffentlicht: (2025)
von: Ni, Mingze, et al.
Veröffentlicht: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition
von: Xu, Zhenhua, et al.
Veröffentlicht: (2024)
von: Xu, Zhenhua, et al.
Veröffentlicht: (2024)
Model Provenance Testing for Large Language Models
von: Nikolic, Ivica, et al.
Veröffentlicht: (2025)
von: Nikolic, Ivica, et al.
Veröffentlicht: (2025)
SPML: A DSL for Defending Language Models Against Prompt Attacks
von: Sharma, Reshabh K, et al.
Veröffentlicht: (2024)
von: Sharma, Reshabh K, et al.
Veröffentlicht: (2024)
On the Reliability of Watermarks for Large Language Models
von: Kirchenbauer, John, et al.
Veröffentlicht: (2023)
von: Kirchenbauer, John, et al.
Veröffentlicht: (2023)
Beyond Gradient and Priors in Privacy Attacks: Leveraging Pooler Layer Inputs of Language Models in Federated Learning
von: Li, Jianwei, et al.
Veröffentlicht: (2023)
von: Li, Jianwei, et al.
Veröffentlicht: (2023)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
von: Sitawarin, Chawin, et al.
Veröffentlicht: (2024)
von: Sitawarin, Chawin, et al.
Veröffentlicht: (2024)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
von: Roth, Tom, et al.
Veröffentlicht: (2021)
von: Roth, Tom, et al.
Veröffentlicht: (2021)
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
von: Liu, Frank Weizhen, et al.
Veröffentlicht: (2024)
von: Liu, Frank Weizhen, et al.
Veröffentlicht: (2024)
Representation Bending for Large Language Model Safety
von: Yousefpour, Ashkan, et al.
Veröffentlicht: (2025)
von: Yousefpour, Ashkan, et al.
Veröffentlicht: (2025)
Topic-Based Watermarks for Large Language Models
von: Nemecek, Alexander, et al.
Veröffentlicht: (2024)
von: Nemecek, Alexander, et al.
Veröffentlicht: (2024)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
von: Wu, Yihan, et al.
Veröffentlicht: (2023)
von: Wu, Yihan, et al.
Veröffentlicht: (2023)
Phantom: General Backdoor Attacks on Retrieval Augmented Language Generation
von: Chaudhari, Harsh, et al.
Veröffentlicht: (2024)
von: Chaudhari, Harsh, et al.
Veröffentlicht: (2024)
Watermarks for Embeddings-as-a-Service Large Language Models
von: Shetty, Anudeex
Veröffentlicht: (2025)
von: Shetty, Anudeex
Veröffentlicht: (2025)
Detecting Pretraining Data from Large Language Models
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
von: Shi, Weijia, et al.
Veröffentlicht: (2023)
Learning to Poison Large Language Models for Downstream Manipulation
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2024)
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2024)
Membership Inference Attacks and Privacy in Topic Modeling
von: Manzonelli, Nico, et al.
Veröffentlicht: (2024)
von: Manzonelli, Nico, et al.
Veröffentlicht: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
von: Chang, Hongyan, et al.
Veröffentlicht: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SemRoDe: Macro Adversarial Training to Learn Representations That are Robust to Word-Level Attacks
von: Formento, Brian, et al.
Veröffentlicht: (2024) -
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
von: Liu, Renyang, et al.
Veröffentlicht: (2025) -
User Inference Attacks on Large Language Models
von: Kandpal, Nikhil, et al.
Veröffentlicht: (2023) -
Composite Backdoor Attacks Against Large Language Models
von: Huang, Hai, et al.
Veröffentlicht: (2023) -
TFL: Targeted Bit-Flip Attack on Large Language Model
von: Guo, Jingkai, et al.
Veröffentlicht: (2026)