Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability
Fuente:
arXiv
Guardado en:
| Autores principales: | García-Carrasco, Jorge, Maté, Alejandro, Trujillo, Juan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
por: Liu, Frank Weizhen, et al.
Publicado: (2024)
por: Liu, Frank Weizhen, et al.
Publicado: (2024)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
por: Zhang, Anqi, et al.
Publicado: (2024)
por: Zhang, Anqi, et al.
Publicado: (2024)
Publicly-Detectable Watermarking for Language Models
por: Fairoze, Jaiden, et al.
Publicado: (2023)
por: Fairoze, Jaiden, et al.
Publicado: (2023)
Detecting Pretraining Data from Large Language Models
por: Shi, Weijia, et al.
Publicado: (2023)
por: Shi, Weijia, et al.
Publicado: (2023)
How Vulnerable Are Edge LLMs?
por: Ding, Ao, et al.
Publicado: (2026)
por: Ding, Ao, et al.
Publicado: (2026)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
por: Fan, Mingyuan, et al.
Publicado: (2026)
por: Fan, Mingyuan, et al.
Publicado: (2026)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
por: Liu, Fuqiang, et al.
Publicado: (2024)
por: Liu, Fuqiang, et al.
Publicado: (2024)
Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
por: Zhuo, Terry Yue, et al.
Publicado: (2025)
por: Zhuo, Terry Yue, et al.
Publicado: (2025)
The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers
por: Makroo, Owais, et al.
Publicado: (2025)
por: Makroo, Owais, et al.
Publicado: (2025)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
por: Huo, Mingjia, et al.
Publicado: (2024)
por: Huo, Mingjia, et al.
Publicado: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
por: Shetty, Anudeex, et al.
Publicado: (2026)
por: Shetty, Anudeex, et al.
Publicado: (2026)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
por: Sivapiromrat, Sanhanat, et al.
Publicado: (2025)
por: Sivapiromrat, Sanhanat, et al.
Publicado: (2025)
Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities
por: Krishna, Arjun, et al.
Publicado: (2025)
por: Krishna, Arjun, et al.
Publicado: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
Copyright-Protected Language Generation via Adaptive Model Fusion
por: Abad, Javier, et al.
Publicado: (2024)
por: Abad, Javier, et al.
Publicado: (2024)
Hijacking Large Language Models via Adversarial In-Context Learning
por: Zhou, Xiangyu, et al.
Publicado: (2023)
por: Zhou, Xiangyu, et al.
Publicado: (2023)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
por: Price, Sara, et al.
Publicado: (2024)
por: Price, Sara, et al.
Publicado: (2024)
Cross-Entropy Attacks to Language Models via Rare Event Simulation
por: Ni, Mingze, et al.
Publicado: (2025)
por: Ni, Mingze, et al.
Publicado: (2025)
SecureNet: A Comparative Study of DeBERTa and Large Language Models for Phishing Detection
por: Mahendru, Sakshi, et al.
Publicado: (2024)
por: Mahendru, Sakshi, et al.
Publicado: (2024)
Interpreting the Repeated Token Phenomenon in Large Language Models
por: Yona, Itay, et al.
Publicado: (2025)
por: Yona, Itay, et al.
Publicado: (2025)
Watermarking Language Models through Language Models
por: Dasgupta, Agnibh, et al.
Publicado: (2024)
por: Dasgupta, Agnibh, et al.
Publicado: (2024)
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
por: Shetty, Anudeex, et al.
Publicado: (2024)
por: Shetty, Anudeex, et al.
Publicado: (2024)
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
por: Liu, Jinxin, et al.
Publicado: (2024)
por: Liu, Jinxin, et al.
Publicado: (2024)
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
por: Zhang, Ruisi, et al.
Publicado: (2025)
por: Zhang, Ruisi, et al.
Publicado: (2025)
Time Will Tell: Timing Side Channels via Output Token Count in Large Language Models
por: Zhang, Tianchen, et al.
Publicado: (2024)
por: Zhang, Tianchen, et al.
Publicado: (2024)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
por: Geng, Jiahui, et al.
Publicado: (2025)
por: Geng, Jiahui, et al.
Publicado: (2025)
Every Character Counts: From Vulnerability to Defense in Phishing Detection
por: Chiper, Maria, et al.
Publicado: (2025)
por: Chiper, Maria, et al.
Publicado: (2025)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
por: Boreiko, Valentyn, et al.
Publicado: (2024)
por: Boreiko, Valentyn, et al.
Publicado: (2024)
Detecting Training Data of Large Language Models via Expectation Maximization
por: Kim, Gyuwan, et al.
Publicado: (2024)
por: Kim, Gyuwan, et al.
Publicado: (2024)
Conti Inc.: Understanding the Internal Discussions of a large Ransomware-as-a-Service Operator with Machine Learning
por: Ruellan, Estelle, et al.
Publicado: (2023)
por: Ruellan, Estelle, et al.
Publicado: (2023)
Empirical Analysis of Large Vision-Language Models against Goal Hijacking via Visual Prompt Injection
por: Kimura, Subaru, et al.
Publicado: (2024)
por: Kimura, Subaru, et al.
Publicado: (2024)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
por: Guo, Wenkai, et al.
Publicado: (2025)
por: Guo, Wenkai, et al.
Publicado: (2025)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
por: Fu, Wenjie, et al.
Publicado: (2023)
por: Fu, Wenjie, et al.
Publicado: (2023)
Model Provenance Testing for Large Language Models
por: Nikolic, Ivica, et al.
Publicado: (2025)
por: Nikolic, Ivica, et al.
Publicado: (2025)
Towards the Anonymization of the Language Modeling
por: Boutet, Antoine, et al.
Publicado: (2025)
por: Boutet, Antoine, et al.
Publicado: (2025)
On the Learnability of Watermarks for Language Models
por: Gu, Chenchen, et al.
Publicado: (2023)
por: Gu, Chenchen, et al.
Publicado: (2023)
Localizing Paragraph Memorization in Language Models
por: Stoehr, Niklas, et al.
Publicado: (2024)
por: Stoehr, Niklas, et al.
Publicado: (2024)
Are PPO-ed Language Models Hackable?
por: Anand, Suraj, et al.
Publicado: (2024)
por: Anand, Suraj, et al.
Publicado: (2024)
A Watermark for Large Language Models
por: Kirchenbauer, John, et al.
Publicado: (2023)
por: Kirchenbauer, John, et al.
Publicado: (2023)
Ejemplares similares
-
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
por: Liu, Frank Weizhen, et al.
Publicado: (2024) -
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
por: Zhang, Anqi, et al.
Publicado: (2024) -
Publicly-Detectable Watermarking for Language Models
por: Fairoze, Jaiden, et al.
Publicado: (2023) -
Detecting Pretraining Data from Large Language Models
por: Shi, Weijia, et al.
Publicado: (2023) -
How Vulnerable Are Edge LLMs?
por: Ding, Ao, et al.
Publicado: (2026)