Is poisoning a real threat to LLM alignment? Maybe more so than you think
Fuente:
arXiv
Guardado en:
| Autores principales: | Pathmanathan, Pankayaraj, Chakraborty, Souradip, Liu, Xiangyu, Liang, Yongyuan, Huang, Furong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
por: Panaitescu-Liess, Michael-Andrei, et al.
Publicado: (2025)
por: Panaitescu-Liess, Michael-Andrei, et al.
Publicado: (2025)
The 2020 US Decennial Census is more private than you (might) think
por: Su, Buxin, et al.
Publicado: (2024)
por: Su, Buxin, et al.
Publicado: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2025)
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2025)
LLM Dataset Inference: Did you train on my dataset?
por: Maini, Pratyush, et al.
Publicado: (2024)
por: Maini, Pratyush, et al.
Publicado: (2024)
Cross-Modal Safety Alignment: Is textual unlearning all you need?
por: Chakraborty, Trishna, et al.
Publicado: (2024)
por: Chakraborty, Trishna, et al.
Publicado: (2024)
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2026)
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2026)
What are the attackers doing now? Automating cyber threat intelligence extraction from text on pace with the changing threat landscape: A survey
por: Rahman, Md Rayhanur, et al.
Publicado: (2021)
por: Rahman, Md Rayhanur, et al.
Publicado: (2021)
PROPS: Progressively Private Self-alignment of Large Language Models
por: Teku, Noel, et al.
Publicado: (2025)
por: Teku, Noel, et al.
Publicado: (2025)
The poison of dimensionality
por: Hoang, Lê-Nguyên
Publicado: (2024)
por: Hoang, Lê-Nguyên
Publicado: (2024)
Are aligned neural networks adversarially aligned?
por: Carlini, Nicholas, et al.
Publicado: (2023)
por: Carlini, Nicholas, et al.
Publicado: (2023)
Good Parenting is all you need -- Multi-agentic LLM Hallucination Mitigation
por: Kwartler, Ted, et al.
Publicado: (2024)
por: Kwartler, Ted, et al.
Publicado: (2024)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
por: Liu, Hongfu, et al.
Publicado: (2024)
por: Liu, Hongfu, et al.
Publicado: (2024)
Localizing Malicious Outputs from CodeLLM
por: Borana, Mayukh, et al.
Publicado: (2025)
por: Borana, Mayukh, et al.
Publicado: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
MARAGE: Transferable Multi-Model Adversarial Attack for Retrieval-Augmented Generation Data Extraction
por: Hu, Xiao, et al.
Publicado: (2025)
por: Hu, Xiao, et al.
Publicado: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
por: Liang, Jiacheng, et al.
Publicado: (2024)
por: Liang, Jiacheng, et al.
Publicado: (2024)
Improving LLM Safety Alignment with Dual-Objective Optimization
por: Zhao, Xuandong, et al.
Publicado: (2025)
por: Zhao, Xuandong, et al.
Publicado: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
por: An, Bang, et al.
Publicado: (2024)
por: An, Bang, et al.
Publicado: (2024)
Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs
por: Liu, Ruixuan, et al.
Publicado: (2026)
por: Liu, Ruixuan, et al.
Publicado: (2026)
Two Birds with One Stone: Multi-Task Detection and Attribution of LLM-Generated Text
por: Rao, Zixin, et al.
Publicado: (2025)
por: Rao, Zixin, et al.
Publicado: (2025)
I still know it's you! On Challenges in Anonymizing Source Code
por: Horlboge, Micha, et al.
Publicado: (2022)
por: Horlboge, Micha, et al.
Publicado: (2022)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
por: Wang, Tianchun, et al.
Publicado: (2024)
por: Wang, Tianchun, et al.
Publicado: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
Hijacking Large Language Models via Adversarial In-Context Learning
por: Zhou, Xiangyu, et al.
Publicado: (2023)
por: Zhou, Xiangyu, et al.
Publicado: (2023)
Robustness of LLM-enabled vehicle trajectory prediction under data security threats
por: Wang, Feilong, et al.
Publicado: (2025)
por: Wang, Feilong, et al.
Publicado: (2025)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
por: Li, Tung-Ling, et al.
Publicado: (2025)
por: Li, Tung-Ling, et al.
Publicado: (2025)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
por: Guo, Wenkai, et al.
Publicado: (2025)
por: Guo, Wenkai, et al.
Publicado: (2025)
LLM Unlearning Should Be Form-Independent
por: Ye, Xiaotian, et al.
Publicado: (2025)
por: Ye, Xiaotian, et al.
Publicado: (2025)
GCG Attack On A Diffusion LLM
por: Neyroud, Ruben, et al.
Publicado: (2025)
por: Neyroud, Ruben, et al.
Publicado: (2025)
Non-omniscient backdoor injection with one poison sample: Proving the one-poison hypothesis for linear regression, linear classification, and 2-layer ReLU neural networks
por: Peinemann, Thorsten, et al.
Publicado: (2025)
por: Peinemann, Thorsten, et al.
Publicado: (2025)
LLMGuard: Guarding Against Unsafe LLM Behavior
por: Goyal, Shubh, et al.
Publicado: (2024)
por: Goyal, Shubh, et al.
Publicado: (2024)
Sparse Autoencoders are Capable LLM Jailbreak Mitigators
por: Assogba, Yannick, et al.
Publicado: (2026)
por: Assogba, Yannick, et al.
Publicado: (2026)
Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities
por: Krishna, Arjun, et al.
Publicado: (2025)
por: Krishna, Arjun, et al.
Publicado: (2025)
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
por: Duan, Haohua, et al.
Publicado: (2025)
por: Duan, Haohua, et al.
Publicado: (2025)
Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent
por: Zhang, Boyang, et al.
Publicado: (2026)
por: Zhang, Boyang, et al.
Publicado: (2026)
Learning to Poison Large Language Models for Downstream Manipulation
por: Zhou, Xiangyu, et al.
Publicado: (2024)
por: Zhou, Xiangyu, et al.
Publicado: (2024)
Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness
por: Shafee, Samaneh, et al.
Publicado: (2024)
por: Shafee, Samaneh, et al.
Publicado: (2024)
Robust LLM safeguarding via refusal feature adversarial training
por: Yu, Lei, et al.
Publicado: (2024)
por: Yu, Lei, et al.
Publicado: (2024)
Proving membership in LLM pretraining data via data watermarks
por: Wei, Johnny Tian-Zheng, et al.
Publicado: (2024)
por: Wei, Johnny Tian-Zheng, et al.
Publicado: (2024)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
por: Pang, Qi, et al.
Publicado: (2024)
por: Pang, Qi, et al.
Publicado: (2024)
Ejemplares similares
-
PoisonedParrot: Subtle Data Poisoning Attacks to Elicit Copyright-Infringing Content from Large Language Models
por: Panaitescu-Liess, Michael-Andrei, et al.
Publicado: (2025) -
The 2020 US Decennial Census is more private than you (might) think
por: Su, Buxin, et al.
Publicado: (2024) -
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
por: Pathmanathan, Pankayaraj, et al.
Publicado: (2025) -
LLM Dataset Inference: Did you train on my dataset?
por: Maini, Pratyush, et al.
Publicado: (2024) -
Cross-Modal Safety Alignment: Is textual unlearning all you need?
por: Chakraborty, Trishna, et al.
Publicado: (2024)