Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruihan, Sun, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Make Text Unlearnable: Exploiting Effective Patterns to Protect Personal Data
par: Li, Xinzhe, et autres
Publié: (2023)
par: Li, Xinzhe, et autres
Publié: (2023)
The Unlearnability Phenomenon in RLVR for Language Models
par: Chen, Yulin, et autres
Publié: (2026)
par: Chen, Yulin, et autres
Publié: (2026)
Efficient Knowledge Infusion via KG-LLM Alignment
par: Jiang, Zhouyu, et autres
Publié: (2024)
par: Jiang, Zhouyu, et autres
Publié: (2024)
Towards Provably Unlearnable Examples via Bayes Error Optimisation
par: Zhang, Ruihan, et autres
Publié: (2025)
par: Zhang, Ruihan, et autres
Publié: (2025)
The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
par: Zhang, Yihao, et autres
Publié: (2026)
par: Zhang, Yihao, et autres
Publié: (2026)
Exploring LLM-based Data Annotation Strategies for Medical Dialogue Preference Alignment
par: Dou, Chengfeng, et autres
Publié: (2024)
par: Dou, Chengfeng, et autres
Publié: (2024)
Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and Refinement
par: Cao, Maosong, et autres
Publié: (2025)
par: Cao, Maosong, et autres
Publié: (2025)
Exploiting Pseudo Image Captions for Multimodal Summarization
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
par: Zhou, Hongli, et autres
Publié: (2026)
par: Zhou, Hongli, et autres
Publié: (2026)
Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data
par: Chen, Zhuowei, et autres
Publié: (2025)
par: Chen, Zhuowei, et autres
Publié: (2025)
ASGEA: Exploiting Logic Rules from Align-Subgraphs for Entity Alignment
par: Luo, Yangyifei, et autres
Publié: (2024)
par: Luo, Yangyifei, et autres
Publié: (2024)
LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data
par: Meisenbacher, Stephen, et autres
Publié: (2025)
par: Meisenbacher, Stephen, et autres
Publié: (2025)
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
par: Si, Jianfeng, et autres
Publié: (2026)
par: Si, Jianfeng, et autres
Publié: (2026)
Evaluating LLM Alignment on Personality Inference from Real-World Interview Data
par: Zhu, Jianfeng, et autres
Publié: (2025)
par: Zhu, Jianfeng, et autres
Publié: (2025)
REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
par: Xu, Zhihao, et autres
Publié: (2025)
par: Xu, Zhihao, et autres
Publié: (2025)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
par: Sun, Shuqiao, et autres
Publié: (2024)
par: Sun, Shuqiao, et autres
Publié: (2024)
Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception
par: Ni, Shiyu, et autres
Publié: (2025)
par: Ni, Shiyu, et autres
Publié: (2025)
Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding
par: Bao, Jianzhu, et autres
Publié: (2026)
par: Bao, Jianzhu, et autres
Publié: (2026)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
par: Fayyaz, Mohsen, et autres
Publié: (2024)
par: Fayyaz, Mohsen, et autres
Publié: (2024)
Understanding Layer Significance in LLM Alignment
par: Shi, Guangyuan, et autres
Publié: (2024)
par: Shi, Guangyuan, et autres
Publié: (2024)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
par: Sun, Guanglong, et autres
Publié: (2026)
par: Sun, Guanglong, et autres
Publié: (2026)
CAMOUFLAGE: Exploiting Misinformation Detection Systems Through LLM-driven Adversarial Claim Transformation
par: Bethany, Mazal, et autres
Publié: (2025)
par: Bethany, Mazal, et autres
Publié: (2025)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
par: Sun, Chenkai, et autres
Publié: (2025)
par: Sun, Chenkai, et autres
Publié: (2025)
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
par: Khan, Ishmam, et autres
Publié: (2026)
par: Khan, Ishmam, et autres
Publié: (2026)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
par: Zhou, Enyu, et autres
Publié: (2024)
par: Zhou, Enyu, et autres
Publié: (2024)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
par: Huang, Yue, et autres
Publié: (2025)
par: Huang, Yue, et autres
Publié: (2025)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Societal Alignment Frameworks Can Improve LLM Alignment
par: Stańczak, Karolina, et autres
Publié: (2025)
par: Stańczak, Karolina, et autres
Publié: (2025)
Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM Era
par: Wu, Xuansheng, et autres
Publié: (2024)
par: Wu, Xuansheng, et autres
Publié: (2024)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
MAPS: Motivation-Aware Personalized Search via LLM-Driven Consultation Alignment
par: Qin, Weicong, et autres
Publié: (2025)
par: Qin, Weicong, et autres
Publié: (2025)
Alignment Drift in Long-Term Human-LLM Interaction: A Mechanism-Oriented Framework
par: Yao, Xintong
Publié: (2026)
par: Yao, Xintong
Publié: (2026)
Data-efficient LLM Fine-tuning for Code Generation
par: Lv, Weijie, et autres
Publié: (2025)
par: Lv, Weijie, et autres
Publié: (2025)
PAD: Towards Efficient Data Generation for Transfer Learning Using Phrase Alignment
par: Kim, Jong Myoung, et autres
Publié: (2025)
par: Kim, Jong Myoung, et autres
Publié: (2025)
Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations
par: Huang, Yiming, et autres
Publié: (2025)
par: Huang, Yiming, et autres
Publié: (2025)
Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching
par: Li, Songze, et autres
Publié: (2025)
par: Li, Songze, et autres
Publié: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
par: Cheng, Zehua, et autres
Publié: (2026)
par: Cheng, Zehua, et autres
Publié: (2026)
Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment
par: Zhang, Yizhuo, et autres
Publié: (2025)
par: Zhang, Yizhuo, et autres
Publié: (2025)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
Documents similaires
-
Make Text Unlearnable: Exploiting Effective Patterns to Protect Personal Data
par: Li, Xinzhe, et autres
Publié: (2023) -
The Unlearnability Phenomenon in RLVR for Language Models
par: Chen, Yulin, et autres
Publié: (2026) -
Efficient Knowledge Infusion via KG-LLM Alignment
par: Jiang, Zhouyu, et autres
Publié: (2024) -
Towards Provably Unlearnable Examples via Bayes Error Optimisation
par: Zhang, Ruihan, et autres
Publié: (2025) -
The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
par: Zhang, Yihao, et autres
Publié: (2026)