Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, San, Lee, Gary Geunbae |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection
par: Kim, San, et autres
Publié: (2025)
par: Kim, San, et autres
Publié: (2025)
Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents
par: Kim, San, et autres
Publié: (2024)
par: Kim, San, et autres
Publié: (2024)
Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model
par: Kim, Daehee, et autres
Publié: (2024)
par: Kim, Daehee, et autres
Publié: (2024)
Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2026)
par: Lee, Wonjun, et autres
Publié: (2026)
Key-Element-Informed sLLM Tuning for Document Summarization
par: Ryu, Sangwon, et autres
Publié: (2024)
par: Ryu, Sangwon, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
Learning When to Translate for Multilingual Reasoning
par: Kang, Deokhyung, et autres
Publié: (2026)
par: Kang, Deokhyung, et autres
Publié: (2026)
Autoregressive Score Generation for Multi-trait Essay Scoring
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
K-COMP: Retrieval-Augmented Medical Domain Question Answering With Knowledge-Injected Compressor
par: Cho, Jeonghun, et autres
Publié: (2025)
par: Cho, Jeonghun, et autres
Publié: (2025)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
par: Zhao, Shuai, et autres
Publié: (2025)
par: Zhao, Shuai, et autres
Publié: (2025)
Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?
par: Kang, Deokhyung, et autres
Publié: (2025)
par: Kang, Deokhyung, et autres
Publié: (2025)
Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning
par: Kim, Subin, et autres
Publié: (2025)
par: Kim, Subin, et autres
Publié: (2025)
Exploring Iterative Controllable Summarization with Large Language Models
par: Ryu, Sangwon, et autres
Publié: (2024)
par: Ryu, Sangwon, et autres
Publié: (2024)
Denoising Table-Text Retrieval for Open-Domain Question Answering
par: Kang, Deokhyung, et autres
Publié: (2024)
par: Kang, Deokhyung, et autres
Publié: (2024)
Cross-lingual Back-Parsing: Utterance Synthesis from Meaning Representation for Zero-Resource Semantic Parsing
par: Kang, Deokhyung, et autres
Publié: (2024)
par: Kang, Deokhyung, et autres
Publié: (2024)
Behavior-Aware Item Modeling via Dynamic Procedural Solution Representations for Knowledge Tracing
par: Seo, Jun, et autres
Publié: (2026)
par: Seo, Jun, et autres
Publié: (2026)
Leveraging What's Overfixed: Post-Correction via LLM Grammatical Error Overcorrection
par: Park, Taehee, et autres
Publié: (2025)
par: Park, Taehee, et autres
Publié: (2025)
Teach-to-Reason with Scoring: Self-Explainable Rationale-Driven Multi-Trait Essay Scoring
par: Do, Heejin, et autres
Publié: (2025)
par: Do, Heejin, et autres
Publié: (2025)
Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program Generation
par: Kang, Deokhyung, et autres
Publié: (2025)
par: Kang, Deokhyung, et autres
Publié: (2025)
Speak & Spell: LLM-Driven Controllable Phonetic Error Augmentation for Robust Dialogue State Tracking
par: Lee, Jihyun, et autres
Publié: (2024)
par: Lee, Jihyun, et autres
Publié: (2024)
EXAONE 3.0 7.8B Instruction Tuned Language Model
par: An, Soyoung, et autres
Publié: (2024)
par: An, Soyoung, et autres
Publié: (2024)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023)
par: Liu, Qin, et autres
Publié: (2023)
Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search
par: Ryu, Sangwon, et autres
Publié: (2025)
par: Ryu, Sangwon, et autres
Publié: (2025)
Multi-Dimensional Optimization for Text Summarization via Reinforcement Learning
par: Ryu, Sangwon, et autres
Publié: (2024)
par: Ryu, Sangwon, et autres
Publié: (2024)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Model
par: Kim, Jaemin, et autres
Publié: (2026)
par: Kim, Jaemin, et autres
Publié: (2026)
Multi-Facet Blending for Faceted Query-by-Example Retrieval
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Towards Prompt Generalization: Grammar-aware Cross-Prompt Automated Essay Scoring
par: Do, Heejin, et autres
Publié: (2025)
par: Do, Heejin, et autres
Publié: (2025)
Disperse-Then-Merge: Pushing the Limits of Instruction Tuning via Alignment Tax Reduction
par: Fu, Tingchen, et autres
Publié: (2024)
par: Fu, Tingchen, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
par: Wu, Zongru, et autres
Publié: (2024)
par: Wu, Zongru, et autres
Publié: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models
par: Ye, Rui, et autres
Publié: (2024)
par: Ye, Rui, et autres
Publié: (2024)
When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models
par: Liu, Ziyu, et autres
Publié: (2026)
par: Liu, Ziyu, et autres
Publié: (2026)
Phased Instruction Fine-Tuning for Large Language Models
par: Pang, Wei, et autres
Publié: (2024)
par: Pang, Wei, et autres
Publié: (2024)
Investigating Instruction Tuning Large Language Models on Graphs
par: Zhu, Kerui, et autres
Publié: (2024)
par: Zhu, Kerui, et autres
Publié: (2024)
Model Fusion through Bayesian Optimization in Language Model Fine-Tuning
par: Jang, Chaeyun, et autres
Publié: (2024)
par: Jang, Chaeyun, et autres
Publié: (2024)
Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization
par: Ryu, Sangwon, et autres
Publié: (2026)
par: Ryu, Sangwon, et autres
Publié: (2026)
Documents similaires
-
Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection
par: Kim, San, et autres
Publié: (2025) -
Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents
par: Kim, San, et autres
Publié: (2024) -
Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model
par: Kim, Daehee, et autres
Publié: (2024) -
Mixture-of-Experts with Intermediate CTC Supervision for Accented Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2026) -
Key-Element-Informed sLLM Tuning for Document Summarization
par: Ryu, Sangwon, et autres
Publié: (2024)