Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Das, Anindya Sundar, Chen, Kangjie, Bhuyan, Monowar |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Deviation Learning for Visual Anomaly Detection with Data Contamination
par: Das, Anindya Sundar, et autres
Publié: (2024)
par: Das, Anindya Sundar, et autres
Publié: (2024)
Multi-Cue Anomaly Detection and Localization under Data Contamination
par: Das, Anindya Sundar, et autres
Publié: (2026)
par: Das, Anindya Sundar, et autres
Publié: (2026)
Pruning Strategies for Backdoor Defense in LLMs
par: Chapagain, Santosh, et autres
Publié: (2025)
par: Chapagain, Santosh, et autres
Publié: (2025)
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
par: Baker, Mohammed Abu, et autres
Publié: (2025)
par: Baker, Mohammed Abu, et autres
Publié: (2025)
Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models
par: kurra, Sailesh kiran, et autres
Publié: (2026)
par: kurra, Sailesh kiran, et autres
Publié: (2026)
Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense
par: Sundar, Nataraj Agaram, et autres
Publié: (2026)
par: Sundar, Nataraj Agaram, et autres
Publié: (2026)
Model Merging in Pre-training of Large Language Models
par: Li, Yunshui, et autres
Publié: (2025)
par: Li, Yunshui, et autres
Publié: (2025)
Making Pre-trained Language Models Great on Tabular Prediction
par: Yan, Jiahuan, et autres
Publié: (2024)
par: Yan, Jiahuan, et autres
Publié: (2024)
The Efficiency of Pre-training with Objective Masking in Pseudo Labeling for Semi-Supervised Text Classification
par: Hatefi, Arezoo, et autres
Publié: (2025)
par: Hatefi, Arezoo, et autres
Publié: (2025)
Structural Pruning of Pre-trained Language Models via Neural Architecture Search
par: Klein, Aaron, et autres
Publié: (2024)
par: Klein, Aaron, et autres
Publié: (2024)
DEPT: Decoupled Embeddings for Pre-training Language Models
par: Iacob, Alex, et autres
Publié: (2024)
par: Iacob, Alex, et autres
Publié: (2024)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
par: Zhong, Zexuan, et autres
Publié: (2024)
par: Zhong, Zexuan, et autres
Publié: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
par: Chung, Woojin, et autres
Publié: (2025)
par: Chung, Woojin, et autres
Publié: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
par: Xia, Mengzhou, et autres
Publié: (2023)
par: Xia, Mengzhou, et autres
Publié: (2023)
PaPaformer: Language Model from Pre-trained Parallel Paths
par: Tapaninaho, Joonas, et autres
Publié: (2025)
par: Tapaninaho, Joonas, et autres
Publié: (2025)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
par: Zheng, Junhao, et autres
Publié: (2023)
par: Zheng, Junhao, et autres
Publié: (2023)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
par: Thangarasa, Vithursan, et autres
Publié: (2024)
par: Thangarasa, Vithursan, et autres
Publié: (2024)
Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
par: Sharma, Kartik, et autres
Publié: (2025)
par: Sharma, Kartik, et autres
Publié: (2025)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
par: Fesalbon, Daniel, et autres
Publié: (2024)
par: Fesalbon, Daniel, et autres
Publié: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
par: Zhou, Tianyi, et autres
Publié: (2024)
par: Zhou, Tianyi, et autres
Publié: (2024)
HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
par: Fan, Haozheng, et autres
Publié: (2024)
par: Fan, Haozheng, et autres
Publié: (2024)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
par: Zhang, Ying, et autres
Publié: (2024)
par: Zhang, Ying, et autres
Publié: (2024)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Investigating Data Contamination for Pre-training Language Models
par: Jiang, Minhao, et autres
Publié: (2024)
par: Jiang, Minhao, et autres
Publié: (2024)
Aligning Pre-trained Models for Spoken Language Translation
par: Sedláček, Šimon, et autres
Publié: (2024)
par: Sedláček, Šimon, et autres
Publié: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
par: Araujo, Vladimir, et autres
Publié: (2023)
par: Araujo, Vladimir, et autres
Publié: (2023)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
par: Shang, Bingqi, et autres
Publié: (2025)
par: Shang, Bingqi, et autres
Publié: (2025)
FLEx: Language Modeling with Few-shot Language Explanations
par: Avsian, Adar, et autres
Publié: (2026)
par: Avsian, Adar, et autres
Publié: (2026)
Evaluating the Effectiveness of Pre-trained Language Models in Predicting the Helpfulness of Online Product Reviews
par: Boluki, Ali, et autres
Publié: (2023)
par: Boluki, Ali, et autres
Publié: (2023)
A Context-Aware Approach for Enhancing Data Imputation with Pre-trained Language Models
par: Hayat, Ahatsham, et autres
Publié: (2024)
par: Hayat, Ahatsham, et autres
Publié: (2024)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
par: Zhang, Anqi, et autres
Publié: (2024)
par: Zhang, Anqi, et autres
Publié: (2024)
Efficient Continual Pre-training of LLMs for Low-resource Languages
par: Nag, Arijit, et autres
Publié: (2024)
par: Nag, Arijit, et autres
Publié: (2024)
The Dark Side of the Language: Pre-trained Transformers in the DarkNet
par: Ranaldi, Leonardo, et autres
Publié: (2022)
par: Ranaldi, Leonardo, et autres
Publié: (2022)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
Data-centric NLP Backdoor Defense from the Lens of Memorization
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
Guarding the Middle: Protecting Intermediate Representations in Federated Split Learning
par: Zaland, Obaidullah, et autres
Publié: (2026)
par: Zaland, Obaidullah, et autres
Publié: (2026)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
Integrating Pre-trained Language Model into Neural Machine Translation
par: Hwang, Soon-Jae, et autres
Publié: (2023)
par: Hwang, Soon-Jae, et autres
Publié: (2023)
CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
par: Gu, Jiawei, et autres
Publié: (2024)
par: Gu, Jiawei, et autres
Publié: (2024)
Variance Control via Weight Rescaling in LLM Pre-training
par: Owen, Louis, et autres
Publié: (2025)
par: Owen, Louis, et autres
Publié: (2025)
Documents similaires
-
Adaptive Deviation Learning for Visual Anomaly Detection with Data Contamination
par: Das, Anindya Sundar, et autres
Publié: (2024) -
Multi-Cue Anomaly Detection and Localization under Data Contamination
par: Das, Anindya Sundar, et autres
Publié: (2026) -
Pruning Strategies for Backdoor Defense in LLMs
par: Chapagain, Santosh, et autres
Publié: (2025) -
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
par: Baker, Mohammed Abu, et autres
Publié: (2025) -
Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models
par: kurra, Sailesh kiran, et autres
Publié: (2026)