Neutralizing Backdoors through Information Conflicts for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Chen, Sun, Yuchen, Gong, Xueluan, Gao, Jiaxin, Lam, Kwok-Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
par: Chen, Chen, et autres
Publié: (2026)
par: Chen, Chen, et autres
Publié: (2026)
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
par: Chen, Chen, et autres
Publié: (2026)
par: Chen, Chen, et autres
Publié: (2026)
Hidden Data Privacy Breaches in Federated Learning
par: Gong, Xueluan, et autres
Publié: (2024)
par: Gong, Xueluan, et autres
Publié: (2024)
Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems
par: Gao, Jiaxin, et autres
Publié: (2025)
par: Gao, Jiaxin, et autres
Publié: (2025)
AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Detecting Stealthy Backdoor Samples based on Intra-class Distance for Large Language Models
par: Chen, Jinwen, et autres
Publié: (2025)
par: Chen, Jinwen, et autres
Publié: (2025)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
par: Mo, Wenjie, et autres
Publié: (2023)
par: Mo, Wenjie, et autres
Publié: (2023)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
par: Liu, Yantao, et autres
Publié: (2024)
par: Liu, Yantao, et autres
Publié: (2024)
Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey
par: Zhao, Yuqing, et autres
Publié: (2026)
par: Zhao, Yuqing, et autres
Publié: (2026)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
par: He, Xingwei, et autres
Publié: (2025)
par: He, Xingwei, et autres
Publié: (2025)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Resolving Editing-Unlearning Conflicts: A Knowledge Codebook Framework for Large Language Model Updating
par: Zhang, Binchi, et autres
Publié: (2025)
par: Zhang, Binchi, et autres
Publié: (2025)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
par: Yan, Jun, et autres
Publié: (2023)
par: Yan, Jun, et autres
Publié: (2023)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023)
par: Cao, Yuanpu, et autres
Publié: (2023)
Assessing and Mitigating Medical Knowledge Drift and Conflicts in Large Language Models
par: Wu, Weiyi, et autres
Publié: (2025)
par: Wu, Weiyi, et autres
Publié: (2025)
Resolving Knowledge Conflicts in Large Language Models
par: Wang, Yike, et autres
Publié: (2023)
par: Wang, Yike, et autres
Publié: (2023)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
par: Li, Jiahuan, et autres
Publié: (2024)
par: Li, Jiahuan, et autres
Publié: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
CoSearchAgent: A Lightweight Collaborative Search Agent with Large Language Models
par: Gong, Peiyuan, et autres
Publié: (2024)
par: Gong, Peiyuan, et autres
Publié: (2024)
DynamicMind: A Tri-Mode Thinking System for Large Language Models
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Taming Knowledge Conflicts in Language Models
par: Li, Gaotang, et autres
Publié: (2025)
par: Li, Gaotang, et autres
Publié: (2025)
Astute RAG: Overcoming Imperfect Retrieval Augmentation and Knowledge Conflicts for Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Rethinking Backdoor Detection Evaluation for Language Models
par: Yan, Jun, et autres
Publié: (2024)
par: Yan, Jun, et autres
Publié: (2024)
SPUQ: Perturbation-Based Uncertainty Quantification for Large Language Models
par: Gao, Xiang, et autres
Publié: (2024)
par: Gao, Xiang, et autres
Publié: (2024)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
par: Baker, Mohammed Abu, et autres
Publié: (2025)
par: Baker, Mohammed Abu, et autres
Publié: (2025)
MEGen: Generative Backdoor into Large Language Models via Model Editing
par: Qiu, Jiyang, et autres
Publié: (2024)
par: Qiu, Jiyang, et autres
Publié: (2024)
A Novel Paradigm Boosting Translation Capabilities of Large Language Models
par: Guo, Jiaxin, et autres
Publié: (2024)
par: Guo, Jiaxin, et autres
Publié: (2024)
Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models
par: Lasnier, Théo, et autres
Publié: (2026)
par: Lasnier, Théo, et autres
Publié: (2026)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
par: Chen, Guanyu, et autres
Publié: (2026)
par: Chen, Guanyu, et autres
Publié: (2026)
Evaluating Cultural Adaptability of a Large Language Model via Simulation of Synthetic Personas
par: Kwok, Louis, et autres
Publié: (2024)
par: Kwok, Louis, et autres
Publié: (2024)
Adaptive Chameleon or Stubborn Sloth: Revealing the Behavior of Large Language Models in Knowledge Conflicts
par: Xie, Jian, et autres
Publié: (2023)
par: Xie, Jian, et autres
Publié: (2023)
LTD-Bench: Evaluating Large Language Models by Letting Them Draw
par: Lin, Liuhao, et autres
Publié: (2025)
par: Lin, Liuhao, et autres
Publié: (2025)
Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach
par: Yang, Jingyuan, et autres
Publié: (2025)
par: Yang, Jingyuan, et autres
Publié: (2025)
LLM4Ranking: An Easy-to-use Framework of Utilizing Large Language Models for Document Reranking
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
Measuring Maximum Activations in Open Large Language Models
par: Chen, Luxuan, et autres
Publié: (2026)
par: Chen, Luxuan, et autres
Publié: (2026)
Large Language Models for Healthcare Text Classification: A Systematic Review
par: Sakai, Hajar, et autres
Publié: (2025)
par: Sakai, Hajar, et autres
Publié: (2025)
Documents similaires
-
Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
par: Chen, Chen, et autres
Publié: (2025) -
Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
par: Chen, Chen, et autres
Publié: (2026) -
The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents
par: Chen, Chen, et autres
Publié: (2026) -
Hidden Data Privacy Breaches in Federated Learning
par: Gong, Xueluan, et autres
Publié: (2024) -
Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems
par: Gao, Jiaxin, et autres
Publié: (2025)