Analyzing And Editing Inner Mechanisms Of Backdoored Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lamparth, Max, Reuel, Anka |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
par: Rivera, Juan-Pablo, et autres
Publié: (2024)
par: Rivera, Juan-Pablo, et autres
Publié: (2024)
BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices
par: Reuel, Anka, et autres
Publié: (2024)
par: Reuel, Anka, et autres
Publié: (2024)
Fairness in Reinforcement Learning: A Survey
par: Reuel, Anka, et autres
Publié: (2024)
par: Reuel, Anka, et autres
Publié: (2024)
Fantastic Bugs and Where to Find Them in AI Benchmarks
par: Truong, Sang, et autres
Publié: (2025)
par: Truong, Sang, et autres
Publié: (2025)
Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation
par: Grabb, Declan, et autres
Publié: (2024)
par: Grabb, Declan, et autres
Publié: (2024)
Measuring Free-Form Decision-Making Inconsistency of Language Models in Military Crisis Simulations
par: Shrivastava, Aryan, et autres
Publié: (2024)
par: Shrivastava, Aryan, et autres
Publié: (2024)
Self-Improvement in Language Models: The Sharpening Mechanism
par: Huang, Audrey, et autres
Publié: (2024)
par: Huang, Audrey, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Knowledge Editing on Black-box Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024)
par: Qiu, Yifu, et autres
Publié: (2024)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
par: Min, Nay Myat, et autres
Publié: (2024)
par: Min, Nay Myat, et autres
Publié: (2024)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
par: Jin, Zhijing, et autres
Publié: (2024)
par: Jin, Zhijing, et autres
Publié: (2024)
Language Models Represent Space and Time
par: Gurnee, Wes, et autres
Publié: (2023)
par: Gurnee, Wes, et autres
Publié: (2023)
Language Models Use Trigonometry to Do Addition
par: Kantamneni, Subhash, et autres
Publié: (2025)
par: Kantamneni, Subhash, et autres
Publié: (2025)
Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models
par: Rajaee, Sara, et autres
Publié: (2024)
par: Rajaee, Sara, et autres
Publié: (2024)
Constraining Sequential Model Editing with Editing Anchor Compression
par: Xu, Hao-Xiang, et autres
Publié: (2025)
par: Xu, Hao-Xiang, et autres
Publié: (2025)
FRED: Financial Retrieval-Enhanced Detection and Editing of Hallucinations in Language Models
par: Tan, Likun, et autres
Publié: (2025)
par: Tan, Likun, et autres
Publié: (2025)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
par: Veldanda, Akshaj Kumar, et autres
Publié: (2024)
Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
par: Chua, James, et autres
Publié: (2025)
par: Chua, James, et autres
Publié: (2025)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
par: Lan, Michael, et autres
Publié: (2023)
par: Lan, Michael, et autres
Publié: (2023)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
par: Lee, Isack, et autres
Publié: (2024)
par: Lee, Isack, et autres
Publié: (2024)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
Retrieval-enhanced Knowledge Editing in Language Models for Multi-Hop Question Answering
par: Shi, Yucheng, et autres
Publié: (2024)
par: Shi, Yucheng, et autres
Publié: (2024)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
par: Gu, Xiaojie, et autres
Publié: (2025)
par: Gu, Xiaojie, et autres
Publié: (2025)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Analyzing Persuasive Strategies in Meme Texts: A Fusion of Language Models with Paraphrase Enrichment
par: Nayak, Kota Shamanth Ramanath, et autres
Publié: (2024)
par: Nayak, Kota Shamanth Ramanath, et autres
Publié: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
par: Raghuram, Jayaram, et autres
Publié: (2024)
par: Raghuram, Jayaram, et autres
Publié: (2024)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
Model Merging for Knowledge Editing
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
par: Zhang, Rongzhi, et autres
Publié: (2025)
par: Zhang, Rongzhi, et autres
Publié: (2025)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
par: Sundar, Anirudh, et autres
Publié: (2025)
par: Sundar, Anirudh, et autres
Publié: (2025)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning
par: Radha, Santosh Kumar, et autres
Publié: (2024)
par: Radha, Santosh Kumar, et autres
Publié: (2024)
A Unified Framework for Model Editing
par: Gupta, Akshat, et autres
Publié: (2024)
par: Gupta, Akshat, et autres
Publié: (2024)
Model Editing by Standard Fine-Tuning
par: Gangadhar, Govind, et autres
Publié: (2024)
par: Gangadhar, Govind, et autres
Publié: (2024)
FLUID-LLM: Learning Computational Fluid Dynamics with Spatiotemporal-aware Large Language Models
par: Zhu, Max, et autres
Publié: (2024)
par: Zhu, Max, et autres
Publié: (2024)
RIPPLECOT: Amplifying Ripple Effect of Knowledge Editing in Language Models via Chain-of-Thought In-Context Learning
par: Zhao, Zihao, et autres
Publié: (2024)
par: Zhao, Zihao, et autres
Publié: (2024)
Documents similaires
-
Escalation Risks from Language Models in Military and Diplomatic Decision-Making
par: Rivera, Juan-Pablo, et autres
Publié: (2024) -
BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices
par: Reuel, Anka, et autres
Publié: (2024) -
Fairness in Reinforcement Learning: A Survey
par: Reuel, Anka, et autres
Publié: (2024) -
Fantastic Bugs and Where to Find Them in AI Benchmarks
par: Truong, Sang, et autres
Publié: (2025) -
Risks from Language Models for Automated Mental Healthcare: Ethics and Structure for Implementation
par: Grabb, Declan, et autres
Publié: (2024)