Do Influence Functions Work on Large Language Models?
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zhe, Zhao, Wei, Li, Yige, Sun, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
di: Li, Yige, et al.
Pubblicazione: (2025)
di: Li, Yige, et al.
Pubblicazione: (2025)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
di: Min, Nay Myat, et al.
Pubblicazione: (2024)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Do Large Language Models Understand Logic or Just Mimick Context?
di: Yan, Junbing, et al.
Pubblicazione: (2024)
di: Yan, Junbing, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Do Large Language Models Possess Sensitive to Sentiment?
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Empowering Working Memory for Large Language Model Agents
di: Guo, Jing, et al.
Pubblicazione: (2023)
di: Guo, Jing, et al.
Pubblicazione: (2023)
SentenceVAE: Enable Next-sentence Prediction for Large Language Models with Faster Speed, Higher Accuracy and Longer Context
di: An, Hongjun, et al.
Pubblicazione: (2024)
di: An, Hongjun, et al.
Pubblicazione: (2024)
Anti-adversarial Learning: Desensitizing Prompts for Large Language Models
di: Li, Xuan, et al.
Pubblicazione: (2025)
di: Li, Xuan, et al.
Pubblicazione: (2025)
Table as a Modality for Large Language Models
di: Li, Liyao, et al.
Pubblicazione: (2025)
di: Li, Liyao, et al.
Pubblicazione: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
How Do Language Models Compose Functions?
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
EnviroExam: Benchmarking Environmental Science Knowledge of Large Language Models
di: Huang, Yu, et al.
Pubblicazione: (2024)
di: Huang, Yu, et al.
Pubblicazione: (2024)
Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
Internal Safety Collapse in Frontier Large Language Models
di: Wu, Yutao, et al.
Pubblicazione: (2026)
di: Wu, Yutao, et al.
Pubblicazione: (2026)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
Correcting Large Language Model Behavior via Influence Function
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
DIM: Dynamic Integration of Multimodal Entity Linking with Large Language Model
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
Large Language Models are In-Context Molecule Learners
di: Li, Jiatong, et al.
Pubblicazione: (2024)
di: Li, Jiatong, et al.
Pubblicazione: (2024)
Memory Retrieval and Consolidation in Large Language Models through Function Tokens
di: Zhang, Shaohua, et al.
Pubblicazione: (2025)
di: Zhang, Shaohua, et al.
Pubblicazione: (2025)
Do Large Language Models Mirror Cognitive Language Processing?
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
di: Ren, Yuqi, et al.
Pubblicazione: (2024)
SA-MDKIF: A Scalable and Adaptable Medical Domain Knowledge Injection Framework for Large Language Models
di: Xu, Tianhan, et al.
Pubblicazione: (2024)
di: Xu, Tianhan, et al.
Pubblicazione: (2024)
Radiology-GPT: A Large Language Model for Radiology
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
di: Ng, Lynnette Hui Xian, et al.
Pubblicazione: (2024)
di: Ng, Lynnette Hui Xian, et al.
Pubblicazione: (2024)
Do Large Language Models Understand Word Senses?
di: Meconi, Domenico, et al.
Pubblicazione: (2025)
di: Meconi, Domenico, et al.
Pubblicazione: (2025)
Do Large Language Models Know What They Are Capable Of?
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
di: Barkan, Casey O., et al.
Pubblicazione: (2025)
Towards Atoms of Large Language Models
di: Hu, Chenhui, et al.
Pubblicazione: (2025)
di: Hu, Chenhui, et al.
Pubblicazione: (2025)
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
di: Sun, Wangtao, et al.
Pubblicazione: (2023)
di: Sun, Wangtao, et al.
Pubblicazione: (2023)
Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models
di: Wu, Taiqiang, et al.
Pubblicazione: (2024)
di: Wu, Taiqiang, et al.
Pubblicazione: (2024)
Do Large Language Models Solve ARC Visual Analogies Like People Do?
di: Opiełka, Gustaw, et al.
Pubblicazione: (2024)
di: Opiełka, Gustaw, et al.
Pubblicazione: (2024)
Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
Do Large Language Models Align with Core Mental Health Counseling Competencies?
di: Nguyen, Viet Cuong, et al.
Pubblicazione: (2024)
di: Nguyen, Viet Cuong, et al.
Pubblicazione: (2024)
Unlocking the Working Memory of Large Language Models for Latent Reasoning
di: Aichberger, Lukas, et al.
Pubblicazione: (2026)
di: Aichberger, Lukas, et al.
Pubblicazione: (2026)
Unveiling and Manipulating Prompt Influence in Large Language Models
di: Feng, Zijian, et al.
Pubblicazione: (2024)
di: Feng, Zijian, et al.
Pubblicazione: (2024)
Iter-AHMCL: Alleviate Hallucination for Large Language Model via Iterative Model-level Contrastive Learning
di: Wu, Huiwen, et al.
Pubblicazione: (2024)
di: Wu, Huiwen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024) -
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025) -
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025) -
Adaptive Content Restriction for Large Language Models via Suffix Optimization
di: Li, Yige, et al.
Pubblicazione: (2025) -
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
di: Min, Nay Myat, et al.
Pubblicazione: (2024)