Influence-based Attributions can be Manipulated
Fuente:
arXiv
Salvato in:
| Autori principali: | Yadav, Chhavi, Wu, Ruihan, Chaudhuri, Kamalika |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FairProof : Confidential and Certifiable Fairness for Neural Networks
di: Yadav, Chhavi, et al.
Pubblicazione: (2024)
di: Yadav, Chhavi, et al.
Pubblicazione: (2024)
ExpProof : Operationalizing Explanations for Confidential Models with ZKPs
di: Yadav, Chhavi, et al.
Pubblicazione: (2025)
di: Yadav, Chhavi, et al.
Pubblicazione: (2025)
Can We Infer Confidential Properties of Training Data from LLMs?
di: Huang, Pengrun, et al.
Pubblicazione: (2025)
di: Huang, Pengrun, et al.
Pubblicazione: (2025)
Curriculum Learning for Safety Alignment
di: Kumar, Sandeep, et al.
Pubblicazione: (2026)
di: Kumar, Sandeep, et al.
Pubblicazione: (2026)
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
di: Wang, Erchi, et al.
Pubblicazione: (2026)
di: Wang, Erchi, et al.
Pubblicazione: (2026)
Better Membership Inference Privacy Measurement through Discrepancy
di: Wu, Ruihan, et al.
Pubblicazione: (2024)
di: Wu, Ruihan, et al.
Pubblicazione: (2024)
Learning-Time Encoding Shapes Unlearning in LLMs
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
Evaluating Deep Unlearning in Large Language Models
di: Wu, Ruihan, et al.
Pubblicazione: (2024)
di: Wu, Ruihan, et al.
Pubblicazione: (2024)
Privacy-Preserving Retrieval-Augmented Generation with Differential Privacy
di: Koga, Tatsuki, et al.
Pubblicazione: (2024)
di: Koga, Tatsuki, et al.
Pubblicazione: (2024)
Revisiting Data Attribution for Influence Functions
di: Zhu, Hongbo, et al.
Pubblicazione: (2025)
di: Zhu, Hongbo, et al.
Pubblicazione: (2025)
Integrated Influence: Data Attribution with Baseline
di: Yang, Linxiao, et al.
Pubblicazione: (2025)
di: Yang, Linxiao, et al.
Pubblicazione: (2025)
Interaction-Aware Influence Functions for Group Attribution
di: Heo, Jaeseung, et al.
Pubblicazione: (2026)
di: Heo, Jaeseung, et al.
Pubblicazione: (2026)
Accumulative SGD Influence Estimation for Data Attribution
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
di: Shi, Yunxiao, et al.
Pubblicazione: (2025)
Influence Functions for Scalable Data Attribution in Diffusion Models
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2024)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2024)
Diffusion Attribution Score: Evaluating Training Data Influence in Diffusion Models
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
Distributional Training Data Attribution: What do Influence Functions Sample?
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
Z0-Inf: Zeroth Order Approximation for Data Influence
di: Kokhlikyan, Narine, et al.
Pubblicazione: (2025)
di: Kokhlikyan, Narine, et al.
Pubblicazione: (2025)
Concept Influence: Leveraging Interpretability to Improve Performance and Efficiency in Training Data Attribution
di: Kowal, Matthew, et al.
Pubblicazione: (2026)
di: Kowal, Matthew, et al.
Pubblicazione: (2026)
BoolGebra: Attributed Graph-learning for Boolean Algebraic Manipulation
di: Li, Yingjie, et al.
Pubblicazione: (2024)
di: Li, Yingjie, et al.
Pubblicazione: (2024)
Synthesize, Partition, then Adapt: Eliciting Diverse Samples from Foundation Models
di: Wen, Yeming, et al.
Pubblicazione: (2024)
di: Wen, Yeming, et al.
Pubblicazione: (2024)
Harmonic Mobile Manipulation
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
VRAIL: Vectorized Reward-based Attribution for Interpretable Learning
di: Kim, Jina, et al.
Pubblicazione: (2025)
di: Kim, Jina, et al.
Pubblicazione: (2025)
Full-Atom Peptide Design based on Multi-modal Flow Matching
di: Li, Jiahan, et al.
Pubblicazione: (2024)
di: Li, Jiahan, et al.
Pubblicazione: (2024)
AIMM: An AI-Driven Multimodal Framework for Detecting Social-Media-Influenced Stock Market Manipulation
di: Neela, Sandeep
Pubblicazione: (2025)
di: Neela, Sandeep
Pubblicazione: (2025)
Machine Learning with Privacy for Protected Attributes
di: Mahloujifar, Saeed, et al.
Pubblicazione: (2025)
di: Mahloujifar, Saeed, et al.
Pubblicazione: (2025)
Quantifying Manifolds: Do the manifolds learned by Generative Adversarial Networks converge to the real data manifold
di: Chaudhuri, Anupam, et al.
Pubblicazione: (2024)
di: Chaudhuri, Anupam, et al.
Pubblicazione: (2024)
Distribution Learning with Valid Outputs Beyond the Worst-Case
di: Rittler, Nick, et al.
Pubblicazione: (2024)
di: Rittler, Nick, et al.
Pubblicazione: (2024)
A Closer Look at the Learnability of Out-of-Distribution (OOD) Detection
di: Garov, Konstantin, et al.
Pubblicazione: (2025)
di: Garov, Konstantin, et al.
Pubblicazione: (2025)
Pinpointing crucial steps: Attribution-based Credit Assignment for Verifiable Reinforcement Learning
di: Yin, Junxi, et al.
Pubblicazione: (2025)
di: Yin, Junxi, et al.
Pubblicazione: (2025)
Dynamic Influence Tracker: Measuring Time-Varying Sample Influence During Training
di: Xu, Jie, et al.
Pubblicazione: (2025)
di: Xu, Jie, et al.
Pubblicazione: (2025)
Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Private
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
NN-Former: Rethinking Graph Structure in Neural Architecture Representation
di: Xu, Ruihan, et al.
Pubblicazione: (2025)
di: Xu, Ruihan, et al.
Pubblicazione: (2025)
OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs
di: Gao, Yuting, et al.
Pubblicazione: (2025)
di: Gao, Yuting, et al.
Pubblicazione: (2025)
Understanding and Improving Noisy Embedding Techniques in Instruction Finetuning
di: Yadav, Abhay
Pubblicazione: (2026)
di: Yadav, Abhay
Pubblicazione: (2026)
SPICED: Syntactical Bug and Trojan Pattern Identification in A/MS Circuits using LLM-Enhanced Detection
di: Chaudhuri, Jayeeta, et al.
Pubblicazione: (2024)
di: Chaudhuri, Jayeeta, et al.
Pubblicazione: (2024)
Prompt Tuning Strikes Back: Customizing Foundation Models with Low-Rank Prompt Adaptation
di: Jain, Abhinav, et al.
Pubblicazione: (2024)
di: Jain, Abhinav, et al.
Pubblicazione: (2024)
Generalized Group Data Attribution
di: Ley, Dan, et al.
Pubblicazione: (2024)
di: Ley, Dan, et al.
Pubblicazione: (2024)
Impossibility Theorems for Feature Attribution
di: Bilodeau, Blair, et al.
Pubblicazione: (2022)
di: Bilodeau, Blair, et al.
Pubblicazione: (2022)
Batched Low-Rank Adaptation of Foundation Models
di: Wen, Yeming, et al.
Pubblicazione: (2023)
di: Wen, Yeming, et al.
Pubblicazione: (2023)
Enhancing LLMs for Physics Problem-Solving using Reinforcement Learning with Human-AI Feedback
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FairProof : Confidential and Certifiable Fairness for Neural Networks
di: Yadav, Chhavi, et al.
Pubblicazione: (2024) -
ExpProof : Operationalizing Explanations for Confidential Models with ZKPs
di: Yadav, Chhavi, et al.
Pubblicazione: (2025) -
Can We Infer Confidential Properties of Training Data from LLMs?
di: Huang, Pengrun, et al.
Pubblicazione: (2025) -
Curriculum Learning for Safety Alignment
di: Kumar, Sandeep, et al.
Pubblicazione: (2026) -
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
di: Wang, Erchi, et al.
Pubblicazione: (2026)