Characterizing Data Point Vulnerability via Average-Case Robustness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Tessa, Srinivas, Suraj, Lakkaraju, Himabindu |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Unifying Interpretability and Control: Evaluation via Intervention
par: Bhalla, Usha, et autres
Publié: (2024)
par: Bhalla, Usha, et autres
Publié: (2024)
Discriminative Feature Attributions: Bridging Post Hoc Explainability and Inherent Interpretability
par: Bhalla, Usha, et autres
Publié: (2023)
par: Bhalla, Usha, et autres
Publié: (2023)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Generalized Group Data Attribution
par: Ley, Dan, et autres
Publié: (2024)
par: Ley, Dan, et autres
Publié: (2024)
Towards Unified Attribution in Explainable AI, Data-Centric AI, and Mechanistic Interpretability
par: Zhang, Shichang, et autres
Publié: (2025)
par: Zhang, Shichang, et autres
Publié: (2025)
All Roads Lead to Rome? Exploring Representational Similarities Between Latent Spaces of Generative Image Models
par: Badrinath, Charumathi, et autres
Publié: (2024)
par: Badrinath, Charumathi, et autres
Publié: (2024)
Which Models have Perceptually-Aligned Gradients? An Explanation via Off-Manifold Robustness
par: Srinivas, Suraj, et autres
Publié: (2023)
par: Srinivas, Suraj, et autres
Publié: (2023)
Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE)
par: Bhalla, Usha, et autres
Publié: (2024)
par: Bhalla, Usha, et autres
Publié: (2024)
On the Trade-offs between Adversarial Robustness and Actionable Explanations
par: Krishna, Satyapriya, et autres
Publié: (2023)
par: Krishna, Satyapriya, et autres
Publié: (2023)
Explaining the Model, Protecting Your Data: Revealing and Mitigating the Data Privacy Risks of Post-Hoc Model Explanations via Membership Inference
par: Huang, Catherine, et autres
Publié: (2024)
par: Huang, Catherine, et autres
Publié: (2024)
Towards Interpretable Soft Prompts
par: Patel, Oam, et autres
Publié: (2025)
par: Patel, Oam, et autres
Publié: (2025)
Learning Recourse Costs from Pairwise Feature Comparisons
par: Rawal, Kaivalya, et autres
Publié: (2024)
par: Rawal, Kaivalya, et autres
Publié: (2024)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
The Disagreement Problem in Explainable Machine Learning: A Practitioner's Perspective
par: Krishna, Satyapriya, et autres
Publié: (2022)
par: Krishna, Satyapriya, et autres
Publié: (2022)
Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning
par: Xiong, Zidi, et autres
Publié: (2026)
par: Xiong, Zidi, et autres
Publié: (2026)
In-Context Unlearning: Language Models as Few Shot Unlearners
par: Pawelczyk, Martin, et autres
Publié: (2023)
par: Pawelczyk, Martin, et autres
Publié: (2023)
Confronting LLMs with Traditional ML: Rethinking the Fairness of Large Language Models in Tabular Classifications
par: Liu, Yanchen, et autres
Publié: (2023)
par: Liu, Yanchen, et autres
Publié: (2023)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
par: Lobo, Elita, et autres
Publié: (2024)
par: Lobo, Elita, et autres
Publié: (2024)
Operationalizing the Blueprint for an AI Bill of Rights: Recommendations for Practitioners, Researchers, and Policy Makers
par: Oesterling, Alex, et autres
Publié: (2024)
par: Oesterling, Alex, et autres
Publié: (2024)
Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems
par: Zhang, Shichang, et autres
Publié: (2025)
par: Zhang, Shichang, et autres
Publié: (2025)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
par: Qi, Zhenting, et autres
Publié: (2024)
par: Qi, Zhenting, et autres
Publié: (2024)
Interpretability Needs a New Paradigm
par: Madsen, Andreas, et autres
Publié: (2024)
par: Madsen, Andreas, et autres
Publié: (2024)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
par: Pawelczyk, Martin, et autres
Publié: (2024)
par: Pawelczyk, Martin, et autres
Publié: (2024)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
par: Kroeger, Nicholas, et autres
Publié: (2023)
par: Kroeger, Nicholas, et autres
Publié: (2023)
Inference-Time Reward Hacking in Large Language Models
par: Khalaf, Hadi, et autres
Publié: (2025)
par: Khalaf, Hadi, et autres
Publié: (2025)
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
par: Han, Tessa, et autres
Publié: (2024)
par: Han, Tessa, et autres
Publié: (2024)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
par: Bhalla, Usha, et autres
Publié: (2025)
par: Bhalla, Usha, et autres
Publié: (2025)
How Much Can We Forget about Data Contamination?
par: Bordt, Sebastian, et autres
Publié: (2024)
par: Bordt, Sebastian, et autres
Publié: (2024)
D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting
par: Wu, Tianyu, et autres
Publié: (2026)
par: Wu, Tianyu, et autres
Publié: (2026)
How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence
par: Du, Hongzhe, et autres
Publié: (2025)
par: Du, Hongzhe, et autres
Publié: (2025)
OpenXAI: Towards a Transparent Evaluation of Model Explanations
par: Agarwal, Chirag, et autres
Publié: (2022)
par: Agarwal, Chirag, et autres
Publié: (2022)
A Study on the Calibration of In-context Learning
par: Zhang, Hanlin, et autres
Publié: (2023)
par: Zhang, Hanlin, et autres
Publié: (2023)
Efficient Private SCO for Heavy-Tailed Data via Averaged Clipping
par: Jin, Chenhan, et autres
Publié: (2022)
par: Jin, Chenhan, et autres
Publié: (2022)
Manipulating Large Language Models to Increase Product Visibility
par: Kumar, Aounon, et autres
Publié: (2024)
par: Kumar, Aounon, et autres
Publié: (2024)
EvoLM: In Search of Lost Language Model Training Dynamics
par: Qi, Zhenting, et autres
Publié: (2025)
par: Qi, Zhenting, et autres
Publié: (2025)
Fair Machine Unlearning: Data Removal while Mitigating Disparities
par: Oesterling, Alex, et autres
Publié: (2023)
par: Oesterling, Alex, et autres
Publié: (2023)
Exact Unlearning of Finetuning Data via Model Merging at Scale
par: Kuo, Kevin, et autres
Publié: (2025)
par: Kuo, Kevin, et autres
Publié: (2025)
Robust Regression over Averaged Uncertainty
par: Bertsimas, Dimitris, et autres
Publié: (2023)
par: Bertsimas, Dimitris, et autres
Publié: (2023)
Heterogeneous Multisource Transfer Learning via Model Averaging for Positive-Unlabeled Data
par: Liu, Jialei, et autres
Publié: (2025)
par: Liu, Jialei, et autres
Publié: (2025)
The Built-In Robustness of Decentralized Federated Averaging to Bad Data
par: Sabella, Samuele, et autres
Publié: (2025)
par: Sabella, Samuele, et autres
Publié: (2025)
Documents similaires
-
Towards Unifying Interpretability and Control: Evaluation via Intervention
par: Bhalla, Usha, et autres
Publié: (2024) -
Discriminative Feature Attributions: Bridging Post Hoc Explainability and Inherent Interpretability
par: Bhalla, Usha, et autres
Publié: (2023) -
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025) -
Generalized Group Data Attribution
par: Ley, Dan, et autres
Publié: (2024) -
Towards Unified Attribution in Explainable AI, Data-Centric AI, and Mechanistic Interpretability
par: Zhang, Shichang, et autres
Publié: (2025)