Saved in:
| Main Authors: | Cheon, Seung Hyun, Stewart, Meredith, Kulynych, Bogdan, Weng, Tsui-Wei, Ustun, Berk |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2507.02169 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Prediction without Preclusion: Recourse Verification with Reachable Sets
by: Kothari, Avni, et al.
Published: (2023)
by: Kothari, Avni, et al.
Published: (2023)
Understanding Fixed Predictions via Confined Regions
by: Lawless, Connor, et al.
Published: (2025)
by: Lawless, Connor, et al.
Published: (2025)
Concept Bottleneck Large Language Models
by: Sun, Chung-En, et al.
Published: (2024)
by: Sun, Chung-En, et al.
Published: (2024)
Feature Responsiveness Scores: Model-Agnostic Explanations for Recourse
by: Cheon, Harry, et al.
Published: (2024)
by: Cheon, Harry, et al.
Published: (2024)
Observational Multiplicity
by: George, Erin, et al.
Published: (2025)
by: George, Erin, et al.
Published: (2025)
Classification with Conceptual Safeguards
by: Joren, Hailey, et al.
Published: (2024)
by: Joren, Hailey, et al.
Published: (2024)
Lost in the Averages: A New Specific Setup to Evaluate Membership Inference Attacks Against Machine Learning Models
by: Krčo, Nataša, et al.
Published: (2024)
by: Krčo, Nataša, et al.
Published: (2024)
Explanations are a Means to an End: Decision Theoretic Explanation Evaluation
by: Guo, Ziyang, et al.
Published: (2025)
by: Guo, Ziyang, et al.
Published: (2025)
Should I use Synthetic Data for That? An Analysis of the Suitability of Synthetic Data for Data Sharing and Augmentation
by: Kulynych, Bogdan, et al.
Published: (2026)
by: Kulynych, Bogdan, et al.
Published: (2026)
Tight Auditing of Differential Privacy in MST and AIM
by: Ganev, Georgi, et al.
Published: (2026)
by: Ganev, Georgi, et al.
Published: (2026)
Regretful Decisions under Label Noise
by: Nagaraj, Sujay, et al.
Published: (2025)
by: Nagaraj, Sujay, et al.
Published: (2025)
The Fundamental Limits of Least-Privilege Learning
by: Stadler, Theresa, et al.
Published: (2024)
by: Stadler, Theresa, et al.
Published: (2024)
Linear Explanations for Individual Neurons
by: Oikarinen, Tuomas, et al.
Published: (2024)
by: Oikarinen, Tuomas, et al.
Published: (2024)
Evaluating Neuron Explanations: A Unified Framework with Sanity Checks
by: Oikarinen, Tuomas, et al.
Published: (2025)
by: Oikarinen, Tuomas, et al.
Published: (2025)
RAT: Boosting Misclassification Detection Ability without Extra Data
by: Yan, Ge, et al.
Published: (2025)
by: Yan, Ge, et al.
Published: (2025)
Interpretability-Guided Test-Time Adversarial Defense
by: Kulkarni, Akshay, et al.
Published: (2024)
by: Kulkarni, Akshay, et al.
Published: (2024)
Unifying Re-Identification, Attribute Inference, and Data Reconstruction Risks in Differential Privacy
by: Kulynych, Bogdan, et al.
Published: (2025)
by: Kulynych, Bogdan, et al.
Published: (2025)
FINEST: Stabilizing Recommendations by Rank-Preserving Fine-Tuning
by: Oh, Sejoon, et al.
Published: (2024)
by: Oh, Sejoon, et al.
Published: (2024)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
by: Yan, Ge, et al.
Published: (2025)
by: Yan, Ge, et al.
Published: (2025)
VLG-CBM: Training Concept Bottleneck Models with Vision-Language Guidance
by: Srivastava, Divyansh, et al.
Published: (2024)
by: Srivastava, Divyansh, et al.
Published: (2024)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
by: Sun, Chung-En, et al.
Published: (2025)
by: Sun, Chung-En, et al.
Published: (2025)
Effective Skill Unlearning through Intervention and Abstention
by: Li, Yongce, et al.
Published: (2025)
by: Li, Yongce, et al.
Published: (2025)
Crafting Large Language Models for Enhanced Interpretability
by: Sun, Chung-En, et al.
Published: (2024)
by: Sun, Chung-En, et al.
Published: (2024)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
by: Sun, Chung-En, et al.
Published: (2024)
by: Sun, Chung-En, et al.
Published: (2024)
Learning under Temporal Label Noise
by: Nagaraj, Sujay, et al.
Published: (2024)
by: Nagaraj, Sujay, et al.
Published: (2024)
Attack-Aware Noise Calibration for Differential Privacy
by: Kulynych, Bogdan, et al.
Published: (2024)
by: Kulynych, Bogdan, et al.
Published: (2024)
Provably Robust Conformal Prediction with Improved Efficiency
by: Yan, Ge, et al.
Published: (2024)
by: Yan, Ge, et al.
Published: (2024)
Graph Concept Bottleneck Models
by: Xu, Haotian, et al.
Published: (2025)
by: Xu, Haotian, et al.
Published: (2025)
Participatory Assessment of Large Language Model Applications in an Academic Medical Center
by: Carra, Giorgia, et al.
Published: (2024)
by: Carra, Giorgia, et al.
Published: (2024)
Unsupervised Machine Learning for Detecting Structural Anomalies in European Regional Statistics
by: Oancea, Bogdan
Published: (2026)
by: Oancea, Bogdan
Published: (2026)
Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity
by: Xu, Haotian, et al.
Published: (2025)
by: Xu, Haotian, et al.
Published: (2025)
Gaussian DP for Reporting Differential Privacy Guarantees in Machine Learning
by: Gomez, Juan Felipe, et al.
Published: (2025)
by: Gomez, Juan Felipe, et al.
Published: (2025)
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability
by: Oikarinen, Tuomas, et al.
Published: (2025)
by: Oikarinen, Tuomas, et al.
Published: (2025)
CI-CBM: Class-Incremental Concept Bottleneck Model for Interpretable Continual Learning
by: Javadi, Amirhosein, et al.
Published: (2026)
by: Javadi, Amirhosein, et al.
Published: (2026)
Predictive Churn with the Set of Good Models
by: Watson-Daniels, Jamelle, et al.
Published: (2024)
by: Watson-Daniels, Jamelle, et al.
Published: (2024)
Abstracted Shapes as Tokens -- A Generalizable and Interpretable Model for Time-series Classification
by: Wen, Yunshi, et al.
Published: (2024)
by: Wen, Yunshi, et al.
Published: (2024)
Probabilistic Federated Prompt-Tuning with Non-IID and Imbalanced Data
by: Weng, Pei-Yau, et al.
Published: (2025)
by: Weng, Pei-Yau, et al.
Published: (2025)
Minimax optimal transfer learning for high-dimensional additive regression
by: Moon, Seung Hyun
Published: (2025)
by: Moon, Seung Hyun
Published: (2025)
Interpretable Generative Models through Post-hoc Concept Bottlenecks
by: Kulkarni, Akshay, et al.
Published: (2025)
by: Kulkarni, Akshay, et al.
Published: (2025)
Interpreting Neurons in Deep Vision Networks with Language Models
by: Bai, Nicholas, et al.
Published: (2024)
by: Bai, Nicholas, et al.
Published: (2024)
Similar Items
-
Prediction without Preclusion: Recourse Verification with Reachable Sets
by: Kothari, Avni, et al.
Published: (2023) -
Understanding Fixed Predictions via Confined Regions
by: Lawless, Connor, et al.
Published: (2025) -
Concept Bottleneck Large Language Models
by: Sun, Chung-En, et al.
Published: (2024) -
Feature Responsiveness Scores: Model-Agnostic Explanations for Recourse
by: Cheon, Harry, et al.
Published: (2024) -
Observational Multiplicity
by: George, Erin, et al.
Published: (2025)