Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Junhao, Yu, Haonan, Yan, Zhenyu, Zhang, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Focus-LIME: Surgical Interpretation of Long-Context Large Language Models via Proxy-Based Neighborhood Selection
par: Liu, Junhao, et autres
Publié: (2026)
par: Liu, Junhao, et autres
Publié: (2026)
MAnchors: Memorization-Based Acceleration of Anchors via Rule Reuse and Transformation
par: Yu, Haonan, et autres
Publié: (2025)
par: Yu, Haonan, et autres
Publié: (2025)
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025)
par: Butler, Landon, et autres
Publié: (2025)
Interpretability Can Be Actionable
par: Orgad, Hadas, et autres
Publié: (2026)
par: Orgad, Hadas, et autres
Publié: (2026)
Locally Interpretable Individualized Treatment Rules for Black-Box Decision Models
par: Charvadeh, Yasin Khadem, et autres
Publié: (2026)
par: Charvadeh, Yasin Khadem, et autres
Publié: (2026)
Actionable Interpretability via Causal Hypergraphs: Unravelling Batch Size Effects in Deep Learning
par: Sun, Zhongtian, et autres
Publié: (2025)
par: Sun, Zhongtian, et autres
Publié: (2025)
Actionable Interpretability Must Be Defined in Terms of Symmetries
par: Barbiero, Pietro, et autres
Publié: (2026)
par: Barbiero, Pietro, et autres
Publié: (2026)
From Black-Box to White-Box: Control-Theoretic Neural Network Interpretability
par: Moon, Jihoon
Publié: (2025)
par: Moon, Jihoon
Publié: (2025)
Locally Pareto-Optimal Interpretations for Black-Box Machine Learning Models
par: Joshi, Aniruddha, et autres
Publié: (2025)
par: Joshi, Aniruddha, et autres
Publié: (2025)
Comparing Post-Hoc Explainable AI Methods for Interpreting Black-Box EEG Models in Depression Detection
par: Šarčević, Antonia, et autres
Publié: (2026)
par: Šarčević, Antonia, et autres
Publié: (2026)
Interpreting GFlowNets for Drug Discovery: Extracting Actionable Insights for Medicinal Chemistry
par: S, Amirtha Varshini A, et autres
Publié: (2025)
par: S, Amirtha Varshini A, et autres
Publié: (2025)
E-TCAV: Formalizing Penultimate Proxies for Efficient Concept Based Interpretability
par: Aslam, Hasib, et autres
Publié: (2026)
par: Aslam, Hasib, et autres
Publié: (2026)
CIRCUIT: A Benchmark for Circuit Interpretation and Reasoning Capabilities of LLMs
par: Skelic, Lejla, et autres
Publié: (2025)
par: Skelic, Lejla, et autres
Publié: (2025)
Interpreting Inflammation Prediction Model via Tag-based Cohort Explanation
par: Meng, Fanyu, et autres
Publié: (2024)
par: Meng, Fanyu, et autres
Publié: (2024)
Black Box Model Explanations and the Human Interpretability Expectations -- An Analysis in the Context of Homicide Prediction
par: Ribeiro, José, et autres
Publié: (2022)
par: Ribeiro, José, et autres
Publié: (2022)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
par: Sitawarin, Chawin, et autres
Publié: (2024)
par: Sitawarin, Chawin, et autres
Publié: (2024)
BlackBoxToBlueprint: Extracting Interpretable Logic from Legacy Systems using Reinforcement Learning and Counterfactual Analysis
par: Rathore, Vidhi
Publié: (2025)
par: Rathore, Vidhi
Publié: (2025)
Unlocking Interpretability for RF Sensing: A Complex-Valued White-Box Transformer
par: Zhang, Xie, et autres
Publié: (2025)
par: Zhang, Xie, et autres
Publié: (2025)
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
par: Lingam, Vijay, et autres
Publié: (2026)
par: Lingam, Vijay, et autres
Publié: (2026)
FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion
par: Fan, Tao, et autres
Publié: (2026)
par: Fan, Tao, et autres
Publié: (2026)
VidModEx: Interpretable and Efficient Black Box Model Extraction for High-Dimensional Spaces
par: Kumar, Somnath Sendhil, et autres
Publié: (2024)
par: Kumar, Somnath Sendhil, et autres
Publié: (2024)
Benchmarking Counterfactual Interpretability in Deep Learning Models for Time Series Classification
par: Kan, Ziwen, et autres
Publié: (2024)
par: Kan, Ziwen, et autres
Publié: (2024)
Demystifying MuZero Planning: Interpreting the Learned Model
par: Guei, Hung, et autres
Publié: (2024)
par: Guei, Hung, et autres
Publié: (2024)
WLFM: A Well-Logs Foundation Model for Multi-Task and Cross-Well Geological Interpretation
par: Qi, Zhenyu, et autres
Publié: (2025)
par: Qi, Zhenyu, et autres
Publié: (2025)
Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs
par: Li, Changhao, et autres
Publié: (2024)
par: Li, Changhao, et autres
Publié: (2024)
Sharpness-Aware Black-Box Optimization
par: Ye, Feiyang, et autres
Publié: (2024)
par: Ye, Feiyang, et autres
Publié: (2024)
Explanation Space: A New Perspective into Time Series Interpretability
par: Rezaei, Shahbaz, et autres
Publié: (2024)
par: Rezaei, Shahbaz, et autres
Publié: (2024)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
par: Kroeger, Nicholas, et autres
Publié: (2023)
par: Kroeger, Nicholas, et autres
Publié: (2023)
Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability
par: Lee, Yu-Ting, et autres
Publié: (2025)
par: Lee, Yu-Ting, et autres
Publié: (2025)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
Interpreting the Effects of Quantization on LLMs
par: Singh, Manpreet, et autres
Publié: (2025)
par: Singh, Manpreet, et autres
Publié: (2025)
From Black-box to Causal-box: Towards Building More Interpretable Models
par: Hwang, Inwoo, et autres
Publié: (2025)
par: Hwang, Inwoo, et autres
Publié: (2025)
Black-Box Time-Series Domain Adaptation via Cross-Prompt Foundation Models
par: Furqon, M. T., et autres
Publié: (2025)
par: Furqon, M. T., et autres
Publié: (2025)
Dynamic Interpretability for Model Comparison via Decision Rules
par: Rida, Adam, et autres
Publié: (2023)
par: Rida, Adam, et autres
Publié: (2023)
Interpreting Language Reward Models via Contrastive Explanations
par: Jiang, Junqi, et autres
Publié: (2024)
par: Jiang, Junqi, et autres
Publié: (2024)
Gnothi Seauton: Empowering Faithful Self-Interpretability in Black-Box Transformers
par: Wang, Shaobo, et autres
Publié: (2024)
par: Wang, Shaobo, et autres
Publié: (2024)
Meta Additive Model: Interpretable Sparse Learning With Auto Weighting
par: Zhang, Xuelin, et autres
Publié: (2026)
par: Zhang, Xuelin, et autres
Publié: (2026)
MolWorld: Molecule World Models for Actionable Molecular Optimization
par: Qiao, Yang, et autres
Publié: (2026)
par: Qiao, Yang, et autres
Publié: (2026)
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
par: Li, Zhaoxin, et autres
Publié: (2025)
par: Li, Zhaoxin, et autres
Publié: (2025)
PUPAE: Intuitive and Actionable Explanations for Time Series Anomalies
par: Der, Audrey, et autres
Publié: (2024)
par: Der, Audrey, et autres
Publié: (2024)
Documents similaires
-
Focus-LIME: Surgical Interpretation of Long-Context Large Language Models via Proxy-Based Neighborhood Selection
par: Liu, Junhao, et autres
Publié: (2026) -
MAnchors: Memorization-Based Acceleration of Anchors via Rule Reuse and Transformation
par: Yu, Haonan, et autres
Publié: (2025) -
ProxySPEX: Inference-Efficient Interpretability via Sparse Feature Interactions in LLMs
par: Butler, Landon, et autres
Publié: (2025) -
Interpretability Can Be Actionable
par: Orgad, Hadas, et autres
Publié: (2026) -
Locally Interpretable Individualized Treatment Rules for Black-Box Decision Models
par: Charvadeh, Yasin Khadem, et autres
Publié: (2026)