Trust Regions for Explanations via Black-Box Probabilistic Certification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dhurandhar, Amit, Haldar, Swagatam, Wei, Dennis, Ramamurthy, Karthikeyan Natesan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024)
par: Dhurandhar, Amit, et autres
Publié: (2024)
Identifying Sub-networks in Neural Networks via Functionally Similar Representations
par: Gao, Tian, et autres
Publié: (2024)
par: Gao, Tian, et autres
Publié: (2024)
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
When Stability meets Sufficiency: Informative Explanations that do not Overwhelm
par: Luss, Ronny, et autres
Publié: (2021)
par: Luss, Ronny, et autres
Publié: (2021)
Final-Model-Only Data Attribution with a Unifying View of Gradient-Based Methods
par: Wei, Dennis, et autres
Publié: (2024)
par: Wei, Dennis, et autres
Publié: (2024)
Large Language Model Confidence Estimation via Black-Box Access
par: Pedapati, Tejaswini, et autres
Publié: (2024)
par: Pedapati, Tejaswini, et autres
Publié: (2024)
CELL your Model: Contrastive Explanations for Large Language Models
par: Luss, Ronny, et autres
Publié: (2024)
par: Luss, Ronny, et autres
Publié: (2024)
LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
Multi-Level Explanations for Generative Language Models
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows
par: Ngong, Ivoline C., et autres
Publié: (2026)
par: Ngong, Ivoline C., et autres
Publié: (2026)
CoFrNets: Interpretable Neural Architecture Inspired by Continued Fractions
par: Puri, Isha, et autres
Publié: (2025)
par: Puri, Isha, et autres
Publié: (2025)
Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents
par: Ngong, Ivoline, et autres
Publié: (2025)
par: Ngong, Ivoline, et autres
Publié: (2025)
Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration
par: Mouzouni, Charafeddine
Publié: (2026)
par: Mouzouni, Charafeddine
Publié: (2026)
Beyond Linear Surrogates: High-Fidelity Local Explanations for Black-Box Models
par: Shrestha, Sanjeev, et autres
Publié: (2025)
par: Shrestha, Sanjeev, et autres
Publié: (2025)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025)
par: Villa, Danielle, et autres
Publié: (2025)
Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models
par: Schweiger, Niklas, et autres
Publié: (2026)
par: Schweiger, Niklas, et autres
Publié: (2026)
Locally-Minimal Probabilistic Explanations
par: Izza, Yacine, et autres
Publié: (2023)
par: Izza, Yacine, et autres
Publié: (2023)
Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM
par: Kumarappan, Adarsh, et autres
Publié: (2025)
par: Kumarappan, Adarsh, et autres
Publié: (2025)
GNNInterpreter: A Probabilistic Generative Model-Level Explanation for Graph Neural Networks
par: Wang, Xiaoqi, et autres
Publié: (2022)
par: Wang, Xiaoqi, et autres
Publié: (2022)
Rigorous Probabilistic Guarantees for Robust Counterfactual Explanations
par: Marzari, Luca, et autres
Publié: (2024)
par: Marzari, Luca, et autres
Publié: (2024)
Probabilistic Trust Intervals for Out of Distribution Detection
par: Singh, Gagandeep, et autres
Publié: (2021)
par: Singh, Gagandeep, et autres
Publié: (2021)
Counterfactual Explanations with Probabilistic Guarantees on their Robustness to Model Change
par: Stępka, Ignacy, et autres
Publié: (2024)
par: Stępka, Ignacy, et autres
Publié: (2024)
DiConStruct: Causal Concept-based Explanations through Black-Box Distillation
par: Moreira, Ricardo, et autres
Publié: (2024)
par: Moreira, Ricardo, et autres
Publié: (2024)
Safe Reinforcement Learning in Black-Box Environments via Adaptive Shielding
par: Bethell, Daniel, et autres
Publié: (2024)
par: Bethell, Daniel, et autres
Publié: (2024)
Black Box Model Explanations and the Human Interpretability Expectations -- An Analysis in the Context of Homicide Prediction
par: Ribeiro, José, et autres
Publié: (2022)
par: Ribeiro, José, et autres
Publié: (2022)
Learning Surrogates for Offline Black-Box Optimization via Gradient Matching
par: Hoang, Minh, et autres
Publié: (2025)
par: Hoang, Minh, et autres
Publié: (2025)
Probabilistically Plausible Counterfactual Explanations with Normalizing Flows
par: Wielopolski, Patryk, et autres
Publié: (2024)
par: Wielopolski, Patryk, et autres
Publié: (2024)
Sharpness-Aware Black-Box Optimization
par: Ye, Feiyang, et autres
Publié: (2024)
par: Ye, Feiyang, et autres
Publié: (2024)
A Probabilistic Consensus-Driven Approach for Robust Counterfactual Explanations
par: Kostrzewa, Marcin, et autres
Publié: (2026)
par: Kostrzewa, Marcin, et autres
Publié: (2026)
Trust Regions Sell, But Who's Buying? Overlap Geometry as an Alternative Trust Region for Policy Optimization
par: Trivedi, Gaurish, et autres
Publié: (2026)
par: Trivedi, Gaurish, et autres
Publié: (2026)
GLiRA: Black-Box Membership Inference Attack via Knowledge Distillation
par: Galichin, Andrey V., et autres
Publié: (2024)
par: Galichin, Andrey V., et autres
Publié: (2024)
Reasoning about concepts with LLMs: Inconsistencies abound
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
par: Liu, Junhao, et autres
Publié: (2025)
par: Liu, Junhao, et autres
Publié: (2025)
From Black Box to Insight: Explainable AI for Extreme Event Preparedness
par: Vu, Kiana, et autres
Publié: (2025)
par: Vu, Kiana, et autres
Publié: (2025)
Measuring the Fragility of Trust: Devising Credibility Index via Explanation Stability (CIES) for Business Decision Support Systems
par: Vaduva, Alin-Gabriel, et autres
Publié: (2026)
par: Vaduva, Alin-Gabriel, et autres
Publié: (2026)
Hyperparameter Optimisation with Practical Interpretability and Explanation Methods in Probabilistic Curriculum Learning
par: Salt, Llewyn, et autres
Publié: (2025)
par: Salt, Llewyn, et autres
Publié: (2025)
Benchmarking Instance-Centric Counterfactual Algorithms for XAI: From White Box to Black Box
par: Moreira, Catarina, et autres
Publié: (2022)
par: Moreira, Catarina, et autres
Publié: (2022)
In-Context Black-Box Optimization with Unreliable Feedback
par: Blumer, Nicolas Samuel, et autres
Publié: (2026)
par: Blumer, Nicolas Samuel, et autres
Publié: (2026)
The Argument is the Explanation: Structured Argumentation for Trust in Agents
par: Cakar, Ege, et autres
Publié: (2025)
par: Cakar, Ege, et autres
Publié: (2025)
Trust-Region Adaptive Policy Optimization
par: Su, Mingyu, et autres
Publié: (2025)
par: Su, Mingyu, et autres
Publié: (2025)
Documents similaires
-
Ranking Large Language Models without Ground Truth
par: Dhurandhar, Amit, et autres
Publié: (2024) -
Identifying Sub-networks in Neural Networks via Functionally Similar Representations
par: Gao, Tian, et autres
Publié: (2024) -
Programming Refusal with Conditional Activation Steering
par: Lee, Bruce W., et autres
Publié: (2024) -
When Stability meets Sufficiency: Informative Explanations that do not Overwhelm
par: Luss, Ronny, et autres
Publié: (2021) -
Final-Model-Only Data Attribution with a Unifying View of Gradient-Based Methods
par: Wei, Dennis, et autres
Publié: (2024)