Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sovrano, Francesco, Dominici, Gabriele, Langheinrich, Marc |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Global XAI Methods Reveal Injected Bias in LLMs? SHAP vs Rule Extraction vs RuleSHAP
por: Sovrano, Francesco
Publicado: (2025)
por: Sovrano, Francesco
Publicado: (2025)
In-Context Symbolic Regression for Robustness-Improved Kolmogorov-Arnold Networks
por: Sovrano, Francesco, et al.
Publicado: (2026)
por: Sovrano, Francesco, et al.
Publicado: (2026)
Counterfactual Concept Bottleneck Models
por: Dominici, Gabriele, et al.
Publicado: (2024)
por: Dominici, Gabriele, et al.
Publicado: (2024)
Causal Concept Graph Models: Beyond Causal Opacity in Deep Learning
por: Dominici, Gabriele, et al.
Publicado: (2024)
por: Dominici, Gabriele, et al.
Publicado: (2024)
Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering
por: Sovrano, Francesco, et al.
Publicado: (2026)
por: Sovrano, Francesco, et al.
Publicado: (2026)
Interpretable Hierarchical Concept Reasoning through Attention-Guided Graph Learning
por: Debot, David, et al.
Publicado: (2025)
por: Debot, David, et al.
Publicado: (2025)
Rule-Bottleneck Reinforcement Learning: Joint Explanation and Decision Optimization for Resource Allocation with Language Agents
por: Tec, Mauricio, et al.
Publicado: (2025)
por: Tec, Mauricio, et al.
Publicado: (2025)
Evaluating Explanations Through LLMs: Beyond Traditional User Studies
por: De Bona, Francesco Bombassei, et al.
Publicado: (2024)
por: De Bona, Francesco Bombassei, et al.
Publicado: (2024)
Model Agreement via Anchoring
por: Eaton, Eric, et al.
Publicado: (2026)
por: Eaton, Eric, et al.
Publicado: (2026)
Counterfactual Explanations for Clustering Models
por: Spagnol, Aurora, et al.
Publicado: (2024)
por: Spagnol, Aurora, et al.
Publicado: (2024)
Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models
por: Li, Kunhao, et al.
Publicado: (2025)
por: Li, Kunhao, et al.
Publicado: (2025)
Automatically Finding Rule-Based Neurons in OthelloGPT
por: Singh, Aditya, et al.
Publicado: (2025)
por: Singh, Aditya, et al.
Publicado: (2025)
Enabling Regional Explainability by Automatic and Model-agnostic Rule Extraction
por: Chen, Yu, et al.
Publicado: (2024)
por: Chen, Yu, et al.
Publicado: (2024)
Is General-Purpose AI Reasoning Sensitive to Data-Induced Cognitive Biases? Dynamic Benchmarking on Typical Software Engineering Dilemmas
por: Sovrano, Francesco, et al.
Publicado: (2025)
por: Sovrano, Francesco, et al.
Publicado: (2025)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
por: Chen, Sihan, et al.
Publicado: (2025)
por: Chen, Sihan, et al.
Publicado: (2025)
NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
por: Zhou, Yi, et al.
Publicado: (2025)
por: Zhou, Yi, et al.
Publicado: (2025)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
por: Wang, Yongxin, et al.
Publicado: (2025)
por: Wang, Yongxin, et al.
Publicado: (2025)
Learning Mathematical Rules with Large Language Models
por: Gorceix, Antoine, et al.
Publicado: (2024)
por: Gorceix, Antoine, et al.
Publicado: (2024)
Model Fusion via Neuron Transplantation
por: Öz, Muhammed, et al.
Publicado: (2025)
por: Öz, Muhammed, et al.
Publicado: (2025)
Interpreting Language Reward Models via Contrastive Explanations
por: Jiang, Junqi, et al.
Publicado: (2024)
por: Jiang, Junqi, et al.
Publicado: (2024)
SCALPEL: Selective Capability Ablation via Low-rank Parameter Editing for Large Language Model Interpretability Analysis
por: Fu, Zihao, et al.
Publicado: (2026)
por: Fu, Zihao, et al.
Publicado: (2026)
CORTEX: A Cost-Sensitive Rule and Tree Extraction Method
por: Kopanja, Marija, et al.
Publicado: (2025)
por: Kopanja, Marija, et al.
Publicado: (2025)
Automatic Extraction of Linguistic Description from Fuzzy Rule Base
por: Siminski, Krzysztof, et al.
Publicado: (2024)
por: Siminski, Krzysztof, et al.
Publicado: (2024)
Metadata Extraction Leveraging Large Language Models
por: Han, Cuize, et al.
Publicado: (2025)
por: Han, Cuize, et al.
Publicado: (2025)
Differential Privacy for Anomaly Detection: Analyzing the Trade-off Between Privacy and Explainability
por: Ezzeddine, Fatima, et al.
Publicado: (2024)
por: Ezzeddine, Fatima, et al.
Publicado: (2024)
MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
por: Wang, Jason Z
Publicado: (2026)
por: Wang, Jason Z
Publicado: (2026)
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
por: Li, Shuozhe, et al.
Publicado: (2026)
por: Li, Shuozhe, et al.
Publicado: (2026)
Large Language Models for In-File Vulnerability Localization Can Be "Lost in the End"
por: Sovrano, Francesco, et al.
Publicado: (2025)
por: Sovrano, Francesco, et al.
Publicado: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
Hierarchical Federated Unlearning for Large Language Models
por: Zhong, Yisheng, et al.
Publicado: (2025)
por: Zhong, Yisheng, et al.
Publicado: (2025)
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
por: D'Oosterlinck, Karel, et al.
Publicado: (2024)
por: D'Oosterlinck, Karel, et al.
Publicado: (2024)
Efficient Large Language Model Inference with Neural Block Linearization
por: Erdogan, Mete, et al.
Publicado: (2025)
por: Erdogan, Mete, et al.
Publicado: (2025)
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
por: Kazemi, Hamid, et al.
Publicado: (2026)
por: Kazemi, Hamid, et al.
Publicado: (2026)
SPIN: Sparsifying and Integrating Internal Neurons in Large Language Models for Text Classification
por: Jiao, Difan, et al.
Publicado: (2023)
por: Jiao, Difan, et al.
Publicado: (2023)
CELL your Model: Contrastive Explanations for Large Language Models
por: Luss, Ronny, et al.
Publicado: (2024)
por: Luss, Ronny, et al.
Publicado: (2024)
Leveraging Foundation Language Models (FLMs) for Automated Cohort Extraction from Large EHR Databases
por: Mugambi, Purity, et al.
Publicado: (2024)
por: Mugambi, Purity, et al.
Publicado: (2024)
Confidence Regulation Neurons in Language Models
por: Stolfo, Alessandro, et al.
Publicado: (2024)
por: Stolfo, Alessandro, et al.
Publicado: (2024)
FDRMFL:Multi-modal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning
por: Wu, Haozhe
Publicado: (2025)
por: Wu, Haozhe
Publicado: (2025)
Doubly Robust Alignment for Large Language Models
por: Xu, Erhan, et al.
Publicado: (2025)
por: Xu, Erhan, et al.
Publicado: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
por: Zhao, Kaixiang, et al.
Publicado: (2025)
por: Zhao, Kaixiang, et al.
Publicado: (2025)
Ejemplares similares
-
Can Global XAI Methods Reveal Injected Bias in LLMs? SHAP vs Rule Extraction vs RuleSHAP
por: Sovrano, Francesco
Publicado: (2025) -
In-Context Symbolic Regression for Robustness-Improved Kolmogorov-Arnold Networks
por: Sovrano, Francesco, et al.
Publicado: (2026) -
Counterfactual Concept Bottleneck Models
por: Dominici, Gabriele, et al.
Publicado: (2024) -
Causal Concept Graph Models: Beyond Causal Opacity in Deep Learning
por: Dominici, Gabriele, et al.
Publicado: (2024) -
Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering
por: Sovrano, Francesco, et al.
Publicado: (2026)