Concept Layers: Enhancing Interpretability and Intervenability via LLM Conceptualization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bidusa, Or Raphael, Markovitch, Shaul |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Identifying Intervenable and Interpretable Features via Orthogonality Regularization
par: Miller, Moritz, et autres
Publié: (2026)
par: Miller, Moritz, et autres
Publié: (2026)
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
par: Garg, Ankur, et autres
Publié: (2025)
par: Garg, Ankur, et autres
Publié: (2025)
Attention Flows: Tracing LLM Conceptual Engagement via Story Summaries
par: Hicke, Rebecca M. M., et autres
Publié: (2026)
par: Hicke, Rebecca M. M., et autres
Publié: (2026)
Aligned at the Start: Conceptual Groupings in LLM Embeddings
par: Khatir, Mehrdad, et autres
Publié: (2024)
par: Khatir, Mehrdad, et autres
Publié: (2024)
One Example Shown, Many Concepts Known! Counterexample-Driven Conceptual Reasoning in Mathematical LLMs
par: Li, Yinghui, et autres
Publié: (2025)
par: Li, Yinghui, et autres
Publié: (2025)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
par: Sim, Woo Seob, et autres
Publié: (2026)
par: Sim, Woo Seob, et autres
Publié: (2026)
Variational Language Concepts for Interpreting Foundation Language Models
par: Wang, Hengyi, et autres
Publié: (2024)
par: Wang, Hengyi, et autres
Publié: (2024)
Parallel LLM Reasoning for Bias-Resilient, Robust Conceptual Abstraction
par: Adeseye, Aisvarya, et autres
Publié: (2026)
par: Adeseye, Aisvarya, et autres
Publié: (2026)
Robustly Improving LLM Fairness in Realistic Settings via Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
Interpreting Language Models Through Concept Descriptions: A Survey
par: Feldhus, Nils, et autres
Publié: (2025)
par: Feldhus, Nils, et autres
Publié: (2025)
Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space
par: Bigelow, Eric, et autres
Publié: (2026)
par: Bigelow, Eric, et autres
Publié: (2026)
Learning to Intervene on Concept Bottlenecks
par: Steinmann, David, et autres
Publié: (2023)
par: Steinmann, David, et autres
Publié: (2023)
Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants
par: Huang, Vincent, et autres
Publié: (2025)
par: Huang, Vincent, et autres
Publié: (2025)
Addressing LLM Diversity by Infusing Random Concepts
par: Agrawal, Pulin, et autres
Publié: (2026)
par: Agrawal, Pulin, et autres
Publié: (2026)
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
par: Gupta, Akshat, et autres
Publié: (2024)
par: Gupta, Akshat, et autres
Publié: (2024)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
par: Taniguchi, Rei, et autres
Publié: (2026)
par: Taniguchi, Rei, et autres
Publié: (2026)
From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts?
par: Mueller, Aaron, et autres
Publié: (2025)
par: Mueller, Aaron, et autres
Publié: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
Dr.LLM: Dynamic Layer Routing in LLMs
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
LESA: Learnable LLM Layer Scaling-Up
par: Yang, Yifei, et autres
Publié: (2025)
par: Yang, Yifei, et autres
Publié: (2025)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
par: Macar, Uzay, et autres
Publié: (2025)
par: Macar, Uzay, et autres
Publié: (2025)
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
par: Zheng, Hang, et autres
Publié: (2025)
par: Zheng, Hang, et autres
Publié: (2025)
Enhancing LLM Agent Safety via Causal Influence Prompting
par: Hahm, Dongyoon, et autres
Publié: (2025)
par: Hahm, Dongyoon, et autres
Publié: (2025)
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
par: Li, Changming, et autres
Publié: (2026)
par: Li, Changming, et autres
Publié: (2026)
Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits
par: Kalibhat, Neha, et autres
Publié: (2026)
par: Kalibhat, Neha, et autres
Publié: (2026)
TrimLLM: Progressive Layer Dropping for Domain-Specific LLMs
par: Hu, Lanxiang, et autres
Publié: (2024)
par: Hu, Lanxiang, et autres
Publié: (2024)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
par: Lou, Hantao, et autres
Publié: (2025)
par: Lou, Hantao, et autres
Publié: (2025)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
par: Chen, Jianhui, et autres
Publié: (2026)
par: Chen, Jianhui, et autres
Publié: (2026)
SLM Meets LLM: Balancing Latency, Interpretability and Consistency in Hallucination Detection
par: Hu, Mengya, et autres
Publié: (2024)
par: Hu, Mengya, et autres
Publié: (2024)
LLM-Guided Semantic Bootstrapping for Interpretable Text Classification with Tsetlin Machines
par: Gao, Jiechao, et autres
Publié: (2026)
par: Gao, Jiechao, et autres
Publié: (2026)
Joint Detection of Fraud and Concept Drift inOnline Conversations with LLM-Assisted Judgment
par: Senol, Ali, et autres
Publié: (2025)
par: Senol, Ali, et autres
Publié: (2025)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
par: Cheng, Pengyu, et autres
Publié: (2023)
par: Cheng, Pengyu, et autres
Publié: (2023)
Fair In-Context Learning via Latent Concept Variables
par: Bhaila, Karuna, et autres
Publié: (2024)
par: Bhaila, Karuna, et autres
Publié: (2024)
StateAct: Enhancing LLM Base Agents via Self-prompting and State-tracking
par: Rozanov, Nikolai, et autres
Publié: (2024)
par: Rozanov, Nikolai, et autres
Publié: (2024)
Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
par: Qin, Jiayu, et autres
Publié: (2025)
par: Qin, Jiayu, et autres
Publié: (2025)
DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis
par: Xu, Bowen, et autres
Publié: (2025)
par: Xu, Bowen, et autres
Publié: (2025)
Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation
par: Bi, Zhen, et autres
Publié: (2025)
par: Bi, Zhen, et autres
Publié: (2025)
Enhancing LLM Evaluations: The Garbling Trick
par: Bradley, William F.
Publié: (2024)
par: Bradley, William F.
Publié: (2024)
Documents similaires
-
Identifying Intervenable and Interpretable Features via Orthogonality Regularization
par: Miller, Moritz, et autres
Publié: (2026) -
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
par: Garg, Ankur, et autres
Publié: (2025) -
Attention Flows: Tracing LLM Conceptual Engagement via Story Summaries
par: Hicke, Rebecca M. M., et autres
Publié: (2026) -
Aligned at the Start: Conceptual Groupings in LLM Embeddings
par: Khatir, Mehrdad, et autres
Publié: (2024) -
One Example Shown, Many Concepts Known! Counterexample-Driven Conceptual Reasoning in Mathematical LLMs
par: Li, Yinghui, et autres
Publié: (2025)