How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Michael, Subramani, Nishant |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models
por: Li, Michael, et al.
Publicado: (2025)
por: Li, Michael, et al.
Publicado: (2025)
Discursive Circuits: How Do Language Models Understand Discourse Relations?
por: Miao, Yisong, et al.
Publicado: (2025)
por: Miao, Yisong, et al.
Publicado: (2025)
Personal Information Parroting in Language Models
por: Subramani, Nishant, et al.
Publicado: (2026)
por: Subramani, Nishant, et al.
Publicado: (2026)
Do Large Language Models Know How Much They Know?
por: Prato, Gabriele, et al.
Publicado: (2025)
por: Prato, Gabriele, et al.
Publicado: (2025)
Task--Specificity Score: Measuring How Much Instructions Really Matter for Supervision
por: Kadasi, Pritam, et al.
Publicado: (2026)
por: Kadasi, Pritam, et al.
Publicado: (2026)
Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion
por: Mehta, Maitrey, et al.
Publicado: (2026)
por: Mehta, Maitrey, et al.
Publicado: (2026)
How Much Do LLMs Know About Chinese Zero Pronouns?
por: Li, Yifei, et al.
Publicado: (2026)
por: Li, Yifei, et al.
Publicado: (2026)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
por: Krasnovsky, Anatoly A.
Publicado: (2025)
por: Krasnovsky, Anatoly A.
Publicado: (2025)
Hatevolution: What Static Benchmarks Don't Tell Us
por: Di Bonaventura, Chiara, et al.
Publicado: (2025)
por: Di Bonaventura, Chiara, et al.
Publicado: (2025)
LLM Circuit Analyses Are Consistent Across Training and Scale
por: Tigges, Curt, et al.
Publicado: (2024)
por: Tigges, Curt, et al.
Publicado: (2024)
LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
por: Liu, Jiarui, et al.
Publicado: (2025)
por: Liu, Jiarui, et al.
Publicado: (2025)
What Artificial Neural Networks Can Tell Us About Human Language Acquisition
por: Warstadt, Alex, et al.
Publicado: (2022)
por: Warstadt, Alex, et al.
Publicado: (2022)
BertaQA: How Much Do Language Models Know About Local Culture?
por: Etxaniz, Julen, et al.
Publicado: (2024)
por: Etxaniz, Julen, et al.
Publicado: (2024)
Circuit Stability Characterizes Language Model Generalization
por: Sun, Alan
Publicado: (2025)
por: Sun, Alan
Publicado: (2025)
How Much Do LLMs Hallucinate across Languages? On Realistic Multilingual Estimation of LLM Hallucination
por: Islam, Saad Obaid ul, et al.
Publicado: (2025)
por: Islam, Saad Obaid ul, et al.
Publicado: (2025)
What Can String Probability Tell Us About Grammaticality?
por: Hu, Jennifer, et al.
Publicado: (2025)
por: Hu, Jennifer, et al.
Publicado: (2025)
Who Are All The Stochastic Parrots Imitating? They Should Tell Us!
por: Shaier, Sagi, et al.
Publicado: (2023)
por: Shaier, Sagi, et al.
Publicado: (2023)
SimBA: Simplifying Benchmark Analysis Using Performance Matrices Alone
por: Subramani, Nishant, et al.
Publicado: (2025)
por: Subramani, Nishant, et al.
Publicado: (2025)
Architecture, Not Scale: Circuit Localization in Large Language Models
por: Venkatesh, Sohan
Publicado: (2026)
por: Venkatesh, Sohan
Publicado: (2026)
Understanding Language Model Circuits through Knowledge Editing
por: Ge, Huaizhi, et al.
Publicado: (2024)
por: Ge, Huaizhi, et al.
Publicado: (2024)
How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent
por: Jung, Sungwoo, et al.
Publicado: (2026)
por: Jung, Sungwoo, et al.
Publicado: (2026)
Electronic Circuit Principles of Large Language Models
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
How Much Annotation is Needed to Compare Summarization Models?
por: Shaib, Chantal, et al.
Publicado: (2024)
por: Shaib, Chantal, et al.
Publicado: (2024)
Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?
por: Balepur, Nishant, et al.
Publicado: (2024)
por: Balepur, Nishant, et al.
Publicado: (2024)
How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models
por: Frank, Gregory N.
Publicado: (2026)
por: Frank, Gregory N.
Publicado: (2026)
How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
por: Liang, Zi, et al.
Publicado: (2025)
por: Liang, Zi, et al.
Publicado: (2025)
Mechanistic Circuit-Based Knowledge Editing in Large Language Models
por: Zhao, Tianyi, et al.
Publicado: (2026)
por: Zhao, Tianyi, et al.
Publicado: (2026)
Do LLMs "Feel"? Emotion Circuits Discovery and Control
por: Wang, Chenxi, et al.
Publicado: (2025)
por: Wang, Chenxi, et al.
Publicado: (2025)
CktFormalizer: Autoformalization of Natural Language into Circuit Representations
por: Xiong, Jing, et al.
Publicado: (2026)
por: Xiong, Jing, et al.
Publicado: (2026)
How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control
por: Li, Kunhang, et al.
Publicado: (2025)
por: Li, Kunhang, et al.
Publicado: (2025)
Circuit Distillation
por: Wadhwa, Somin, et al.
Publicado: (2025)
por: Wadhwa, Somin, et al.
Publicado: (2025)
Circuit Component Reuse Across Tasks in Transformer Language Models
por: Merullo, Jack, et al.
Publicado: (2023)
por: Merullo, Jack, et al.
Publicado: (2023)
How Do LLMs Acquire New Knowledge? A Knowledge Circuits Perspective on Continual Pre-Training
por: Ou, Yixin, et al.
Publicado: (2025)
por: Ou, Yixin, et al.
Publicado: (2025)
Language Model Circuits Are Sparse in the Neuron Basis
por: Arora, Aryaman, et al.
Publicado: (2026)
por: Arora, Aryaman, et al.
Publicado: (2026)
Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models
por: Lasnier, Théo, et al.
Publicado: (2026)
por: Lasnier, Théo, et al.
Publicado: (2026)
Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models
por: Lan, Michael, et al.
Publicado: (2023)
por: Lan, Michael, et al.
Publicado: (2023)
CSP-Atlas: Concept-Specific Neural Circuits in a Sparse Python Transformer
por: Wilam, Piotr
Publicado: (2026)
por: Wilam, Piotr
Publicado: (2026)
Circuit Fingerprints: How Answer Tokens Encode Their Geometrical Path
por: Saurez, Andres, et al.
Publicado: (2026)
por: Saurez, Andres, et al.
Publicado: (2026)
How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models
por: Schwethelm, Kristian, et al.
Publicado: (2026)
por: Schwethelm, Kristian, et al.
Publicado: (2026)
Judge Circuits
por: Feldhus, Nils, et al.
Publicado: (2026)
por: Feldhus, Nils, et al.
Publicado: (2026)
Ejemplares similares
-
Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models
por: Li, Michael, et al.
Publicado: (2025) -
Discursive Circuits: How Do Language Models Understand Discourse Relations?
por: Miao, Yisong, et al.
Publicado: (2025) -
Personal Information Parroting in Language Models
por: Subramani, Nishant, et al.
Publicado: (2026) -
Do Large Language Models Know How Much They Know?
por: Prato, Gabriele, et al.
Publicado: (2025) -
Task--Specificity Score: Measuring How Much Instructions Really Matter for Supervision
por: Kadasi, Pritam, et al.
Publicado: (2026)