LLM Circuit Analyses Are Consistent Across Training and Scale
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tigges, Curt, Hanna, Michael, Yu, Qinan, Biderman, Stella |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transformer-Based Models Are Not Yet Perfect At Learning to Emulate Structural Recursion
par: Zhang, Dylan, et autres
Publié: (2024)
par: Zhang, Dylan, et autres
Publié: (2024)
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
par: van der Wal, Oskar, et autres
Publié: (2025)
par: van der Wal, Oskar, et autres
Publié: (2025)
Grokking Group Multiplication with Cosets
par: Stander, Dashiell, et autres
Publié: (2023)
par: Stander, Dashiell, et autres
Publié: (2023)
LEACE: Perfect linear concept erasure in closed form
par: Belrose, Nora, et autres
Publié: (2023)
par: Belrose, Nora, et autres
Publié: (2023)
Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?
par: Schaeffer, Rylan, et autres
Publié: (2024)
par: Schaeffer, Rylan, et autres
Publié: (2024)
Zero-shot Factual Consistency Evaluation Across Domains
par: Agarwal, Raunak
Publié: (2024)
par: Agarwal, Raunak
Publié: (2024)
Circuit Component Reuse Across Tasks in Transformer Language Models
par: Merullo, Jack, et autres
Publié: (2023)
par: Merullo, Jack, et autres
Publié: (2023)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms
par: Hanna, Michael, et autres
Publié: (2024)
par: Hanna, Michael, et autres
Publié: (2024)
Transcoders Find Interpretable LLM Feature Circuits
par: Dunefsky, Jacob, et autres
Publié: (2024)
par: Dunefsky, Jacob, et autres
Publié: (2024)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Scaling with Collapse: Efficient and Predictable Training of LLM Families
par: Bergsma, Shane, et autres
Publié: (2025)
par: Bergsma, Shane, et autres
Publié: (2025)
WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling
par: Li, Jiacheng, et autres
Publié: (2025)
par: Li, Jiacheng, et autres
Publié: (2025)
Representation Consistency for Accurate and Coherent LLM Answer Aggregation
par: Jiang, Junqi, et autres
Publié: (2025)
par: Jiang, Junqi, et autres
Publié: (2025)
Quantifying the Effect of Test Set Contamination on Generative Evaluations
par: Schaeffer, Rylan, et autres
Publié: (2026)
par: Schaeffer, Rylan, et autres
Publié: (2026)
Training-Inference Consistent Segmented Execution for Long-Context LLMs
par: Shang, Xianpeng, et autres
Publié: (2026)
par: Shang, Xianpeng, et autres
Publié: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
par: Liang, Yu, et autres
Publié: (2026)
par: Liang, Yu, et autres
Publié: (2026)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2026)
par: Zhu, Dingwei, et autres
Publié: (2026)
Efficient Training of Language Models with Compact and Consistent Next Token Distributions
par: Sathe, Ashutosh, et autres
Publié: (2024)
par: Sathe, Ashutosh, et autres
Publié: (2024)
Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
par: Hejabi, Parsa, et autres
Publié: (2025)
par: Hejabi, Parsa, et autres
Publié: (2025)
Towards Best Practices for Open Datasets for LLM Training
par: Baack, Stefan, et autres
Publié: (2025)
par: Baack, Stefan, et autres
Publié: (2025)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
par: Kim, Junseok, et autres
Publié: (2026)
par: Kim, Junseok, et autres
Publié: (2026)
POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation
par: Qiu, Zeju, et autres
Publié: (2026)
par: Qiu, Zeju, et autres
Publié: (2026)
FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
par: Patel, Ajay, et autres
Publié: (2026)
par: Patel, Ajay, et autres
Publié: (2026)
Scaling Law for Quantization-Aware Training
par: Chen, Mengzhao, et autres
Publié: (2025)
par: Chen, Mengzhao, et autres
Publié: (2025)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
Efficiently Scaling LLM Reasoning with Certaindex
par: Fu, Yichao, et autres
Publié: (2024)
par: Fu, Yichao, et autres
Publié: (2024)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
par: Yu, Qiying, et autres
Publié: (2025)
par: Yu, Qiying, et autres
Publié: (2025)
Prescriptive Scaling Laws for Data Constrained Training
par: Lovelace, Justin, et autres
Publié: (2026)
par: Lovelace, Justin, et autres
Publié: (2026)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
par: Wan, Zhongwei, et autres
Publié: (2026)
par: Wan, Zhongwei, et autres
Publié: (2026)
Consolidating Rewarded Perturbations for LLM Post-Training
par: Zhang, Zheyu, et autres
Publié: (2026)
par: Zhang, Zheyu, et autres
Publié: (2026)
Speculative Decoding Across Languages
par: Paudel, Nirajan, et autres
Publié: (2026)
par: Paudel, Nirajan, et autres
Publié: (2026)
Self-Training Meets Consistency: Improving LLMs' Reasoning with Consistency-Driven Rationale Evaluation
par: Lee, Jaehyeok, et autres
Publié: (2024)
par: Lee, Jaehyeok, et autres
Publié: (2024)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
par: Krasnovsky, Anatoly A.
Publié: (2025)
par: Krasnovsky, Anatoly A.
Publié: (2025)
UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Bridging Internal Probability and Self-Consistency for Effective and Efficient LLM Reasoning
par: Zhou, Zhi, et autres
Publié: (2025)
par: Zhou, Zhi, et autres
Publié: (2025)
Scaling Optimal LR Across Token Horizons
par: Bjorck, Johan, et autres
Publié: (2024)
par: Bjorck, Johan, et autres
Publié: (2024)
Prompt Curriculum Learning for Efficient LLM Post-Training
par: Gao, Zhaolin, et autres
Publié: (2025)
par: Gao, Zhaolin, et autres
Publié: (2025)
ZClip: Adaptive Spike Mitigation for LLM Pre-Training
par: Kumar, Abhay, et autres
Publié: (2025)
par: Kumar, Abhay, et autres
Publié: (2025)
Judge Circuits
par: Feldhus, Nils, et autres
Publié: (2026)
par: Feldhus, Nils, et autres
Publié: (2026)
Documents similaires
-
Transformer-Based Models Are Not Yet Perfect At Learning to Emulate Structural Recursion
par: Zhang, Dylan, et autres
Publié: (2024) -
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
par: van der Wal, Oskar, et autres
Publié: (2025) -
Grokking Group Multiplication with Cosets
par: Stander, Dashiell, et autres
Publié: (2023) -
LEACE: Perfect linear concept erasure in closed form
par: Belrose, Nora, et autres
Publié: (2023) -
Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?
par: Schaeffer, Rylan, et autres
Publié: (2024)