Engineering Verifiable Modularity in Transformers via Per-Layer Supervision
Fuente:
arXiv
Saved in:
| Main Author: | Kerce, J. Clayton |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Interpretable-by-Design Transformers via Architectural Stream Independence
by: Kerce, Clayton, et al.
Published: (2026)
by: Kerce, Clayton, et al.
Published: (2026)
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
by: Kerce, J. Clayton, et al.
Published: (2026)
by: Kerce, J. Clayton, et al.
Published: (2026)
GLIDR: Graph-Like Inductive Logic Programming with Differentiable Reasoning
by: Johnson, Blair, et al.
Published: (2025)
by: Johnson, Blair, et al.
Published: (2025)
Stream separation improves Bregman conditioning in transformers
by: Kerce, James Clayton
Published: (2026)
by: Kerce, James Clayton
Published: (2026)
KLAS: Using Similarity to Stitch Neural Networks for Improved Accuracy-Efficiency Tradeoffs
by: Sanyal, Debopam, et al.
Published: (2026)
by: Sanyal, Debopam, et al.
Published: (2026)
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
by: Gull, Ayesha, et al.
Published: (2025)
by: Gull, Ayesha, et al.
Published: (2025)
Modular Jets for Supervised Pipelines: Diagnosing Mirage vs Identifiability
by: Sanyal, Suman
Published: (2025)
by: Sanyal, Suman
Published: (2025)
Understanding Transformer Reasoning Capabilities via Graph Algorithms
by: Sanford, Clayton, et al.
Published: (2024)
by: Sanford, Clayton, et al.
Published: (2024)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
by: Guan, Xinyan, et al.
Published: (2024)
by: Guan, Xinyan, et al.
Published: (2024)
On the Ability of Transformers to Verify Plans
by: Sarrof, Yash, et al.
Published: (2026)
by: Sarrof, Yash, et al.
Published: (2026)
Logic Synthesis Optimization with Predictive Self-Supervision via Causal Transformers
by: Karimi, Raika, et al.
Published: (2024)
by: Karimi, Raika, et al.
Published: (2024)
GoldenTransformer: A Modular Fault Injection Framework for Transformer Robustness Research
by: Howard, Luke
Published: (2025)
by: Howard, Luke
Published: (2025)
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
by: Wang, Jingyi, et al.
Published: (2026)
by: Wang, Jingyi, et al.
Published: (2026)
Multi-Layer Attention-Based Explainability via Transformers for Tabular Data
by: Gavito, Andrea Treviño, et al.
Published: (2023)
by: Gavito, Andrea Treviño, et al.
Published: (2023)
A Layer-wise Analysis of Supervised Fine-Tuning
by: Zhao, Qinghua, et al.
Published: (2026)
by: Zhao, Qinghua, et al.
Published: (2026)
Escaping the Verifier: Learning to Reason via Demonstrations
by: Cai, Locke, et al.
Published: (2025)
by: Cai, Locke, et al.
Published: (2025)
Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective
by: Jia, Zeyu, et al.
Published: (2025)
by: Jia, Zeyu, et al.
Published: (2025)
Time Series Forecasting via Direct Per-Step Probability Distribution Modeling
by: Kong, Linghao, et al.
Published: (2025)
by: Kong, Linghao, et al.
Published: (2025)
Learning Modular Exponentiation with Transformers
by: Africa, David Demitri, et al.
Published: (2025)
by: Africa, David Demitri, et al.
Published: (2025)
CALM: A CKA-Guided Adaptive Layer-Wise Modularization Framework for LLM Quantization
by: Zhang, Jinhao, et al.
Published: (2025)
by: Zhang, Jinhao, et al.
Published: (2025)
Temporal Inductive Logic Reasoning over Hypergraphs
by: Yang, Yuan, et al.
Published: (2022)
by: Yang, Yuan, et al.
Published: (2022)
Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers
by: Sun, Yuanxu, et al.
Published: (2026)
by: Sun, Yuanxu, et al.
Published: (2026)
Neural Organ Transplantation (NOT): Checkpoint-Based Modular Adaptation for Transformer Models
by: Al-Zuraiqi, Ahmad
Published: (2026)
by: Al-Zuraiqi, Ahmad
Published: (2026)
AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization
by: Cranney, Caleb, et al.
Published: (2025)
by: Cranney, Caleb, et al.
Published: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
by: Wang, Zhen, et al.
Published: (2025)
by: Wang, Zhen, et al.
Published: (2025)
Per-Domain Generalizing Policies: On Validation Instances and Scaling Behavior
by: Gros, Timo P., et al.
Published: (2025)
by: Gros, Timo P., et al.
Published: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
by: Kim, Yoonjeon, et al.
Published: (2025)
by: Kim, Yoonjeon, et al.
Published: (2025)
Towards Empirical Interpretation of Internal Circuits and Properties in Grokked Transformers on Modular Polynomials
by: Furuta, Hiroki, et al.
Published: (2024)
by: Furuta, Hiroki, et al.
Published: (2024)
Transformer Normalisation Layers and the Independence of Semantic Subspaces
by: Menary, Stephen, et al.
Published: (2024)
by: Menary, Stephen, et al.
Published: (2024)
Dynamic Layer Tying for Parameter-Efficient Transformers
by: Hay, Tamir David, et al.
Published: (2024)
by: Hay, Tamir David, et al.
Published: (2024)
Layer Specialization Underlying Compositional Reasoning in Transformers
by: Liu, Jing
Published: (2025)
by: Liu, Jing
Published: (2025)
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
by: Cai, Xin-Qiang, et al.
Published: (2025)
by: Cai, Xin-Qiang, et al.
Published: (2025)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
by: Wen, Xuexiang, et al.
Published: (2026)
by: Wen, Xuexiang, et al.
Published: (2026)
Deep Learning with Pretrained 'Internal World' Layers: A Gemma 3-Based Modular Architecture for Wildfire Prediction
by: Jadouli, Ayoub, et al.
Published: (2025)
by: Jadouli, Ayoub, et al.
Published: (2025)
WARP: Guaranteed Inner-Layer Repair of NLP Transformers
by: Hsu, Hsin-Ling, et al.
Published: (2026)
by: Hsu, Hsin-Ling, et al.
Published: (2026)
Universal Approximation Theorem for a Single-Layer Transformer
by: Gumaan, Esmail
Published: (2025)
by: Gumaan, Esmail
Published: (2025)
Time Series Representation Learning with Supervised Contrastive Temporal Transformer
by: Liu, Yuansan, et al.
Published: (2024)
by: Liu, Yuansan, et al.
Published: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
by: Zhu, Zining, et al.
Published: (2025)
by: Zhu, Zining, et al.
Published: (2025)
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
by: Li, Zhuo, et al.
Published: (2026)
by: Li, Zhuo, et al.
Published: (2026)
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers
by: Seo, Wooseok, et al.
Published: (2025)
by: Seo, Wooseok, et al.
Published: (2025)
Similar Items
-
Interpretable-by-Design Transformers via Architectural Stream Independence
by: Kerce, Clayton, et al.
Published: (2026) -
The Dual-Stream Transformer: Channelized Architecture for Interpretable Language Modeling
by: Kerce, J. Clayton, et al.
Published: (2026) -
GLIDR: Graph-Like Inductive Logic Programming with Differentiable Reasoning
by: Johnson, Blair, et al.
Published: (2025) -
Stream separation improves Bregman conditioning in transformers
by: Kerce, James Clayton
Published: (2026) -
KLAS: Using Similarity to Stitch Neural Networks for Improved Accuracy-Efficiency Tradeoffs
by: Sanyal, Debopam, et al.
Published: (2026)