A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Guancheng, Luo, Yisi, He, Zhengfu, Jin, Zhenyu, Ge, Xuyang, Shu, Wentao, Meng, Deyu, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning
par: Wang, Junxuan, et autres
Publié: (2025)
par: Wang, Junxuan, et autres
Publié: (2025)
Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures
par: Wang, Junxuan, et autres
Publié: (2024)
par: Wang, Junxuan, et autres
Publié: (2024)
Dictionary Learning Improves Patch-Free Circuit Discovery in Mechanistic Interpretability: A Case Study on Othello-GPT
par: He, Zhengfu, et autres
Publié: (2024)
par: He, Zhengfu, et autres
Publié: (2024)
Tracing the Thought of a Grandmaster-level Chess-Playing Transformer
par: Lin, Rui, et autres
Publié: (2026)
par: Lin, Rui, et autres
Publié: (2026)
Automatically Identifying Local and Global Circuits with Linear Computation Graphs
par: Ge, Xuyang, et autres
Publié: (2024)
par: Ge, Xuyang, et autres
Publié: (2024)
Evolution of Concepts in Language Model Pre-Training
par: Ge, Xuyang, et autres
Publié: (2025)
par: Ge, Xuyang, et autres
Publié: (2025)
Towards Understanding the Nature of Attention with Low-Rank Sparse Decomposition
par: He, Zhengfu, et autres
Publié: (2025)
par: He, Zhengfu, et autres
Publié: (2025)
Compressive Imaging Reconstruction via Tensor Decomposed Multi-Resolution Grid Encoding
par: Jin, Zhenyu, et autres
Publié: (2025)
par: Jin, Zhenyu, et autres
Publié: (2025)
Revisiting Nonlocal Self-Similarity from Continuous Representation
par: Luo, Yisi, et autres
Publié: (2024)
par: Luo, Yisi, et autres
Publié: (2024)
Continuous Representation Methods, Theories, and Applications: An Overview and Perspectives
par: Luo, Yisi, et autres
Publié: (2025)
par: Luo, Yisi, et autres
Publié: (2025)
Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders
par: He, Zhengfu, et autres
Publié: (2024)
par: He, Zhengfu, et autres
Publié: (2024)
Unveiling the Mechanism of Continuous Representation Full-Waveform Inversion: A Wave Based Neural Tangent Kernel Framework
par: Chen, Ruihua, et autres
Publié: (2026)
par: Chen, Ruihua, et autres
Publié: (2026)
NeurTV: Total Variation on the Neural Domain
par: Luo, Yisi, et autres
Publié: (2024)
par: Luo, Yisi, et autres
Publié: (2024)
Cross-Frequency Implicit Neural Representation with Self-Evolving Parameters
par: Yu, Chang, et autres
Publié: (2025)
par: Yu, Chang, et autres
Publié: (2025)
Beyond Low-rankness: Guaranteed Matrix Recovery via Modified Nuclear Norm
par: Peng, Jiangjun, et autres
Publié: (2025)
par: Peng, Jiangjun, et autres
Publié: (2025)
Deciphering Neural Reparameterized Full-Waveform Inversion with Neural Sensitivity Kernel and Wave Tangent Kernel
par: Chen, Ruihua, et autres
Publié: (2026)
par: Chen, Ruihua, et autres
Publié: (2026)
Spatial Information Bottleneck for Interpretable Visual Recognition
par: Shu, Kaixiang, et autres
Publié: (2025)
par: Shu, Kaixiang, et autres
Publié: (2025)
Neural Approximation and Its Applications
par: Wu, Wei-Hao, et autres
Publié: (2026)
par: Wu, Wei-Hao, et autres
Publié: (2026)
Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination
par: Zhang, Dong-Xiao, et autres
Publié: (2026)
par: Zhang, Dong-Xiao, et autres
Publié: (2026)
Generate Point Clouds with Multiscale Details from Graph-Represented Structures
par: Yang, Ximing, et autres
Publié: (2021)
par: Yang, Ximing, et autres
Publié: (2021)
Simultaneous Swap Regret Minimization via KL-Calibration
par: Luo, Haipeng, et autres
Publié: (2025)
par: Luo, Haipeng, et autres
Publié: (2025)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
par: Yan, Ge, et autres
Publié: (2025)
par: Yan, Ge, et autres
Publié: (2025)
Principled Out-of-Distribution Generalization via Simplicity
par: Ge, Jiawei, et autres
Publié: (2025)
par: Ge, Jiawei, et autres
Publié: (2025)
Can AI Assistants Know What They Don't Know?
par: Cheng, Qinyuan, et autres
Publié: (2024)
par: Cheng, Qinyuan, et autres
Publié: (2024)
Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning
par: Cui, Zhenyu, et autres
Publié: (2026)
par: Cui, Zhenyu, et autres
Publié: (2026)
Making Large Language Models Better Reasoners with Orchestrated Streaming Experiences
par: Liu, Xiangyang, et autres
Publié: (2025)
par: Liu, Xiangyang, et autres
Publié: (2025)
Soft-Evidence Fused Graph Neural Network for Cancer Driver Gene Identification across Multi-View Biological Graphs
par: Chen, Bang, et autres
Publié: (2025)
par: Chen, Bang, et autres
Publié: (2025)
Interpretability in Parameter Space: Minimizing Mechanistic Description Length with Attribution-based Parameter Decomposition
par: Braun, Dan, et autres
Publié: (2025)
par: Braun, Dan, et autres
Publié: (2025)
TRG-Net: An Interpretable and Controllable Rain Generator
par: Pang, Zhiqiang, et autres
Publié: (2024)
par: Pang, Zhiqiang, et autres
Publié: (2024)
A Unified Dual Consensus Approach to Distributed Optimization with Globally-Coupled Constraints
par: Liu, Zixuan, et autres
Publié: (2025)
par: Liu, Zixuan, et autres
Publié: (2025)
Chain-of-Restoration: Multi-Task Image Restoration Models are Zero-Shot Step-by-Step Universal Image Restorers
par: Cao, Jin, et autres
Publié: (2024)
par: Cao, Jin, et autres
Publié: (2024)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
par: Zong, Yi, et autres
Publié: (2024)
par: Zong, Yi, et autres
Publié: (2024)
Differentially Private Distribution Release of Gaussian Mixture Models via KL-Divergence Minimization
par: Liu, Hang, et autres
Publié: (2025)
par: Liu, Hang, et autres
Publié: (2025)
A Novel Control Method of Sugar Boiling Based on Model‐Free Adaptive Control and Neural Networks
par: Guancheng Lu, et autres
Publié: (2025)
par: Guancheng Lu, et autres
Publié: (2025)
Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering
par: Yu, Zeping, et autres
Publié: (2024)
par: Yu, Zeping, et autres
Publié: (2024)
Limiting Behavior of Constraint Minimizers for Inhomogeneous Fractional Schrödinger Equations
par: Zhang, Hongfei, et autres
Publié: (2023)
par: Zhang, Hongfei, et autres
Publié: (2023)
A Novel Robot Hand with Hoeckens Linkages and Soft Phalanges for Scooping and Self-Adaptive Grasping in Environmental Constraints
par: Guo, Wentao, et autres
Publié: (2025)
par: Guo, Wentao, et autres
Publié: (2025)
MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning
par: He, Jesse, et autres
Publié: (2026)
par: He, Jesse, et autres
Publié: (2026)
Improving Memory Efficiency for Training KANs via Meta Learning
par: Zhao, Zhangchi, et autres
Publié: (2025)
par: Zhao, Zhangchi, et autres
Publié: (2025)
Understanding the Generalization of Bilevel Programming in Hyperparameter Optimization: A Tale of Bias-Variance Decomposition
par: Zhou, Yubo, et autres
Publié: (2026)
par: Zhou, Yubo, et autres
Publié: (2026)
Documents similaires
-
Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning
par: Wang, Junxuan, et autres
Publié: (2025) -
Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures
par: Wang, Junxuan, et autres
Publié: (2024) -
Dictionary Learning Improves Patch-Free Circuit Discovery in Mechanistic Interpretability: A Case Study on Othello-GPT
par: He, Zhengfu, et autres
Publié: (2024) -
Tracing the Thought of a Grandmaster-level Chess-Playing Transformer
par: Lin, Rui, et autres
Publié: (2026) -
Automatically Identifying Local and Global Circuits with Linear Computation Graphs
par: Ge, Xuyang, et autres
Publié: (2024)