Concept-SAE: Active Causal Probing of Visual Model Behavior
Fuente:
arXiv
Salvato in:
| Autori principali: | Ding, Jianrong, Chen, Muxi, Zhao, Chenchen, Xu, Qiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
\textit{FocaLogic}: Logic-Based Interpretation of Visual Model Decisions
di: Zhao, Chenchen, et al.
Pubblicazione: (2026)
di: Zhao, Chenchen, et al.
Pubblicazione: (2026)
HiBug2: Efficient and Interpretable Error Slice Discovery for Comprehensive Model Debugging
di: Chen, Muxi, et al.
Pubblicazione: (2025)
di: Chen, Muxi, et al.
Pubblicazione: (2025)
FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution
di: Ding, Jianrong, et al.
Pubblicazione: (2026)
di: Ding, Jianrong, et al.
Pubblicazione: (2026)
AlignSAE: Concept-Aligned Sparse Autoencoders
di: Yang, Minglai, et al.
Pubblicazione: (2025)
di: Yang, Minglai, et al.
Pubblicazione: (2025)
Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits
di: Yap, Jia Qing
Pubblicazione: (2026)
di: Yap, Jia Qing
Pubblicazione: (2026)
Structural Disentanglement of Causal and Correlated Concepts
di: Zhao, Qilong, et al.
Pubblicazione: (2024)
di: Zhao, Qilong, et al.
Pubblicazione: (2024)
Causal-INSIGHT: Probing Temporal Models to Extract Causal Structure
di: Redden, Benjamin, et al.
Pubblicazione: (2026)
di: Redden, Benjamin, et al.
Pubblicazione: (2026)
MCCE: Missingness-aware Causal Concept Explainer
di: Gao, Jifan, et al.
Pubblicazione: (2024)
di: Gao, Jifan, et al.
Pubblicazione: (2024)
Interpretable Reward Modeling with Active Concept Bottlenecks
di: Laguna, Sonia, et al.
Pubblicazione: (2025)
di: Laguna, Sonia, et al.
Pubblicazione: (2025)
Learning Latent and Hierarchical Structures in Cognitive Diagnosis Models
di: Ma, Chenchen, et al.
Pubblicazione: (2021)
di: Ma, Chenchen, et al.
Pubblicazione: (2021)
Causally Reliable Concept Bottleneck Models
di: De Felice, Giovanni, et al.
Pubblicazione: (2025)
di: De Felice, Giovanni, et al.
Pubblicazione: (2025)
VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
di: Shen, Shufan, et al.
Pubblicazione: (2025)
di: Shen, Shufan, et al.
Pubblicazione: (2025)
Tokenized SAEs: Disentangling SAE Reconstructions
di: Dooms, Thomas, et al.
Pubblicazione: (2025)
di: Dooms, Thomas, et al.
Pubblicazione: (2025)
Evaluating SAE interpretability without explanations
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
di: Paulo, Gonçalo, et al.
Pubblicazione: (2025)
Causal Concept Graph Models: Beyond Causal Opacity in Deep Learning
di: Dominici, Gabriele, et al.
Pubblicazione: (2024)
di: Dominici, Gabriele, et al.
Pubblicazione: (2024)
Unveiling and Causalizing CoT: A Causal Pespective
di: Fu, Jiarun, et al.
Pubblicazione: (2025)
di: Fu, Jiarun, et al.
Pubblicazione: (2025)
Structural Causality-based Generalizable Concept Discovery Models
di: Sinha, Sanchit, et al.
Pubblicazione: (2024)
di: Sinha, Sanchit, et al.
Pubblicazione: (2024)
ActiveCQ: Active Estimation of Causal Quantities
di: Gao, Erdun, et al.
Pubblicazione: (2025)
di: Gao, Erdun, et al.
Pubblicazione: (2025)
Evolution of SAE Features Across Layers in LLMs
di: Balcells, Daniel, et al.
Pubblicazione: (2024)
di: Balcells, Daniel, et al.
Pubblicazione: (2024)
SAE: Single Architecture Ensemble Neural Networks
di: Ferianc, Martin, et al.
Pubblicazione: (2024)
di: Ferianc, Martin, et al.
Pubblicazione: (2024)
Frequency Enhanced Pre-training for Cross-city Few-shot Traffic Forecasting
di: Liu, Zhanyu, et al.
Pubblicazione: (2024)
di: Liu, Zhanyu, et al.
Pubblicazione: (2024)
SCALAR: Benchmarking SAE Interaction Sparsity in Toy LLMs
di: Fillingham, Sean P., et al.
Pubblicazione: (2025)
di: Fillingham, Sean P., et al.
Pubblicazione: (2025)
CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds
di: Xu, Shaojun, et al.
Pubblicazione: (2026)
di: Xu, Shaojun, et al.
Pubblicazione: (2026)
A Survey of Deep Causal Models and Their Industrial Applications
di: Li, Zongyu, et al.
Pubblicazione: (2022)
di: Li, Zongyu, et al.
Pubblicazione: (2022)
Testing for Causal Fairness
di: Fu, Jiarun, et al.
Pubblicazione: (2025)
di: Fu, Jiarun, et al.
Pubblicazione: (2025)
TimeSAE: Sparse Decoding for Faithful Explanations of Black-Box Time Series Models
di: Oublal, Khalid, et al.
Pubblicazione: (2026)
di: Oublal, Khalid, et al.
Pubblicazione: (2026)
SAE-FD: Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
Active and Passive Causal Inference Learning
di: Im, Daniel Jiwoong, et al.
Pubblicazione: (2023)
di: Im, Daniel Jiwoong, et al.
Pubblicazione: (2023)
Integrating Active Learning in Causal Inference with Interference: A Novel Approach in Online Experiments
di: Zhu, Hongtao, et al.
Pubblicazione: (2024)
di: Zhu, Hongtao, et al.
Pubblicazione: (2024)
BECAUSE: Bilinear Causal Representation for Generalizable Offline Model-based Reinforcement Learning
di: Lin, Haohong, et al.
Pubblicazione: (2024)
di: Lin, Haohong, et al.
Pubblicazione: (2024)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
di: Lou, Hantao, et al.
Pubblicazione: (2025)
di: Lou, Hantao, et al.
Pubblicazione: (2025)
Causal Evidence that Language Models use Confidence to Drive Behavior
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
di: Kumaran, Dharshan, et al.
Pubblicazione: (2026)
OrtSAE: Orthogonal Sparse Autoencoders Uncover Atomic Features
di: Korznikov, Anton, et al.
Pubblicazione: (2025)
di: Korznikov, Anton, et al.
Pubblicazione: (2025)
Evaluating Synthetic Activations composed of SAE Latents in GPT-2
di: Giglemiani, Giorgi, et al.
Pubblicazione: (2024)
di: Giglemiani, Giorgi, et al.
Pubblicazione: (2024)
Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders
di: Cao, Tue M., et al.
Pubblicazione: (2026)
di: Cao, Tue M., et al.
Pubblicazione: (2026)
Learning Concept-Based Causal Transition and Symbolic Reasoning for Visual Planning
di: Qian, Yilue, et al.
Pubblicazione: (2023)
di: Qian, Yilue, et al.
Pubblicazione: (2023)
CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics
di: Ding, Ziyi, et al.
Pubblicazione: (2026)
di: Ding, Ziyi, et al.
Pubblicazione: (2026)
PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding
di: Koromilas, Panagiotis, et al.
Pubblicazione: (2026)
di: Koromilas, Panagiotis, et al.
Pubblicazione: (2026)
Causal Explanation of Concept Drift -- A Truly Actionable Approach
di: Komnick, David, et al.
Pubblicazione: (2025)
di: Komnick, David, et al.
Pubblicazione: (2025)
Documenti analoghi
-
\textit{FocaLogic}: Logic-Based Interpretation of Visual Model Decisions
di: Zhao, Chenchen, et al.
Pubblicazione: (2026) -
HiBug2: Efficient and Interpretable Error Slice Discovery for Comprehensive Model Debugging
di: Chen, Muxi, et al.
Pubblicazione: (2025) -
FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution
di: Ding, Jianrong, et al.
Pubblicazione: (2026) -
AlignSAE: Concept-Aligned Sparse Autoencoders
di: Yang, Minglai, et al.
Pubblicazione: (2025) -
Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits
di: Yap, Jia Qing
Pubblicazione: (2026)