SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Chanin, David, Garriga-Alonso, Adrià |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025)
di: Chanin, David, et al.
Pubblicazione: (2025)
Are Sparse Autoencoder Benchmarks Reliable?
di: Chanin, David
Pubblicazione: (2026)
di: Chanin, David
Pubblicazione: (2026)
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
di: Arcuschin, Iván, et al.
Pubblicazione: (2026)
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
di: Golechha, Satvik, et al.
Pubblicazione: (2025)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Path Channels and Plan Extension Kernels: a Mechanistic Description of Planning in a Sokoban RNN
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2025)
Interpreting Emergent Planning in Model-Free Reinforcement Learning
di: Bush, Thomas, et al.
Pubblicazione: (2025)
di: Bush, Thomas, et al.
Pubblicazione: (2025)
Data Whitening Improves Sparse Autoencoder Learning
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
CasualSynth: Generating Structurally Sound Synthetic Data
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
DiFR: Inference Verification Despite Nondeterminism
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
di: Karvonen, Adam, et al.
Pubblicazione: (2025)
Sparse Autoencoders, Again?
di: Lu, Yin, et al.
Pubblicazione: (2025)
di: Lu, Yin, et al.
Pubblicazione: (2025)
Empirical Evaluation of Progressive Coding for Sparse Autoencoders
di: Peter, Hans, et al.
Pubblicazione: (2025)
di: Peter, Hans, et al.
Pubblicazione: (2025)
Planning in a recurrent neural network that plays Sokoban
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
di: Taufeeque, Mohammad, et al.
Pubblicazione: (2024)
MisSynth: Improving MISSCI Logical Fallacies Classification with Synthetic Data
di: Poliakov, Mykhailo, et al.
Pubblicazione: (2025)
di: Poliakov, Mykhailo, et al.
Pubblicazione: (2025)
Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality
di: Lee, Sewoong, et al.
Pubblicazione: (2025)
di: Lee, Sewoong, et al.
Pubblicazione: (2025)
AD4RL: Autonomous Driving Benchmarks for Offline Reinforcement Learning with Value-based Dataset
di: Lee, Dongsu, et al.
Pubblicazione: (2024)
di: Lee, Dongsu, et al.
Pubblicazione: (2024)
A Comparative Study of Open-Source Libraries for Synthetic Tabular Data Generation: SDV vs. SynthCity
di: Del Gobbo, Cristian
Pubblicazione: (2025)
di: Del Gobbo, Cristian
Pubblicazione: (2025)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Hypothesis Testing the Circuit Hypothesis in LLMs
di: Shi, Claudia, et al.
Pubblicazione: (2024)
di: Shi, Claudia, et al.
Pubblicazione: (2024)
SynthAgent: Adapting Web Agents with Synthetic Supervision
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2025)
MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation
di: Riaz, Haris, et al.
Pubblicazione: (2025)
di: Riaz, Haris, et al.
Pubblicazione: (2025)
InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques
di: Gupta, Rohan, et al.
Pubblicazione: (2024)
di: Gupta, Rohan, et al.
Pubblicazione: (2024)
SynthDST: Synthetic Data is All You Need for Few-Shot Dialog State Tracking
di: Kulkarni, Atharva, et al.
Pubblicazione: (2024)
di: Kulkarni, Atharva, et al.
Pubblicazione: (2024)
Improving Sparse Autoencoder with Dynamic Attention
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
Generating Realistic Adversarial Examples for Business Processes using Variational Autoencoders
di: Stevens, Alexander, et al.
Pubblicazione: (2024)
di: Stevens, Alexander, et al.
Pubblicazione: (2024)
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
di: Li, Aaron J., et al.
Pubblicazione: (2025)
di: Li, Aaron J., et al.
Pubblicazione: (2025)
Sparse $L^1$-Autoencoders for Scientific Data Compression
di: Chung, Matthias, et al.
Pubblicazione: (2024)
di: Chung, Matthias, et al.
Pubblicazione: (2024)
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
Adaptive Sparse Allocation with Mutual Choice & Feature Choice Sparse Autoencoders
di: Ayonrinde, Kola
Pubblicazione: (2024)
di: Ayonrinde, Kola
Pubblicazione: (2024)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
Do Sparse Autoencoders Capture Concept Manifolds?
di: Bhalla, Usha, et al.
Pubblicazione: (2026)
di: Bhalla, Usha, et al.
Pubblicazione: (2026)
Improving Dictionary Learning with Gated Sparse Autoencoders
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
di: Rajamanoharan, Senthooran, et al.
Pubblicazione: (2024)
On the transferability of Sparse Autoencoders for interpreting compressed models
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
di: Gupte, Suchit, et al.
Pubblicazione: (2025)
Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
di: Minegishi, Gouki, et al.
Pubblicazione: (2025)
Dynamic Linear Coregionalization for Realistic Synthetic Multivariate Time Series
di: Vapsi, Annita, et al.
Pubblicazione: (2026)
di: Vapsi, Annita, et al.
Pubblicazione: (2026)
Improving Robustness In Sparse Autoencoders via Masked Regularization
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025) -
Feature Hedging: Correlated Features Break Narrow Sparse Autoencoders
di: Chanin, David, et al.
Pubblicazione: (2025) -
Are Sparse Autoencoder Benchmarks Reliable?
di: Chanin, David
Pubblicazione: (2026) -
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
di: Arcuschin, Iván, et al.
Pubblicazione: (2026) -
Among Us: A Sandbox for Measuring and Detecting Agentic Deception
di: Golechha, Satvik, et al.
Pubblicazione: (2025)