IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yuhan, Zhang, Mingxu, Shen, Dazhong, Sun, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
SAE-FD: Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
di: Zhang, Mingxu, et al.
Pubblicazione: (2026)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025)
di: Jiang, Nick, et al.
Pubblicazione: (2025)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
di: Helff, Lukas, et al.
Pubblicazione: (2026)
di: Helff, Lukas, et al.
Pubblicazione: (2026)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Self-Interpretable Neural Networks
di: Ji, Yang, et al.
Pubblicazione: (2025)
di: Ji, Yang, et al.
Pubblicazione: (2025)
AtomDisc: An Atom-level Tokenizer that Boosts Molecular LLMs and Reveals Structure--Property Associations
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
di: Zhao, Daniel, et al.
Pubblicazione: (2025)
The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
Towards Interpretable Protein Structure Prediction with Sparse Autoencoders
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
di: Parsan, Nithin, et al.
Pubblicazione: (2025)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
ChemATP: A Training-Free Chemical Reasoning Framework for Large Language Models
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
di: Zhang, Mingxu, et al.
Pubblicazione: (2025)
SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
di: Cywiński, Bartosz, et al.
Pubblicazione: (2025)
Data Whitening Improves Sparse Autoencoder Learning
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
di: Saraswatula, Ashwin, et al.
Pubblicazione: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
di: Wang, Xu, et al.
Pubblicazione: (2026)
di: Wang, Xu, et al.
Pubblicazione: (2026)
Interpreting CLIP with Hierarchical Sparse Autoencoders
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
di: Zaigrajew, Vladimir, et al.
Pubblicazione: (2025)
Sparse Autoencoders, Again?
di: Lu, Yin, et al.
Pubblicazione: (2025)
di: Lu, Yin, et al.
Pubblicazione: (2025)
Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain
di: Qiu, Zhongxi, et al.
Pubblicazione: (2025)
di: Qiu, Zhongxi, et al.
Pubblicazione: (2025)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
di: Balagansky, Nikita, et al.
Pubblicazione: (2025)
DeepSelective: Interpretable Prognosis Prediction via Feature Selection and Compression in EHR Data
di: Zhang, Ruochi, et al.
Pubblicazione: (2025)
di: Zhang, Ruochi, et al.
Pubblicazione: (2025)
Improving Sparse Autoencoder with Dynamic Attention
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
di: Wang, Dongsheng, et al.
Pubblicazione: (2026)
Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability
di: Bhalla, Usha, et al.
Pubblicazione: (2025)
di: Bhalla, Usha, et al.
Pubblicazione: (2025)
Sparse Autoencoders for Sequential Recommendation Models: Interpretation and Flexible Control
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
di: Klenitskiy, Anton, et al.
Pubblicazione: (2025)
Improving Robustness In Sparse Autoencoders via Masked Regularization
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
di: Huang, Zhuoxu, et al.
Pubblicazione: (2026)
Are Sparse Autoencoder Benchmarks Reliable?
di: Chanin, David
Pubblicazione: (2026)
di: Chanin, David
Pubblicazione: (2026)
Interpreting Outliers in Time Series Data through Decoding Autoencoder
di: Knab, Patrick, et al.
Pubblicazione: (2024)
di: Knab, Patrick, et al.
Pubblicazione: (2024)
SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data
di: Chanin, David, et al.
Pubblicazione: (2026)
di: Chanin, David, et al.
Pubblicazione: (2026)
InterPLM: Discovering Interpretable Features in Protein Language Models via Sparse Autoencoders
di: Simon, Elana, et al.
Pubblicazione: (2024)
di: Simon, Elana, et al.
Pubblicazione: (2024)
Rethinking Sparse Autoencoders: Select-and-Project for Fairness and Control from Encoder Features Alone
di: Bărbălau, Antonio, et al.
Pubblicazione: (2025)
di: Bărbălau, Antonio, et al.
Pubblicazione: (2025)
Conformal Selective Acting: Anytime-Valid Risk Control for RLVR-Trained LLMs
di: Khosravi, Hamed, et al.
Pubblicazione: (2026)
di: Khosravi, Hamed, et al.
Pubblicazione: (2026)
vAttention: Verified Sparse Attention
di: Desai, Aditya, et al.
Pubblicazione: (2025)
di: Desai, Aditya, et al.
Pubblicazione: (2025)
Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models
di: Yeung, Calvin, et al.
Pubblicazione: (2026)
di: Yeung, Calvin, et al.
Pubblicazione: (2026)
BatchTopK Sparse Autoencoders
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
di: Bussmann, Bart, et al.
Pubblicazione: (2024)
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
di: Kantamneni, Subhash, et al.
Pubblicazione: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
The Geometry of Concepts: Sparse Autoencoder Feature Structure
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
di: Li, Yuxiao, et al.
Pubblicazione: (2024)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
di: Li, T. Ed, et al.
Pubblicazione: (2025)
di: Li, T. Ed, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing
di: Zhang, Mingxu, et al.
Pubblicazione: (2026) -
SAE-FD: Sparse Autoencoder Feature Distillation for Continual Learning of Large Language Models
di: Zhang, Mingxu, et al.
Pubblicazione: (2026) -
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
di: Jiang, Nick, et al.
Pubblicazione: (2025) -
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
di: Tolooshams, Bahareh, et al.
Pubblicazione: (2025) -
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
di: Helff, Lukas, et al.
Pubblicazione: (2026)