Training Superior Sparse Autoencoders for Instruct Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiaming, Ye, Haoran, Chen, Yukun, Li, Xinyue, Zhang, Lei, Alinejad-Rokny, Hamid, Peng, Jimmy Chih-Hsien, Yang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
par: Zhu, Jingwei, et autres
Publié: (2024)
par: Zhu, Jingwei, et autres
Publié: (2024)
Small Language Model as Data Prospector for Large Language Model
par: Ni, Shiwen, et autres
Publié: (2024)
par: Ni, Shiwen, et autres
Publié: (2024)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generation
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
PatRe: A Full-Stage Office Action and Rebuttal Generation Benchmark for Patent Examination
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates
par: Li, Shuaimin, et autres
Publié: (2025)
par: Li, Shuaimin, et autres
Publié: (2025)
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
par: Chen, Dingwei, et autres
Publié: (2025)
par: Chen, Dingwei, et autres
Publié: (2025)
PersonaMath: Boosting Mathematical Reasoning via Persona-Driven Data Augmentation
par: Luo, Jing, et autres
Publié: (2024)
par: Luo, Jing, et autres
Publié: (2024)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
Lower Layers Matter: Alleviating Hallucination via Multi-Layer Fusion Contrastive Decoding with Truthfulness Refocused
par: Chen, Dingwei, et autres
Publié: (2024)
par: Chen, Dingwei, et autres
Publié: (2024)
PLOT: Enhancing Preference Learning via Optimal Transport
par: Zhu, Liang, et autres
Publié: (2026)
par: Zhu, Liang, et autres
Publié: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025)
par: Li, Renhao, et autres
Publié: (2025)
EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection
par: Xu, Ancheng, et autres
Publié: (2025)
par: Xu, Ancheng, et autres
Publié: (2025)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
par: Li, T. Ed, et autres
Publié: (2025)
par: Li, T. Ed, et autres
Publié: (2025)
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
par: Jing, Yi, et autres
Publié: (2026)
par: Jing, Yi, et autres
Publié: (2026)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
par: Chen, Longze, et autres
Publié: (2025)
par: Chen, Longze, et autres
Publié: (2025)
Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning
par: Li, Xiaochuan, et autres
Publié: (2024)
par: Li, Xiaochuan, et autres
Publié: (2024)
AlignSAE: Concept-Aligned Sparse Autoencoders
par: Yang, Minglai, et autres
Publié: (2025)
par: Yang, Minglai, et autres
Publié: (2025)
xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking
par: Lee, Sunbowen, et autres
Publié: (2025)
par: Lee, Sunbowen, et autres
Publié: (2025)
ETAGE: Enhanced Test Time Adaptation with Integrated Entropy and Gradient Norms for Robust Model Performance
par: Shamsi, Afshar, et autres
Publié: (2024)
par: Shamsi, Afshar, et autres
Publié: (2024)
Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders
par: Zheng, Carolina, et autres
Publié: (2025)
par: Zheng, Carolina, et autres
Publié: (2025)
InstructRAG: Instructing Retrieval-Augmented Generation via Self-Synthesized Rationales
par: Wei, Zhepei, et autres
Publié: (2024)
par: Wei, Zhepei, et autres
Publié: (2024)
Sparse Autoencoder Features for Classifications and Transferability
par: Gallifant, Jack, et autres
Publié: (2025)
par: Gallifant, Jack, et autres
Publié: (2025)
AgentCourt: Simulating Court with Adversarial Evolvable Lawyer Agents
par: Chen, Guhong, et autres
Publié: (2024)
par: Chen, Guhong, et autres
Publié: (2024)
Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders
par: Li, Aaron J., et autres
Publié: (2025)
par: Li, Aaron J., et autres
Publié: (2025)
Act-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective Ambiguity
par: Fang, Feiteng, et autres
Publié: (2025)
par: Fang, Feiteng, et autres
Publié: (2025)
Sparse Autoencoders Enable Scalable and Reliable Circuit Identification in Language Models
par: O'Neill, Charles, et autres
Publié: (2024)
par: O'Neill, Charles, et autres
Publié: (2024)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models
par: Yamashita, Tomoya, et autres
Publié: (2025)
par: Yamashita, Tomoya, et autres
Publié: (2025)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices
par: Chen, Jiyu, et autres
Publié: (2025)
par: Chen, Jiyu, et autres
Publié: (2025)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
InstructPro: Natural Language Guided Ligand-Binding Protein Design
par: Song, Zhenqiao, et autres
Publié: (2025)
par: Song, Zhenqiao, et autres
Publié: (2025)
PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding
par: Koromilas, Panagiotis, et autres
Publié: (2026)
par: Koromilas, Panagiotis, et autres
Publié: (2026)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks
par: Karvonen, Adam, et autres
Publié: (2024)
par: Karvonen, Adam, et autres
Publié: (2024)
Documents similaires
-
CollectiveSFT: Scaling Large Language Models for Chinese Medical Benchmark with Collective Instructions in Healthcare
par: Zhu, Jingwei, et autres
Publié: (2024) -
Small Language Model as Data Prospector for Large Language Model
par: Ni, Shiwen, et autres
Publié: (2024) -
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
par: Wang, Qiyao, et autres
Publié: (2026) -
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
par: Chen, Yukun, et autres
Publié: (2026) -
STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generation
par: Li, Jiaming, et autres
Publié: (2025)