LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
Fuente:
arXiv
Salvato in:
| Autori principali: | Wong, Sing Hieng, Sajjad, Hassan, Siddique, A. B. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
di: Marks, Samuel, et al.
Pubblicazione: (2024)
di: Marks, Samuel, et al.
Pubblicazione: (2024)
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
di: Lamb, Tom A., et al.
Pubblicazione: (2024)
di: Lamb, Tom A., et al.
Pubblicazione: (2024)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
di: Garg, Ankur, et al.
Pubblicazione: (2025)
di: Garg, Ankur, et al.
Pubblicazione: (2025)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
di: Soo, Samuel, et al.
Pubblicazione: (2025)
di: Soo, Samuel, et al.
Pubblicazione: (2025)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
Interpreting the Effects of Quantization on LLMs
di: Singh, Manpreet, et al.
Pubblicazione: (2025)
di: Singh, Manpreet, et al.
Pubblicazione: (2025)
Quantifying the Capabilities of LLMs across Scale and Precision
di: Badshah, Sher, et al.
Pubblicazione: (2024)
di: Badshah, Sher, et al.
Pubblicazione: (2024)
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
di: Siddique, Zara, et al.
Pubblicazione: (2025)
di: Siddique, Zara, et al.
Pubblicazione: (2025)
Discovering Forbidden Topics in Language Models
di: Rager, Can, et al.
Pubblicazione: (2025)
di: Rager, Can, et al.
Pubblicazione: (2025)
Word Embeddings Are Steers for Language Models
di: Han, Chi, et al.
Pubblicazione: (2023)
di: Han, Chi, et al.
Pubblicazione: (2023)
Endogenous Resistance to Activation Steering in Language Models
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
di: McKenzie, Alex, et al.
Pubblicazione: (2026)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
LangTopo: Aligning Language Descriptions of Graphs with Tokenized Topological Modeling
di: Guan, Zhong, et al.
Pubblicazione: (2024)
di: Guan, Zhong, et al.
Pubblicazione: (2024)
LangProBe: a Language Programs Benchmark
di: Tan, Shangyin, et al.
Pubblicazione: (2025)
di: Tan, Shangyin, et al.
Pubblicazione: (2025)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
di: Bayazit, Deniz, et al.
Pubblicazione: (2023)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
di: Sharma, Kartik, et al.
Pubblicazione: (2026)
Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders
di: Lan, Michael, et al.
Pubblicazione: (2024)
di: Lan, Michael, et al.
Pubblicazione: (2024)
Steering Large Language Models for Machine Translation Personalization
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
di: Scalena, Daniel, et al.
Pubblicazione: (2025)
Task-Specific Sparse Feature Masks for Molecular Toxicity Prediction with Chemical Language Models
di: Lee, Kwun Sy, et al.
Pubblicazione: (2025)
di: Lee, Kwun Sy, et al.
Pubblicazione: (2025)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
di: Weng, Zixuan, et al.
Pubblicazione: (2026)
di: Weng, Zixuan, et al.
Pubblicazione: (2026)
SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
di: Yu, Zhuohao, et al.
Pubblicazione: (2025)
HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
Improving Instruction-Following in Language Models through Activation Steering
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
di: Stolfo, Alessandro, et al.
Pubblicazione: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
di: Nguyen, Duy, et al.
Pubblicazione: (2025)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
di: Xu, Yi, et al.
Pubblicazione: (2026)
di: Xu, Yi, et al.
Pubblicazione: (2026)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines
di: Jørgensen, Mikkel Godsk, et al.
Pubblicazione: (2026)
di: Jørgensen, Mikkel Godsk, et al.
Pubblicazione: (2026)
SAEs Are Good for Steering -- If You Select the Right Features
di: Arad, Dana, et al.
Pubblicazione: (2025)
di: Arad, Dana, et al.
Pubblicazione: (2025)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
di: Scalena, Daniel, et al.
Pubblicazione: (2024)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
di: Oozeer, Narmeen, et al.
Pubblicazione: (2025)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
di: Avrahami, Eden, et al.
Pubblicazione: (2026)
di: Avrahami, Eden, et al.
Pubblicazione: (2026)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
di: Anand, Nikhil, et al.
Pubblicazione: (2026)
UniMaia: Steering Chess Policies with Language for Human-like Play
di: Siu, Sherman, et al.
Pubblicazione: (2026)
di: Siu, Sherman, et al.
Pubblicazione: (2026)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
di: Zhou, Hanhan, et al.
Pubblicazione: (2026)
di: Zhou, Hanhan, et al.
Pubblicazione: (2026)
That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation
di: Bae, Jaesung, et al.
Pubblicazione: (2025)
di: Bae, Jaesung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
di: Marks, Samuel, et al.
Pubblicazione: (2024) -
Focus On This, Not That! Steering LLMs with Adaptive Feature Specification
di: Lamb, Tom A., et al.
Pubblicazione: (2024) -
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
di: Haider, Muhammad Umair, et al.
Pubblicazione: (2025) -
Improving Steering Vectors by Targeting Sparse Autoencoder Features
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024) -
Cross-Layer Discrete Concept Discovery for Interpreting Language Models
di: Garg, Ankur, et al.
Pubblicazione: (2025)