Dialz: A Python Toolkit for Steering Vectors
Fuente:
arXiv
Guardado en:
| Autores principales: | Siddique, Zara, Turner, Liam D., Espinosa-Anke, Luis |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
por: Siddique, Zara, et al.
Publicado: (2025)
por: Siddique, Zara, et al.
Publicado: (2025)
CHEW: A Dataset of CHanging Events in Wikipedia
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
por: Borkakoty, Hsuvas, et al.
Publicado: (2024)
On the Non-Identifiability of Steering Vectors in Large Language Models
por: Venkatesh, Sohan, et al.
Publicado: (2026)
por: Venkatesh, Sohan, et al.
Publicado: (2026)
Understanding Reasoning in Thinking Language Models via Steering Vectors
por: Venhoff, Constantin, et al.
Publicado: (2025)
por: Venhoff, Constantin, et al.
Publicado: (2025)
libcll: an Extendable Python Toolkit for Complementary-Label Learning
por: Ye, Nai-Xuan, et al.
Publicado: (2024)
por: Ye, Nai-Xuan, et al.
Publicado: (2024)
Who is better at math, Jenny or Jingzhen? Uncovering Stereotypes in Large Language Models
por: Siddique, Zara, et al.
Publicado: (2024)
por: Siddique, Zara, et al.
Publicado: (2024)
Review of Digital Asset Development with Graph Neural Network Unlearning
por: Lisbon, Zara
Publicado: (2024)
por: Lisbon, Zara
Publicado: (2024)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
por: Wong, Sing Hieng, et al.
Publicado: (2026)
por: Wong, Sing Hieng, et al.
Publicado: (2026)
One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs
por: Dunefsky, Jacob, et al.
Publicado: (2025)
por: Dunefsky, Jacob, et al.
Publicado: (2025)
SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation
por: Burdisso, Sergio, et al.
Publicado: (2025)
por: Burdisso, Sergio, et al.
Publicado: (2025)
Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs
por: Han, Pengrui, et al.
Publicado: (2026)
por: Han, Pengrui, et al.
Publicado: (2026)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
por: Chalnev, Sviatoslav, et al.
Publicado: (2024)
AdvSecureNet: A Python Toolkit for Adversarial Machine Learning
por: Catal, Melih, et al.
Publicado: (2024)
por: Catal, Melih, et al.
Publicado: (2024)
DetoxAI: a Python Toolkit for Debiasing Deep Learning Models in Computer Vision
por: Stępka, Ignacy, et al.
Publicado: (2025)
por: Stępka, Ignacy, et al.
Publicado: (2025)
Steering Llama 2 via Contrastive Activation Addition
por: Panickssery, Nina, et al.
Publicado: (2023)
por: Panickssery, Nina, et al.
Publicado: (2023)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
por: Hedström, Anna, et al.
Publicado: (2025)
por: Hedström, Anna, et al.
Publicado: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
por: Tran, Thanh Q., et al.
Publicado: (2026)
por: Tran, Thanh Q., et al.
Publicado: (2026)
MidSteer: Optimal Affine Framework for Steering Generative Models
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations
por: Braun, Joschka
Publicado: (2026)
por: Braun, Joschka
Publicado: (2026)
Awesome-OL: An Extensible Toolkit for Online Learning
por: Liu, Zeyi, et al.
Publicado: (2025)
por: Liu, Zeyi, et al.
Publicado: (2025)
Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
por: Jiang, Nick, et al.
Publicado: (2025)
por: Jiang, Nick, et al.
Publicado: (2025)
PyG-SSL: A Graph Self-Supervised Learning Toolkit
por: Zheng, Lecheng, et al.
Publicado: (2024)
por: Zheng, Lecheng, et al.
Publicado: (2024)
FlexMol: A Flexible Toolkit for Benchmarking Molecular Relational Learning
por: Liu, Sizhe, et al.
Publicado: (2024)
por: Liu, Sizhe, et al.
Publicado: (2024)
In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering
por: Liu, Sheng, et al.
Publicado: (2023)
por: Liu, Sheng, et al.
Publicado: (2023)
DreamReader: An Interpretability Toolkit for Text-to-Image Models
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
por: Prakash, Nirmalendu, et al.
Publicado: (2026)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
FMTK: A Modular Toolkit for Composable Time Series Foundation Model Pipelines
por: Shastri, Hetvi, et al.
Publicado: (2025)
por: Shastri, Hetvi, et al.
Publicado: (2025)
Imitation Learning Datasets: A Toolkit For Creating Datasets, Training Agents and Benchmarking
por: Gavenski, Nathan, et al.
Publicado: (2024)
por: Gavenski, Nathan, et al.
Publicado: (2024)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
por: Bareeva, Dilyara, et al.
Publicado: (2024)
por: Bareeva, Dilyara, et al.
Publicado: (2024)
Dynamically Scaled Activation Steering
por: Ferrando, Alex, et al.
Publicado: (2025)
por: Ferrando, Alex, et al.
Publicado: (2025)
UncertaintyZoo: A Unified Toolkit for Quantifying Predictive Uncertainty in Deep Learning Systems
por: Wu, Xianzong, et al.
Publicado: (2025)
por: Wu, Xianzong, et al.
Publicado: (2025)
GREATERPROMPT: A Unified, Customizable, and High-Performing Open-Source Toolkit for Prompt Optimization
por: Zheng, Wenliang, et al.
Publicado: (2025)
por: Zheng, Wenliang, et al.
Publicado: (2025)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
por: Hossain, Saad, et al.
Publicado: (2025)
por: Hossain, Saad, et al.
Publicado: (2025)
On Optimal Steering to Achieve Exact Fairness
por: Sharma, Mohit, et al.
Publicado: (2025)
por: Sharma, Mohit, et al.
Publicado: (2025)
Activation Steering for Chain-of-Thought Compression
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
Minimizing Collateral Damage in Activation Steering
por: Nguyen, Tam, et al.
Publicado: (2026)
por: Nguyen, Tam, et al.
Publicado: (2026)
Concept Heterogeneity-aware Representation Steering
por: Abdullaev, Laziz U., et al.
Publicado: (2026)
por: Abdullaev, Laziz U., et al.
Publicado: (2026)
General and Efficient Steering of Unconditional Diffusion
por: Wang, Qingsong, et al.
Publicado: (2026)
por: Wang, Qingsong, et al.
Publicado: (2026)
Ejemplares similares
-
Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
por: Siddique, Zara, et al.
Publicado: (2025) -
CHEW: A Dataset of CHanging Events in Wikipedia
por: Borkakoty, Hsuvas, et al.
Publicado: (2024) -
Hoaxpedia: A Unified Wikipedia Hoax Articles Dataset
por: Borkakoty, Hsuvas, et al.
Publicado: (2024) -
On the Non-Identifiability of Steering Vectors in Large Language Models
por: Venkatesh, Sohan, et al.
Publicado: (2026) -
Understanding Reasoning in Thinking Language Models via Steering Vectors
por: Venhoff, Constantin, et al.
Publicado: (2025)