SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sivakumar, Anushka, Zhang, Andrew, Hakim, Zaber, Thomas, Chris |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
por: Yang, Jiaxi, et al.
Publicado: (2026)
por: Yang, Jiaxi, et al.
Publicado: (2026)
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
por: Alomari, Hani, et al.
Publicado: (2025)
por: Alomari, Hani, et al.
Publicado: (2025)
Flexible-length Text Infilling for Discrete Diffusion Models
por: Zhang, Andrew, et al.
Publicado: (2025)
por: Zhang, Andrew, et al.
Publicado: (2025)
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
por: Hakim, Zaber Ibn Abdul, et al.
Publicado: (2023)
por: Hakim, Zaber Ibn Abdul, et al.
Publicado: (2023)
Steering Rectified Flow Models in the Vector Field for Controlled Image Generation
por: Patel, Maitreya, et al.
Publicado: (2024)
por: Patel, Maitreya, et al.
Publicado: (2024)
VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision
por: Xu, Yi, et al.
Publicado: (2024)
por: Xu, Yi, et al.
Publicado: (2024)
Reducing Hallucinations in Vision-Language Models via Latent Space Steering
por: Liu, Sheng, et al.
Publicado: (2024)
por: Liu, Sheng, et al.
Publicado: (2024)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
por: Hinojosa, Carlos, et al.
Publicado: (2026)
por: Hinojosa, Carlos, et al.
Publicado: (2026)
Image Inpainting via Tractable Steering of Diffusion Models
por: Liu, Anji, et al.
Publicado: (2023)
por: Liu, Anji, et al.
Publicado: (2023)
Steering Guidance for Personalized Text-to-Image Diffusion Models
por: Park, Sunghyun, et al.
Publicado: (2025)
por: Park, Sunghyun, et al.
Publicado: (2025)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
por: Dafnis, Konstantinos M., et al.
Publicado: (2025)
por: Dafnis, Konstantinos M., et al.
Publicado: (2025)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
por: Li, Zhuowei, et al.
Publicado: (2025)
por: Li, Zhuowei, et al.
Publicado: (2025)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
por: Liu, Jiajin, et al.
Publicado: (2026)
por: Liu, Jiajin, et al.
Publicado: (2026)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
por: Bao, Chen, et al.
Publicado: (2024)
por: Bao, Chen, et al.
Publicado: (2024)
Steer Away From Mode Collisions: Improving Composition In Diffusion Models
por: Dutta, Debottam, et al.
Publicado: (2025)
por: Dutta, Debottam, et al.
Publicado: (2025)
BendVLM: Test-Time Debiasing of Vision-Language Embeddings
por: Gerych, Walter, et al.
Publicado: (2024)
por: Gerych, Walter, et al.
Publicado: (2024)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
por: Zhang, Weidong, et al.
Publicado: (2025)
por: Zhang, Weidong, et al.
Publicado: (2025)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
por: Gan, Woody Haosheng, et al.
Publicado: (2025)
por: Gan, Woody Haosheng, et al.
Publicado: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
A Lightweight Large Vision-language Model for Multimodal Medical Images
por: Alsinglawi, Belal, et al.
Publicado: (2025)
por: Alsinglawi, Belal, et al.
Publicado: (2025)
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
por: Zhong, Siru, et al.
Publicado: (2025)
por: Zhong, Siru, et al.
Publicado: (2025)
StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement
por: Seo, Junwon, et al.
Publicado: (2026)
por: Seo, Junwon, et al.
Publicado: (2026)
Learning to Steer: Input-dependent Steering for Multimodal LLMs
por: Parekh, Jayneel, et al.
Publicado: (2025)
por: Parekh, Jayneel, et al.
Publicado: (2025)
A General Framework for Inference-time Scaling and Steering of Diffusion Models
por: Singhal, Raghav, et al.
Publicado: (2025)
por: Singhal, Raghav, et al.
Publicado: (2025)
Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)
por: Lee, Yousung, et al.
Publicado: (2026)
por: Lee, Yousung, et al.
Publicado: (2026)
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
por: Koleilat, Taha, et al.
Publicado: (2026)
por: Koleilat, Taha, et al.
Publicado: (2026)
LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models
por: Ishmam, Alvi Md, et al.
Publicado: (2026)
por: Ishmam, Alvi Md, et al.
Publicado: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024)
por: Chen, Boyuan, et al.
Publicado: (2024)
Controlling Steering Angle for Cooperative Self-driving Vehicles utilizing CNN and LSTM-based Deep Networks
por: Valiente, Rodolfo, et al.
Publicado: (2019)
por: Valiente, Rodolfo, et al.
Publicado: (2019)
Debias your Large Multi-Modal Model at Test-Time via Non-Contrastive Visual Attribute Steering
por: Ratzlaff, Neale, et al.
Publicado: (2024)
por: Ratzlaff, Neale, et al.
Publicado: (2024)
Model Steering: Learning with a Reference Model Improves Generalization Bounds and Scaling Laws
por: Wei, Xiyuan, et al.
Publicado: (2025)
por: Wei, Xiyuan, et al.
Publicado: (2025)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
ATHENA: Adaptive Test-Time Steering for Improving Count Fidelity in Diffusion Models
por: Sepehri, Mohammad Shahab, et al.
Publicado: (2026)
por: Sepehri, Mohammad Shahab, et al.
Publicado: (2026)
ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
por: Li, Junxian, et al.
Publicado: (2024)
por: Li, Junxian, et al.
Publicado: (2024)
Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target Atoms
por: Wang, Mengru, et al.
Publicado: (2025)
por: Wang, Mengru, et al.
Publicado: (2025)
Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts
por: Golovanevsky, Michal, et al.
Publicado: (2025)
por: Golovanevsky, Michal, et al.
Publicado: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
por: Yin, Jianghao, et al.
Publicado: (2026)
por: Yin, Jianghao, et al.
Publicado: (2026)
FREE: Fast and Robust Vision Language Models with Early Exits
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models
por: Wu, Fangzheng, et al.
Publicado: (2026)
por: Wu, Fangzheng, et al.
Publicado: (2026)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
por: Yan, Hao, et al.
Publicado: (2024)
por: Yan, Hao, et al.
Publicado: (2024)
Ejemplares similares
-
Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
por: Yang, Jiaxi, et al.
Publicado: (2026) -
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
por: Alomari, Hani, et al.
Publicado: (2025) -
Flexible-length Text Infilling for Discrete Diffusion Models
por: Zhang, Andrew, et al.
Publicado: (2025) -
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
por: Hakim, Zaber Ibn Abdul, et al.
Publicado: (2023) -
Steering Rectified Flow Models in the Vector Field for Controlled Image Generation
por: Patel, Maitreya, et al.
Publicado: (2024)