ReasonEdit: Editing Vision-Language Models using Human Reasoning

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Qiu, Jiaxing, Hou, Kaihua, Daneshjou, Roxana, Alaa, Ahmed, Hartvigsen, Thomas
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866909033985736704
author Qiu, Jiaxing
Hou, Kaihua
Daneshjou, Roxana
Alaa, Ahmed
Hartvigsen, Thomas
author_facet Qiu, Jiaxing
Hou, Kaihua
Daneshjou, Roxana
Alaa, Ahmed
Hartvigsen, Thomas
contents Model editing aims to correct errors in large, pretrained models without altering unrelated behaviors. While some recent works have edited vision-language models (VLMs), no existing editors tackle reasoning-heavy tasks, which typically require humans and models to reason about images. We therefore propose ReasonEdit, the first VLM editor to let users explain their reasoning during editing, introducing a new, practical model editing setup. ReasonEdit continuously stores human reasoning in a codebook, and retrieves only relevant facts during inference using a novel topology-balanced multimodal embedding method inspired by network science. Across four VLMs on multiple rationale-based visual question answering datasets, ReasonEdit achieves state-of-the-art editing performance, ultimately showing that using human reasoning during editing greatly improves edit generalization.
format Preprint
id arxiv_https___arxiv_org_abs_2602_02408
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle ReasonEdit: Editing Vision-Language Models using Human Reasoning
Qiu, Jiaxing
Hou, Kaihua
Daneshjou, Roxana
Alaa, Ahmed
Hartvigsen, Thomas
Computer Vision and Pattern Recognition
Artificial Intelligence
Model editing aims to correct errors in large, pretrained models without altering unrelated behaviors. While some recent works have edited vision-language models (VLMs), no existing editors tackle reasoning-heavy tasks, which typically require humans and models to reason about images. We therefore propose ReasonEdit, the first VLM editor to let users explain their reasoning during editing, introducing a new, practical model editing setup. ReasonEdit continuously stores human reasoning in a codebook, and retrieves only relevant facts during inference using a novel topology-balanced multimodal embedding method inspired by network science. Across four VLMs on multiple rationale-based visual question answering datasets, ReasonEdit achieves state-of-the-art editing performance, ultimately showing that using human reasoning during editing greatly improves edit generalization.
title ReasonEdit: Editing Vision-Language Models using Human Reasoning
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2602.02408