Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Fan, Yuchun, Wang, Yilin, Mu, Yongyu, Huang, Lei, Li, Bei, Feng, Xiaocheng, Xiao, Tong, Zhu, Jingbo
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866912554571268096
author Fan, Yuchun
Wang, Yilin
Mu, Yongyu
Huang, Lei
Li, Bei
Feng, Xiaocheng
Xiao, Tong
Zhu, Jingbo
author_facet Fan, Yuchun
Wang, Yilin
Mu, Yongyu
Huang, Lei
Li, Bei
Feng, Xiaocheng
Xiao, Tong
Zhu, Jingbo
contents Large vision-language models (LVLMs) have demonstrated exceptional capabilities in understanding visual information with human languages but also exhibit an imbalance in multilingual capabilities. In this work, we delve into the multilingual working pattern of LVLMs and identify a salient correlation between the multilingual understanding ability of LVLMs and language-specific neuron activations in shallow layers. Building on this insight, we introduce PLAST, a training recipe that achieves efficient multilingual enhancement for LVLMs by Precise LAnguage-Specific layers fine-Tuning. PLAST first identifies layers involved in multilingual understanding by monitoring language-specific neuron activations. These layers are then precisely fine-tuned with question-translation pairs to achieve multilingual alignment. Our empirical results on MM-Bench and MMMB demonstrate that PLAST effectively improves the multilingual capabilities of LVLMs and achieves significant efficiency with only 14% of the parameters tuned. Further analysis reveals that PLAST can be generalized to low-resource and complex visual reasoning tasks, facilitating the language-specific visual information engagement in shallow layers.
format Preprint
id arxiv_https___arxiv_org_abs_2508_18381
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
Fan, Yuchun
Wang, Yilin
Mu, Yongyu
Huang, Lei
Li, Bei
Feng, Xiaocheng
Xiao, Tong
Zhu, Jingbo
Computation and Language
Large vision-language models (LVLMs) have demonstrated exceptional capabilities in understanding visual information with human languages but also exhibit an imbalance in multilingual capabilities. In this work, we delve into the multilingual working pattern of LVLMs and identify a salient correlation between the multilingual understanding ability of LVLMs and language-specific neuron activations in shallow layers. Building on this insight, we introduce PLAST, a training recipe that achieves efficient multilingual enhancement for LVLMs by Precise LAnguage-Specific layers fine-Tuning. PLAST first identifies layers involved in multilingual understanding by monitoring language-specific neuron activations. These layers are then precisely fine-tuned with question-translation pairs to achieve multilingual alignment. Our empirical results on MM-Bench and MMMB demonstrate that PLAST effectively improves the multilingual capabilities of LVLMs and achieves significant efficiency with only 14% of the parameters tuned. Further analysis reveals that PLAST can be generalized to low-resource and complex visual reasoning tasks, facilitating the language-specific visual information engagement in shallow layers.
title Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
topic Computation and Language
url https://arxiv.org/abs/2508.18381