LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Mo, Shentong, Yun, Sukmin
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866912986887618560
author Mo, Shentong
Yun, Sukmin
author_facet Mo, Shentong
Yun, Sukmin
contents Unified multimodal pretraining has emerged as a promising paradigm for jointly modeling language and vision within a single foundation model. However, existing approaches largely rely on implicit or indirect alignment signals and remain suboptimal for simultaneously supporting multimodal understanding and generation, particularly in settings that require fine-grained language-visual reasoning and controllable generation. In this work, we propose LVRPO, a language-visual reinforcement-based preference optimization framework that explicitly aligns language and visual representations using Group Relative Policy Optimization (GRPO). Instead of introducing additional alignment losses at the representation level, LVRPO directly optimizes multimodal model behaviors through preference-driven reinforcement signals, encouraging consistent and semantically grounded interactions between language and vision across both understanding and generation tasks. This formulation enables effective alignment without requiring auxiliary encoders or handcrafted cross-modal objectives, and naturally extends to diverse multimodal capabilities. Empirically, LVRPO consistently outperforms strong unified-pretraining baselines on a broad suite of benchmarks spanning multimodal understanding, generation, and reasoning.
format Preprint
id arxiv_https___arxiv_org_abs_2603_27693
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
Mo, Shentong
Yun, Sukmin
Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
Multiagent Systems
Multimedia
Unified multimodal pretraining has emerged as a promising paradigm for jointly modeling language and vision within a single foundation model. However, existing approaches largely rely on implicit or indirect alignment signals and remain suboptimal for simultaneously supporting multimodal understanding and generation, particularly in settings that require fine-grained language-visual reasoning and controllable generation. In this work, we propose LVRPO, a language-visual reinforcement-based preference optimization framework that explicitly aligns language and visual representations using Group Relative Policy Optimization (GRPO). Instead of introducing additional alignment losses at the representation level, LVRPO directly optimizes multimodal model behaviors through preference-driven reinforcement signals, encouraging consistent and semantically grounded interactions between language and vision across both understanding and generation tasks. This formulation enables effective alignment without requiring auxiliary encoders or handcrafted cross-modal objectives, and naturally extends to diverse multimodal capabilities. Empirically, LVRPO consistently outperforms strong unified-pretraining baselines on a broad suite of benchmarks spanning multimodal understanding, generation, and reasoning.
title LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
topic Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
Multiagent Systems
Multimedia
url https://arxiv.org/abs/2603.27693