MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yin, Zhao, Jiaxuan, Wu, Zonghan, Li, Zengxiang, Fang, Junfeng, Wang, Kun, Wen, Qingsong, Shao, Yilei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
par: Lei, Xuanyu, et autres
Publié: (2024)
par: Lei, Xuanyu, et autres
Publié: (2024)
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
par: Fang, Hao, et autres
Publié: (2025)
par: Fang, Hao, et autres
Publié: (2025)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025)
par: Xia, Yinan, et autres
Publié: (2025)
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
par: Gan, Chengguang, et autres
Publié: (2025)
par: Gan, Chengguang, et autres
Publié: (2025)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
par: Shao, Zhenwei, et autres
Publié: (2025)
par: Shao, Zhenwei, et autres
Publié: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
par: Hu, Zhe, et autres
Publié: (2025)
par: Hu, Zhe, et autres
Publié: (2025)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
par: Wu, Xuyang, et autres
Publié: (2024)
par: Wu, Xuyang, et autres
Publié: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
par: Wu, Ruijia, et autres
Publié: (2025)
par: Wu, Ruijia, et autres
Publié: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
par: Li, Qingqiu, et autres
Publié: (2024)
par: Li, Qingqiu, et autres
Publié: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
par: Yang, Senqiao, et autres
Publié: (2025)
par: Yang, Senqiao, et autres
Publié: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025)
par: Zha, Yuheng, et autres
Publié: (2025)
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
par: Liu, Shudong, et autres
Publié: (2025)
par: Liu, Shudong, et autres
Publié: (2025)
Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence
par: He, Jinghan, et autres
Publié: (2024)
par: He, Jinghan, et autres
Publié: (2024)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
par: Shi, Dachuan, et autres
Publié: (2023)
par: Shi, Dachuan, et autres
Publié: (2023)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
par: Hua, Jiacheng, et autres
Publié: (2026)
par: Hua, Jiacheng, et autres
Publié: (2026)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction
par: Jiang, Rongxin, et autres
Publié: (2025)
par: Jiang, Rongxin, et autres
Publié: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
par: Li, Wenyan, et autres
Publié: (2025)
par: Li, Wenyan, et autres
Publié: (2025)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
par: Cheng, Sijie, et autres
Publié: (2023)
par: Cheng, Sijie, et autres
Publié: (2023)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
par: Liang, Cheng, et autres
Publié: (2026)
par: Liang, Cheng, et autres
Publié: (2026)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
par: Yuan, Zhengqing, et autres
Publié: (2023)
par: Yuan, Zhengqing, et autres
Publié: (2023)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
ICONS: Influence Consensus for Vision-Language Data Selection
par: Wu, Xindi, et autres
Publié: (2024)
par: Wu, Xindi, et autres
Publié: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
par: Tian, Yu, et autres
Publié: (2024)
par: Tian, Yu, et autres
Publié: (2024)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
par: Chaffin, Antoine, et autres
Publié: (2024)
par: Chaffin, Antoine, et autres
Publié: (2024)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
par: Chen, Qiyuan, et autres
Publié: (2026)
par: Chen, Qiyuan, et autres
Publié: (2026)
How to Utilize Complementary Vision-Text Information for 2D Structure Understanding
par: Dong, Jiancheng, et autres
Publié: (2026)
par: Dong, Jiancheng, et autres
Publié: (2026)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Documents similaires
-
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
par: Lei, Xuanyu, et autres
Publié: (2024) -
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
par: Fang, Hao, et autres
Publié: (2025) -
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024) -
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025) -
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
par: Gan, Chengguang, et autres
Publié: (2025)