MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yin, Zhao, Jiaxuan, Wu, Zonghan, Li, Zengxiang, Fang, Junfeng, Wang, Kun, Wen, Qingsong, Shao, Yilei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
por: Fang, Hao, et al.
Publicado: (2025)
por: Fang, Hao, et al.
Publicado: (2025)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025)
por: Xia, Yinan, et al.
Publicado: (2025)
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
por: Gan, Chengguang, et al.
Publicado: (2025)
por: Gan, Chengguang, et al.
Publicado: (2025)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
por: Shao, Zhenwei, et al.
Publicado: (2025)
por: Shao, Zhenwei, et al.
Publicado: (2025)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
por: Weng, Fenghua, et al.
Publicado: (2025)
por: Weng, Fenghua, et al.
Publicado: (2025)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
por: Hu, Zhe, et al.
Publicado: (2025)
por: Hu, Zhe, et al.
Publicado: (2025)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
por: Wu, Xuyang, et al.
Publicado: (2024)
por: Wu, Xuyang, et al.
Publicado: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
por: Wu, Ruijia, et al.
Publicado: (2025)
por: Wu, Ruijia, et al.
Publicado: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
por: Li, Qingqiu, et al.
Publicado: (2024)
por: Li, Qingqiu, et al.
Publicado: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
por: Zha, Yuheng, et al.
Publicado: (2025)
por: Zha, Yuheng, et al.
Publicado: (2025)
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025)
por: Xing, Xiaoying, et al.
Publicado: (2025)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
por: Liu, Shudong, et al.
Publicado: (2025)
por: Liu, Shudong, et al.
Publicado: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
por: Wang, Zihu, et al.
Publicado: (2025)
por: Wang, Zihu, et al.
Publicado: (2025)
Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence
por: He, Jinghan, et al.
Publicado: (2024)
por: He, Jinghan, et al.
Publicado: (2024)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
por: Shi, Dachuan, et al.
Publicado: (2023)
por: Shi, Dachuan, et al.
Publicado: (2023)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
por: Hua, Jiacheng, et al.
Publicado: (2026)
por: Hua, Jiacheng, et al.
Publicado: (2026)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
por: Zhao, Bowen, et al.
Publicado: (2024)
por: Zhao, Bowen, et al.
Publicado: (2024)
Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction
por: Jiang, Rongxin, et al.
Publicado: (2025)
por: Jiang, Rongxin, et al.
Publicado: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
por: Li, Wenyan, et al.
Publicado: (2025)
por: Li, Wenyan, et al.
Publicado: (2025)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
por: Cheng, Sijie, et al.
Publicado: (2023)
por: Cheng, Sijie, et al.
Publicado: (2023)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
por: Li, Yifan, et al.
Publicado: (2024)
por: Li, Yifan, et al.
Publicado: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
por: Liang, Cheng, et al.
Publicado: (2026)
por: Liang, Cheng, et al.
Publicado: (2026)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
por: Zhang, Yanghai, et al.
Publicado: (2024)
por: Zhang, Yanghai, et al.
Publicado: (2024)
ICONS: Influence Consensus for Vision-Language Data Selection
por: Wu, Xindi, et al.
Publicado: (2024)
por: Wu, Xindi, et al.
Publicado: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
por: Tian, Yu, et al.
Publicado: (2024)
por: Tian, Yu, et al.
Publicado: (2024)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
por: Chaffin, Antoine, et al.
Publicado: (2024)
por: Chaffin, Antoine, et al.
Publicado: (2024)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
por: Chen, Qiyuan, et al.
Publicado: (2026)
por: Chen, Qiyuan, et al.
Publicado: (2026)
How to Utilize Complementary Vision-Text Information for 2D Structure Understanding
por: Dong, Jiancheng, et al.
Publicado: (2026)
por: Dong, Jiancheng, et al.
Publicado: (2026)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Ejemplares similares
-
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024) -
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
por: Fang, Hao, et al.
Publicado: (2025) -
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024) -
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025) -
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
por: Gan, Chengguang, et al.
Publicado: (2025)