VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Haozhan, Liu, Peng, Li, Jingcheng, Fang, Chunxin, Ma, Yibo, Liao, Jiajia, Shen, Qiaoli, Zhang, Zilun, Zhao, Kangjia, Zhang, Qianqian, Xu, Ruochen, Zhao, Tiancheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025)
par: Liu, Peng, et autres
Publié: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024)
par: Shen, Haozhan, et autres
Publié: (2024)
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
par: Zhang, Qianqian, et autres
Publié: (2025)
par: Zhang, Qianqian, et autres
Publié: (2025)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
par: Zhao, Tiancheng, et autres
Publié: (2024)
par: Zhao, Tiancheng, et autres
Publié: (2024)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023)
par: Zhang, Zilun, et autres
Publié: (2023)
Talking to Yourself: Defying Forgetting in Large Language Models
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
par: Sun, Yutao, et autres
Publié: (2025)
par: Sun, Yutao, et autres
Publié: (2025)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
par: Zhang, Zilun, et autres
Publié: (2022)
par: Zhang, Zilun, et autres
Publié: (2022)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
par: Lai, Yuxiang, et autres
Publié: (2025)
par: Lai, Yuxiang, et autres
Publié: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
par: Wang, Zhiqiang, et autres
Publié: (2025)
par: Wang, Zhiqiang, et autres
Publié: (2025)
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
par: Guo, Yulong, et autres
Publié: (2025)
par: Guo, Yulong, et autres
Publié: (2025)
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
par: Zhang, Lu, et autres
Publié: (2024)
par: Zhang, Lu, et autres
Publié: (2024)
Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
par: Cai, Hua, et autres
Publié: (2025)
par: Cai, Hua, et autres
Publié: (2025)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
par: Fan, Zhiwen, et autres
Publié: (2025)
par: Fan, Zhiwen, et autres
Publié: (2025)
R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding
par: Park, Joonhyung, et autres
Publié: (2025)
par: Park, Joonhyung, et autres
Publié: (2025)
AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models
par: Tian, Beitong, et autres
Publié: (2025)
par: Tian, Beitong, et autres
Publié: (2025)
Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert
par: Liu, Mingyu, et autres
Publié: (2025)
par: Liu, Mingyu, et autres
Publié: (2025)
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization
par: Zhang, Yaning, et autres
Publié: (2026)
par: Zhang, Yaning, et autres
Publié: (2026)
GephiForR: An R package for creating Gephi-style network visualizations
par: Manso, Julia
Publié: (2024)
par: Manso, Julia
Publié: (2024)
Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL
par: Zhai, Skylar, et autres
Publié: (2026)
par: Zhai, Skylar, et autres
Publié: (2026)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
par: Qi, Zhangyang, et autres
Publié: (2025)
par: Qi, Zhangyang, et autres
Publié: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
par: Zheng, Weicheng, et autres
Publié: (2025)
par: Zheng, Weicheng, et autres
Publié: (2025)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
par: Zhao, Tiancheng, et autres
Publié: (2022)
par: Zhao, Tiancheng, et autres
Publié: (2022)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
Generalizable Entity Grounding via Assistance of Large Language Model
par: Qi, Lu, et autres
Publié: (2024)
par: Qi, Lu, et autres
Publié: (2024)
Stable Knowledge Editing in Large Language Models
par: Wei, Zihao, et autres
Publié: (2024)
par: Wei, Zihao, et autres
Publié: (2024)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Domain Adaptation of VLM for Soccer Video Understanding
par: Jiang, Tiancheng, et autres
Publié: (2025)
par: Jiang, Tiancheng, et autres
Publié: (2025)
Documents similaires
-
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024) -
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
par: Zhang, Qianqian, et autres
Publié: (2025) -
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026) -
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
par: Zhao, Tiancheng, et autres
Publié: (2024)