GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Tianbin, Su, Yanzhou, Li, Wei, Fu, Bin, Chen, Zhe, Huang, Ziyan, Wang, Guoan, Ma, Chenglong, Chen, Ying, Hu, Ming, Li, Yanjun, Chen, Pengcheng, Hu, Xiaowei, Deng, Zhongying, Ji, Yuanfeng, Ye, Jin, Qiao, Yu, He, Junjun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
von: Su, Yanzhou, et al.
Veröffentlicht: (2025)
von: Su, Yanzhou, et al.
Veröffentlicht: (2025)
GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
von: Chen, Pengcheng, et al.
Veröffentlicht: (2024)
von: Chen, Pengcheng, et al.
Veröffentlicht: (2024)
SegBook: A Simple Baseline and Cookbook for Volumetric Medical Image Segmentation
von: Ye, Jin, et al.
Veröffentlicht: (2024)
von: Ye, Jin, et al.
Veröffentlicht: (2024)
SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
von: Chen, Ying, et al.
Veröffentlicht: (2024)
von: Chen, Ying, et al.
Veröffentlicht: (2024)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
von: Shu, Yan, et al.
Veröffentlicht: (2025)
von: Shu, Yan, et al.
Veröffentlicht: (2025)
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
von: Gao, Zhangwei, et al.
Veröffentlicht: (2024)
von: Gao, Zhangwei, et al.
Veröffentlicht: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
von: Zhang, Yongting, et al.
Veröffentlicht: (2024)
Interactive Medical Image Segmentation: A Benchmark Dataset and Baseline
von: Cheng, Junlong, et al.
Veröffentlicht: (2024)
von: Cheng, Junlong, et al.
Veröffentlicht: (2024)
Kwai Keye-VL 1.5 Technical Report
von: Yang, Biao, et al.
Veröffentlicht: (2025)
von: Yang, Biao, et al.
Veröffentlicht: (2025)
Towards Interpretable Counterfactual Generation via Multimodal Autoregression
von: Ma, Chenglong, et al.
Veröffentlicht: (2025)
von: Ma, Chenglong, et al.
Veröffentlicht: (2025)
Seed1.5-VL Technical Report
von: Guo, Dong, et al.
Veröffentlicht: (2025)
von: Guo, Dong, et al.
Veröffentlicht: (2025)
S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images
von: Li, Qingxiao, et al.
Veröffentlicht: (2026)
von: Li, Qingxiao, et al.
Veröffentlicht: (2026)
SAM-Med3D: Towards General-purpose Segmentation Models for Volumetric Medical Images
von: Wang, Haoyu, et al.
Veröffentlicht: (2023)
von: Wang, Haoyu, et al.
Veröffentlicht: (2023)
A-Eval: A Benchmark for Cross-Dataset Evaluation of Abdominal Multi-Organ Segmentation
von: Huang, Ziyan, et al.
Veröffentlicht: (2023)
von: Huang, Ziyan, et al.
Veröffentlicht: (2023)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
von: Hu, Yutao, et al.
Veröffentlicht: (2024)
von: Hu, Yutao, et al.
Veröffentlicht: (2024)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
VL-Mamba: Exploring State Space Models for Multimodal Learning
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
Qwen2.5-VL Technical Report
von: Bai, Shuai, et al.
Veröffentlicht: (2025)
von: Bai, Shuai, et al.
Veröffentlicht: (2025)
Kwai Keye-VL Technical Report
von: Kwai Keye Team, et al.
Veröffentlicht: (2025)
von: Kwai Keye Team, et al.
Veröffentlicht: (2025)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
von: Hao, Zhiwei, et al.
Veröffentlicht: (2024)
von: Hao, Zhiwei, et al.
Veröffentlicht: (2024)
A-VL: Adaptive Attention for Large Vision-Language Models
von: Zhang, Junyang, et al.
Veröffentlicht: (2024)
von: Zhang, Junyang, et al.
Veröffentlicht: (2024)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
von: Dong, Daxiang, et al.
Veröffentlicht: (2025)
von: Dong, Daxiang, et al.
Veröffentlicht: (2025)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2025)
von: Luo, Gen, et al.
Veröffentlicht: (2025)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
von: Li, Mingxin, et al.
Veröffentlicht: (2026)
von: Li, Mingxin, et al.
Veröffentlicht: (2026)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
von: Chen, Zhe, et al.
Veröffentlicht: (2023)
von: Chen, Zhe, et al.
Veröffentlicht: (2023)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
von: Guo, Jarvis, et al.
Veröffentlicht: (2024)
von: Guo, Jarvis, et al.
Veröffentlicht: (2024)
AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models
von: Su, Zunhai, et al.
Veröffentlicht: (2025)
von: Su, Zunhai, et al.
Veröffentlicht: (2025)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
von: Yang, Bo, et al.
Veröffentlicht: (2025)
von: Yang, Bo, et al.
Veröffentlicht: (2025)
Kimi-VL Technical Report
von: Kimi Team, et al.
Veröffentlicht: (2025)
von: Kimi Team, et al.
Veröffentlicht: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
von: Wei, Zhixiang, et al.
Veröffentlicht: (2026)
von: Wei, Zhixiang, et al.
Veröffentlicht: (2026)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
von: Wen, Zichen, et al.
Veröffentlicht: (2026)
KairosVL: Orchestrating Time Series and Semantics for Unified Reasoning
von: Si, Haotian, et al.
Veröffentlicht: (2026)
von: Si, Haotian, et al.
Veröffentlicht: (2026)
MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
von: Wang, Ke, et al.
Veröffentlicht: (2025)
von: Wang, Ke, et al.
Veröffentlicht: (2025)
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
von: Ning, Junzhi, et al.
Veröffentlicht: (2026)
von: Ning, Junzhi, et al.
Veröffentlicht: (2026)
VL-UR: Vision-Language-guided Universal Restoration of Images Degraded by Adverse Weather Conditions
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
von: Du, Yi, et al.
Veröffentlicht: (2025)
von: Du, Yi, et al.
Veröffentlicht: (2025)
SAM-Med3D-MoE: Towards a Non-Forgetting Segment Anything Model via Mixture of Experts for 3D Medical Image Segmentation
von: Wang, Guoan, et al.
Veröffentlicht: (2024)
von: Wang, Guoan, et al.
Veröffentlicht: (2024)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
von: Wu, Zhiyu, et al.
Veröffentlicht: (2024)
von: Wu, Zhiyu, et al.
Veröffentlicht: (2024)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
von: Chen, Jiuhai, et al.
Veröffentlicht: (2024)
von: Chen, Jiuhai, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
von: Su, Yanzhou, et al.
Veröffentlicht: (2025) -
GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
von: Chen, Pengcheng, et al.
Veröffentlicht: (2024) -
SegBook: A Simple Baseline and Cookbook for Volumetric Medical Image Segmentation
von: Ye, Jin, et al.
Veröffentlicht: (2024) -
SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
von: Chen, Ying, et al.
Veröffentlicht: (2024) -
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
von: Shu, Yan, et al.
Veröffentlicht: (2025)