Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Zhenyang, Chen, Junying, Wang, Rongsheng, Wang, Weihong, Deng, Yonglin, Song, Dingjie, Chen, Yize, Zhang, Zixu, Wang, Benyou |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024)
par: Wang, Xidong, et autres
Publié: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation
par: Wang, Rongsheng, et autres
Publié: (2026)
par: Wang, Rongsheng, et autres
Publié: (2026)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)
par: Lai, Zhengzhao, et autres
Publié: (2025)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
par: Cai, Zhenyang, et autres
Publié: (2025)
par: Cai, Zhenyang, et autres
Publié: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
par: Liu, Xiaoyuan, et autres
Publié: (2024)
par: Liu, Xiaoyuan, et autres
Publié: (2024)
SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation
par: Wang, Junda, et autres
Publié: (2024)
par: Wang, Junda, et autres
Publié: (2024)
Dual-Scale Volume Priors with Wasserstein-Based Consistency for Semi-Supervised Medical Image Segmentation
par: Meng, Junying, et autres
Publié: (2025)
par: Meng, Junying, et autres
Publié: (2025)
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
par: Zheng, Mingzhe, et autres
Publié: (2025)
par: Zheng, Mingzhe, et autres
Publié: (2025)
WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
par: Jiang, Yiwen, et autres
Publié: (2025)
par: Jiang, Yiwen, et autres
Publié: (2025)
Multimodal Human-AI Synergy for Medical Imaging Quality Control: A Hybrid Intelligence Framework with Adaptive Dataset Curation and Closed-Loop Evaluation
par: Qin, Zhi, et autres
Publié: (2025)
par: Qin, Zhi, et autres
Publié: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
par: Li, Jinyuan, et autres
Publié: (2024)
par: Li, Jinyuan, et autres
Publié: (2024)
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
par: Cai, Zhongang, et autres
Publié: (2025)
par: Cai, Zhongang, et autres
Publié: (2025)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026)
par: Nie, Yiqi, et autres
Publié: (2026)
CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
par: Tian, Baoliang, et autres
Publié: (2025)
par: Tian, Baoliang, et autres
Publié: (2025)
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
par: Ge, Wentao, et autres
Publié: (2023)
par: Ge, Wentao, et autres
Publié: (2023)
Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction
par: Chen, Weiming, et autres
Publié: (2026)
par: Chen, Weiming, et autres
Publié: (2026)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
Do Composed Image Retrieval Benchmarks Require Multimodal Composition?
par: Attimonelli, Matteo, et autres
Publié: (2026)
par: Attimonelli, Matteo, et autres
Publié: (2026)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
par: Wang, Chenglin, et autres
Publié: (2026)
par: Wang, Chenglin, et autres
Publié: (2026)
MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs
par: Liu, Xuannan, et autres
Publié: (2024)
par: Liu, Xuannan, et autres
Publié: (2024)
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
par: Naseh, Ali, et autres
Publié: (2024)
par: Naseh, Ali, et autres
Publié: (2024)
Evaluating LLM -- Generated Multimodal Diagnosis from Medical Images and Symptom Analysis
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
par: Wang, Qiuchen, et autres
Publié: (2026)
par: Wang, Qiuchen, et autres
Publié: (2026)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
Documents similaires
-
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024) -
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025) -
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
par: Song, Dingjie, et autres
Publié: (2024) -
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
par: Chen, Junying, et autres
Publié: (2025) -
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024)