Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Xun, Mo, Fanbin, Zhang, Zheng, Wang, Jiaxi, Shi, Yiming, Wu, Ming, Zhang, Chuang, Li, Miao, Wu, Ji |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
by: Zhu, Xun, et al.
Published: (2024)
by: Zhu, Xun, et al.
Published: (2024)
Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
by: Zhu, Xun, et al.
Published: (2026)
by: Zhu, Xun, et al.
Published: (2026)
VN-Net: Vision-Numerical Fusion Graph Convolutional Network for Sparse Spatio-Temporal Meteorological Forecasting
by: Xiong, Yutong, et al.
Published: (2024)
by: Xiong, Yutong, et al.
Published: (2024)
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
by: Zhu, Xun, et al.
Published: (2025)
by: Zhu, Xun, et al.
Published: (2025)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)
by: Shi, Yiming, et al.
Published: (2024)
MedM-VL: What Makes a Good Medical LVLM?
by: Shi, Yiming, et al.
Published: (2025)
by: Shi, Yiming, et al.
Published: (2025)
MIPS: a Multimodal Infinite Polymer Sequence Pre-training Framework for Polymer Property Prediction
by: Wang, Jiaxi, et al.
Published: (2025)
by: Wang, Jiaxi, et al.
Published: (2025)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
by: Huang, Jiaxi, et al.
Published: (2025)
by: Huang, Jiaxi, et al.
Published: (2025)
MUSE-FM: Multi-task Environment-aware Foundation Model for Wireless Communications
by: Zheng, Tianyue, et al.
Published: (2025)
by: Zheng, Tianyue, et al.
Published: (2025)
VisionFM: a Multi-Modal Multi-Task Vision Foundation Model for Generalist Ophthalmic Artificial Intelligence
by: Qiu, Jianing, et al.
Published: (2023)
by: Qiu, Jianing, et al.
Published: (2023)
Multi-Scale Representations by Varying Window Attention for Semantic Segmentation
by: Yan, Haotian, et al.
Published: (2024)
by: Yan, Haotian, et al.
Published: (2024)
Balancing Multi-Target Semi-Supervised Medical Image Segmentation with Collaborative Generalist and Specialists
by: Wang, You, et al.
Published: (2025)
by: Wang, You, et al.
Published: (2025)
Foundation Models for Medical Imaging: Status, Challenges, and Directions
by: Niu, Chuang, et al.
Published: (2026)
by: Niu, Chuang, et al.
Published: (2026)
A Survey on Trustworthiness in Foundation Models for Medical Image Analysis
by: Shi, Congzhen, et al.
Published: (2024)
by: Shi, Congzhen, et al.
Published: (2024)
Vision Foundation Models as Generalist Tokenizers for Image Generation
by: Zheng, Anlin, et al.
Published: (2026)
by: Zheng, Anlin, et al.
Published: (2026)
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
by: Shi, Danli, et al.
Published: (2024)
by: Shi, Danli, et al.
Published: (2024)
MEBS: Multi-task End-to-end Bid Shading for Multi-slot Display Advertising
by: Gong, Zhen, et al.
Published: (2024)
by: Gong, Zhen, et al.
Published: (2024)
MedVersa: A Generalist Foundation Model for Medical Image Interpretation
by: Zhou, Hong-Yu, et al.
Published: (2024)
by: Zhou, Hong-Yu, et al.
Published: (2024)
MFogHub: Bridging Multi-Regional and Multi-Satellite Data for Global Marine Fog Detection and Forecasting
by: Xu, Mengqiu, et al.
Published: (2025)
by: Xu, Mengqiu, et al.
Published: (2025)
When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical Applications
by: Liu, Qidong, et al.
Published: (2023)
by: Liu, Qidong, et al.
Published: (2023)
LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence
by: Zhang, Xingxuan, et al.
Published: (2025)
by: Zhang, Xingxuan, et al.
Published: (2025)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
by: Wu, Siwei, et al.
Published: (2024)
by: Wu, Siwei, et al.
Published: (2024)
Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction
by: Liu, Liping, et al.
Published: (2025)
by: Liu, Liping, et al.
Published: (2025)
A Residual Multi-task Network for Joint Classification and Regression in Medical Imaging
by: Lin, Junji, et al.
Published: (2025)
by: Lin, Junji, et al.
Published: (2025)
Multi-scale Feature Enhancement in Multi-task Learning for Medical Image Analysis
by: Bui, Phuoc-Nguyen, et al.
Published: (2024)
by: Bui, Phuoc-Nguyen, et al.
Published: (2024)
TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models
by: Yu, Fangxu, et al.
Published: (2026)
by: Yu, Fangxu, et al.
Published: (2026)
An Audio-centric Multi-task Learning Framework for Streaming Ads Targeting on Spotify
by: Verma, Shivam, et al.
Published: (2025)
by: Verma, Shivam, et al.
Published: (2025)
InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery
by: Zheng, Kaili, et al.
Published: (2026)
by: Zheng, Kaili, et al.
Published: (2026)
Towards Metric-Aware Multi-Person Mesh Recovery by Jointly Optimizing Human Crowd in Camera Space
by: Wang, Kaiwen, et al.
Published: (2025)
by: Wang, Kaiwen, et al.
Published: (2025)
Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse
by: Zhang, Kuan, et al.
Published: (2026)
by: Zhang, Kuan, et al.
Published: (2026)
Delving into Multi-modal Multi-task Foundation Models for Road Scene Understanding: From Learning Paradigm Perspectives
by: Luo, Sheng, et al.
Published: (2024)
by: Luo, Sheng, et al.
Published: (2024)
VersaTune: An Efficient Data Composition Framework for Training Multi-Capability LLMs
by: Lu, Keer, et al.
Published: (2024)
by: Lu, Keer, et al.
Published: (2024)
$π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
by: Intelligence, Physical, et al.
Published: (2026)
by: Intelligence, Physical, et al.
Published: (2026)
Multi-View Crowd Counting With Self-Supervised Learning
by: Mo, Hong, et al.
Published: (2025)
by: Mo, Hong, et al.
Published: (2025)
Self-Supervised Learning for Medical Image Data with Anatomy-Oriented Imaging Planes
by: Zhang, Tianwei, et al.
Published: (2024)
by: Zhang, Tianwei, et al.
Published: (2024)
Metamaterial‐Enabled Hybrid Receive Coil for Enhanced Magnetic Resonance Imaging Capabilities
by: Xia Zhu, et al.
Published: (2024)
by: Xia Zhu, et al.
Published: (2024)
Large Language Model as a Universal Clinical Multi-task Decoder
by: Wu, Yujiang, et al.
Published: (2024)
by: Wu, Yujiang, et al.
Published: (2024)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
by: Liu, Ye, et al.
Published: (2024)
by: Liu, Ye, et al.
Published: (2024)
UniCompress: Enhancing Multi-Data Medical Image Compression with Knowledge Distillation
by: Yang, Runzhao, et al.
Published: (2024)
by: Yang, Runzhao, et al.
Published: (2024)
QuMATL: Query-based Multi-annotator Tendency Learning
by: Zhang, Liyun, et al.
Published: (2025)
by: Zhang, Liyun, et al.
Published: (2025)
Similar Items
-
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
by: Zhu, Xun, et al.
Published: (2024) -
Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
by: Zhu, Xun, et al.
Published: (2026) -
VN-Net: Vision-Numerical Fusion Graph Convolutional Network for Sparse Spatio-Temporal Meteorological Forecasting
by: Xiong, Yutong, et al.
Published: (2024) -
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
by: Zhu, Xun, et al.
Published: (2025) -
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)