Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ren, Sucheng, Huang, Xiaoke, Li, Xianhang, Xiao, Junfei, Mei, Jieru, Wang, Zeyu, Yuille, Alan, Zhou, Yuyin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024)
par: Li, Xianhang, et autres
Publié: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
Autoregressive Pretraining with Mamba in Vision
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
par: Wang, Feng, et autres
Publié: (2023)
par: Wang, Feng, et autres
Publié: (2023)
HResFormer: Hybrid Residual Transformer for Volumetric Medical Image Segmentation
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
par: Xiao, Junfei, et autres
Publié: (2023)
par: Xiao, Junfei, et autres
Publié: (2023)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
par: Mei, Jieru, et autres
Publié: (2024)
par: Mei, Jieru, et autres
Publié: (2024)
How Well Do Supervised 3D Models Transfer to Medical Imaging Tasks?
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
par: Huang, Xiaoke, et autres
Publié: (2025)
par: Huang, Xiaoke, et autres
Publié: (2025)
Beyond Masks: The Case for Medical Image Parsing
par: Gupta, Siddharth, et autres
Publié: (2026)
par: Gupta, Siddharth, et autres
Publié: (2026)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
par: Xiao, Junfei, et autres
Publié: (2024)
par: Xiao, Junfei, et autres
Publié: (2024)
Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets
par: Chen, Yixiong, et autres
Publié: (2024)
par: Chen, Yixiong, et autres
Publié: (2024)
Frequency-Aware Flow Matching for High-Quality Image Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Embracing Massive Medical Data
par: Chou, Yu-Cheng, et autres
Publié: (2024)
par: Chou, Yu-Cheng, et autres
Publié: (2024)
Large-Scale Label Quality Assessment for Medical Segmentation via a Vision-Language Judge and Synthetic Data
par: Chen, Yixiong, et autres
Publié: (2026)
par: Chen, Yixiong, et autres
Publié: (2026)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
par: Liu, Haoyu, et autres
Publié: (2026)
par: Liu, Haoyu, et autres
Publié: (2026)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
Scaling White-Box Transformers for Vision
par: Yang, Jinrui, et autres
Publié: (2024)
par: Yang, Jinrui, et autres
Publié: (2024)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
MedVersa: A Generalist Foundation Model for Medical Image Interpretation
par: Zhou, Hong-Yu, et autres
Publié: (2024)
par: Zhou, Hong-Yu, et autres
Publié: (2024)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
par: Wang, Feng, et autres
Publié: (2025)
par: Wang, Feng, et autres
Publié: (2025)
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering
par: Chen, Yixiong, et autres
Publié: (2025)
par: Chen, Yixiong, et autres
Publié: (2025)
A Comprehensive Analysis of Mamba for 3D Volumetric Medical Image Segmentation
par: Wang, Chaohan, et autres
Publié: (2025)
par: Wang, Chaohan, et autres
Publié: (2025)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
Med-LEGO: Editing and Adapting toward Generalist Medical Image Diagnosis
par: Zhu, Yitao, et autres
Publié: (2025)
par: Zhu, Yitao, et autres
Publié: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
Unified Medical Image Segmentation with State Space Modeling Snake
par: Zhang, Ruicheng, et autres
Publié: (2025)
par: Zhang, Ruicheng, et autres
Publié: (2025)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
par: Yuille, Alan, et autres
Publié: (2026)
par: Yuille, Alan, et autres
Publié: (2026)
Documents similaires
-
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024) -
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024) -
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023) -
Autoregressive Pretraining with Mamba in Vision
par: Ren, Sucheng, et autres
Publié: (2024) -
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
par: Wang, Feng, et autres
Publié: (2023)