CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singh, Pooja, Ujjain, Siddhant, Gandhi, Tapan Kumar, Kumar, Sandeep |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedVSR: Medical Video Super-Resolution with Cross State-Space Propagation
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Cross Modality Image Translation In Medical Imaging Using Generative Frameworks
par: Romoli, Giulia, et autres
Publié: (2026)
par: Romoli, Giulia, et autres
Publié: (2026)
Personalized Image Generation from an Author Writing Style
par: Gandhi, Sagar, et autres
Publié: (2025)
par: Gandhi, Sagar, et autres
Publié: (2025)
Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare
par: Chhetri, Aavash, et autres
Publié: (2026)
par: Chhetri, Aavash, et autres
Publié: (2026)
A Multimodal, Multitask System for Generating E Commerce Text Listings from Images
par: Singh, Nayan Kumar
Publié: (2025)
par: Singh, Nayan Kumar
Publié: (2025)
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
par: Gong, Haozhen, et autres
Publié: (2025)
par: Gong, Haozhen, et autres
Publié: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
par: Li, Yanjun, et autres
Publié: (2025)
par: Li, Yanjun, et autres
Publié: (2025)
Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
par: Aggarwal, Sajal, et autres
Publié: (2024)
par: Aggarwal, Sajal, et autres
Publié: (2024)
RegionMed-CLIP: A Region-Aware Multimodal Contrastive Learning Pre-trained Model for Medical Image Understanding
par: Fang, Tianchen, et autres
Publié: (2025)
par: Fang, Tianchen, et autres
Publié: (2025)
Cross-Task Pretraining for Cross-Organ Cross-Scanner Adenocarcinoma Segmentation
par: Galdran, Adrian
Publié: (2024)
par: Galdran, Adrian
Publié: (2024)
Mitigating Cross-Image Information Leakage in LVLMs for Multi-Image Tasks
par: Park, Yeji, et autres
Publié: (2025)
par: Park, Yeji, et autres
Publié: (2025)
A Multimodal-Multitask Framework with Cross-modal Relation and Hierarchical Interactive Attention for Semantic Comprehension
par: Rehman, Mohammad Zia Ur, et autres
Publié: (2025)
par: Rehman, Mohammad Zia Ur, et autres
Publié: (2025)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
par: Wan, Zhongwei, et autres
Publié: (2023)
par: Wan, Zhongwei, et autres
Publié: (2023)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
par: Choi, Byungjin, et autres
Publié: (2026)
par: Choi, Byungjin, et autres
Publié: (2026)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
par: Cai, Zhenyang, et autres
Publié: (2024)
par: Cai, Zhenyang, et autres
Publié: (2024)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
par: Shang, Fangxin, et autres
Publié: (2025)
par: Shang, Fangxin, et autres
Publié: (2025)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
Cross-model Mutual Learning for Exemplar-based Medical Image Segmentation
par: En, Qing, et autres
Publié: (2024)
par: En, Qing, et autres
Publié: (2024)
Masked Contrastive Reconstruction for Cross-modal Medical Image-Report Retrieval
par: Wei, Zeqiang, et autres
Publié: (2023)
par: Wei, Zeqiang, et autres
Publié: (2023)
MedFILIP: Medical Fine-grained Language-Image Pre-training
par: Liang, Xinjie, et autres
Publié: (2025)
par: Liang, Xinjie, et autres
Publié: (2025)
MedLiteNet: Lightweight Hybrid Medical Image Segmentation Model
par: Yu, Pengyang, et autres
Publié: (2025)
par: Yu, Pengyang, et autres
Publié: (2025)
MedEBench: Diagnosing Reliability in Text-Guided Medical Image Editing
par: Liu, Minghao, et autres
Publié: (2025)
par: Liu, Minghao, et autres
Publié: (2025)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
par: Chang, Aofei, et autres
Publié: (2025)
par: Chang, Aofei, et autres
Publié: (2025)
MedSymmFlow: Bridging Generative Modeling and Classification in Medical Imaging through Symmetrical Flow Matching
par: Caetano, Francisco, et autres
Publié: (2025)
par: Caetano, Francisco, et autres
Publié: (2025)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
ISS-Geo142: A Benchmark for Geolocating Astronaut Photography from the International Space Station
par: Srivastava, Vedika, et autres
Publié: (2025)
par: Srivastava, Vedika, et autres
Publié: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
XAI-MeD: Explainable Knowledge Guided Neuro-Symbolic Framework for Domain Generalization and Rare Class Detection in Medical Imaging
par: Urooj, Midhat, et autres
Publié: (2026)
par: Urooj, Midhat, et autres
Publié: (2026)
VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment
par: Saravanan, Darshana, et autres
Publié: (2024)
par: Saravanan, Darshana, et autres
Publié: (2024)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
FashionSD-X: Multimodal Fashion Garment Synthesis using Latent Diffusion
par: Singh, Abhishek Kumar, et autres
Publié: (2024)
par: Singh, Abhishek Kumar, et autres
Publié: (2024)
RecruitView: A Multimodal Dataset for Predicting Personality and Interview Performance for Human Resources Applications
par: Gupta, Amit Kumar, et autres
Publié: (2025)
par: Gupta, Amit Kumar, et autres
Publié: (2025)
Separate-and-Enhance: Compositional Finetuning for Text2Image Diffusion Models
par: Bao, Zhipeng, et autres
Publié: (2023)
par: Bao, Zhipeng, et autres
Publié: (2023)
MedIQA: A Scalable Foundation Model for Prompt-Driven Medical Image Quality Assessment
par: Xun, Siyi, et autres
Publié: (2025)
par: Xun, Siyi, et autres
Publié: (2025)
CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion
par: Huang, Nisha, et autres
Publié: (2024)
par: Huang, Nisha, et autres
Publié: (2024)
Cross-Task Attack: A Self-Supervision Generative Framework Based on Attention Shift
par: Zeng, Qingyuan, et autres
Publié: (2024)
par: Zeng, Qingyuan, et autres
Publié: (2024)
DescriptorMedSAM: Language-Image Fusion with Multi-Aspect Text Guidance for Medical Image Segmentation
par: Zhang, Wenjie, et autres
Publié: (2025)
par: Zhang, Wenjie, et autres
Publié: (2025)
SURE-Med: Systematic Uncertainty Reduction for Enhanced Reliability in Medical Report Generation
par: Gu, Yuhang, et autres
Publié: (2025)
par: Gu, Yuhang, et autres
Publié: (2025)
Documents similaires
-
MedVSR: Medical Video Super-Resolution with Cross State-Space Propagation
par: Liu, Xinyu, et autres
Publié: (2025) -
Cross Modality Image Translation In Medical Imaging Using Generative Frameworks
par: Romoli, Giulia, et autres
Publié: (2026) -
Personalized Image Generation from an Author Writing Style
par: Gandhi, Sagar, et autres
Publié: (2025) -
Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare
par: Chhetri, Aavash, et autres
Publié: (2026) -
A Multimodal, Multitask System for Generating E Commerce Text Listings from Images
par: Singh, Nayan Kumar
Publié: (2025)