Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Sheng, Chen, Hao, Yin, Rui, Ba, Juyan, Zhang, Yu, Li, Yuanzhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
por: Qin, Zhenyue, et al.
Publicado: (2024)
por: Qin, Zhenyue, et al.
Publicado: (2024)
iMD4GC: Incomplete Multimodal Data Integration to Advance Precise Treatment Response Prediction and Survival Analysis for Gastric Cancer
por: Zhou, Fengtao, et al.
Publicado: (2024)
por: Zhou, Fengtao, et al.
Publicado: (2024)
A Comparative Analysis of Image Descriptors for Histopathological Classification of Gastric Cancer
por: Usai, Marco, et al.
Publicado: (2025)
por: Usai, Marco, et al.
Publicado: (2025)
SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis
por: Zhao, Shuxian, et al.
Publicado: (2026)
por: Zhao, Shuxian, et al.
Publicado: (2026)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
por: Shao, Hao, et al.
Publicado: (2024)
por: Shao, Hao, et al.
Publicado: (2024)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
por: Qin, Zhenyue, et al.
Publicado: (2025)
por: Qin, Zhenyue, et al.
Publicado: (2025)
ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis
por: Chen, Jian, et al.
Publicado: (2024)
por: Chen, Jian, et al.
Publicado: (2024)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
HWA-UNETR: Hierarchical Window Aggregate UNETR for 3D Multimodal Gastric Lesion Segmentation
por: Liang, Jiaming, et al.
Publicado: (2025)
por: Liang, Jiaming, et al.
Publicado: (2025)
Soft-Label Anonymous Gastric X-ray Image Distillation
por: Li, Guang, et al.
Publicado: (2021)
por: Li, Guang, et al.
Publicado: (2021)
Multimodal Dataset Distillation via Phased Teacher Models
por: Guo, Shengbin, et al.
Publicado: (2026)
por: Guo, Shengbin, et al.
Publicado: (2026)
Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
por: Hao, Jing, et al.
Publicado: (2025)
por: Hao, Jing, et al.
Publicado: (2025)
Foundational Models for Pathology and Endoscopy Images: Application for Gastric Inflammation
por: Kerdegari, Hamideh, et al.
Publicado: (2024)
por: Kerdegari, Hamideh, et al.
Publicado: (2024)
Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
por: Weng, Xingxing, et al.
Publicado: (2026)
por: Weng, Xingxing, et al.
Publicado: (2026)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
por: Huang, Guolei, et al.
Publicado: (2025)
por: Huang, Guolei, et al.
Publicado: (2025)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
por: Li, Jiale, et al.
Publicado: (2025)
por: Li, Jiale, et al.
Publicado: (2025)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
por: Zhang, Fan, et al.
Publicado: (2025)
por: Zhang, Fan, et al.
Publicado: (2025)
Vision-Language Models for Vision Tasks: A Survey
por: Zhang, Jingyi, et al.
Publicado: (2023)
por: Zhang, Jingyi, et al.
Publicado: (2023)
Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
por: Nguyen, Huu Tien, et al.
Publicado: (2025)
por: Nguyen, Huu Tien, et al.
Publicado: (2025)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
por: Sugiura, Issa, et al.
Publicado: (2026)
por: Sugiura, Issa, et al.
Publicado: (2026)
Motion-Guided Dual-Camera Tracker for Endoscope Tracking and Motion Analysis in a Mechanical Gastric Simulator
por: Zhang, Yuelin, et al.
Publicado: (2024)
por: Zhang, Yuelin, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
por: Chen, Qian, et al.
Publicado: (2026)
por: Chen, Qian, et al.
Publicado: (2026)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
por: Ying, Kaining, et al.
Publicado: (2024)
por: Ying, Kaining, et al.
Publicado: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
por: Ma, Yingzi, et al.
Publicado: (2024)
por: Ma, Yingzi, et al.
Publicado: (2024)
Practical X-ray Gastric Cancer Diagnostic Support Using Refined Stochastic Data Augmentation and Hard Boundary Box Training
por: Okamoto, Hideaki, et al.
Publicado: (2021)
por: Okamoto, Hideaki, et al.
Publicado: (2021)
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
por: Khanal, Bidur, et al.
Publicado: (2025)
por: Khanal, Bidur, et al.
Publicado: (2025)
Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective
por: An, Arctanx, et al.
Publicado: (2026)
por: An, Arctanx, et al.
Publicado: (2026)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
por: Shi, Zhelun, et al.
Publicado: (2024)
por: Shi, Zhelun, et al.
Publicado: (2024)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
por: Du, Hao, et al.
Publicado: (2025)
por: Du, Hao, et al.
Publicado: (2025)
A Touch, Vision, and Language Dataset for Multimodal Alignment
por: Fu, Letian, et al.
Publicado: (2024)
por: Fu, Letian, et al.
Publicado: (2024)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
por: Ren, Xiyu, et al.
Publicado: (2026)
por: Ren, Xiyu, et al.
Publicado: (2026)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)
por: Wu, Jiannan, et al.
Publicado: (2024)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
por: Li, Chenxu, et al.
Publicado: (2025)
por: Li, Chenxu, et al.
Publicado: (2025)
When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark Dataset
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study
por: Mayer, Leon, et al.
Publicado: (2025)
por: Mayer, Leon, et al.
Publicado: (2025)
Ejemplares similares
-
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
por: Qin, Zhenyue, et al.
Publicado: (2024) -
iMD4GC: Incomplete Multimodal Data Integration to Advance Precise Treatment Response Prediction and Survival Analysis for Gastric Cancer
por: Zhou, Fengtao, et al.
Publicado: (2024) -
A Comparative Analysis of Image Descriptors for Histopathological Classification of Gastric Cancer
por: Usai, Marco, et al.
Publicado: (2025) -
SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis
por: Zhao, Shuxian, et al.
Publicado: (2026) -
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
por: Shao, Hao, et al.
Publicado: (2024)