EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shengyuan, Zheng, Boyun, Chen, Wenting, Peng, Zhihao, Yin, Zhenfei, Shao, Jing, Hu, Jiancong, Yuan, Yixuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TumorGen: Boundary-Aware Tumor-Mask Synthesis with Rectified Flow Matching
di: Liu, Shengyuan, et al.
Pubblicazione: (2025)
di: Liu, Shengyuan, et al.
Pubblicazione: (2025)
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
di: Peng, Zhihao, et al.
Pubblicazione: (2025)
di: Peng, Zhihao, et al.
Pubblicazione: (2025)
MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
di: Liu, Shengyuan, et al.
Pubblicazione: (2026)
di: Liu, Shengyuan, et al.
Pubblicazione: (2026)
MAC: Masked Agent Collaboration Boosts Large Language Model Medical Decision-Making
di: Peng, Zhihao, et al.
Pubblicazione: (2025)
di: Peng, Zhihao, et al.
Pubblicazione: (2025)
Polyp-Gen: Realistic and Diverse Polyp Image Generation for Endoscopic Dataset Expansion
di: Liu, Shengyuan, et al.
Pubblicazione: (2025)
di: Liu, Shengyuan, et al.
Pubblicazione: (2025)
EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy
di: Ng, Chi Kit, et al.
Pubblicazione: (2025)
di: Ng, Chi Kit, et al.
Pubblicazione: (2025)
EndoMUST: Monocular Depth Estimation for Robotic Endoscopy via End-to-end Multi-step Self-supervised Training
di: Shao, Liangjing, et al.
Pubblicazione: (2025)
di: Shao, Liangjing, et al.
Pubblicazione: (2025)
EndoDINO: A Foundation Model for GI Endoscopy
di: Dermyer, Patrick, et al.
Pubblicazione: (2025)
di: Dermyer, Patrick, et al.
Pubblicazione: (2025)
Brain-WM: Brain Glioblastoma World Model
di: Wang, Chenhui, et al.
Pubblicazione: (2026)
di: Wang, Chenhui, et al.
Pubblicazione: (2026)
MAP: Evaluation and Multi-Agent Enhancement of Large Language Models for Inpatient Pathways
di: Chen, Zhen, et al.
Pubblicazione: (2025)
di: Chen, Zhen, et al.
Pubblicazione: (2025)
Safe Navigation for Robotic Digestive Endoscopy via Human Intervention-based Reinforcement Learning
di: Tan, Min, et al.
Pubblicazione: (2024)
di: Tan, Min, et al.
Pubblicazione: (2024)
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
di: Huang, Xu, et al.
Pubblicazione: (2025)
di: Huang, Xu, et al.
Pubblicazione: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
di: Li, Lijun, et al.
Pubblicazione: (2024)
di: Li, Lijun, et al.
Pubblicazione: (2024)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
di: Yin, Wenjing, et al.
Pubblicazione: (2025)
di: Yin, Wenjing, et al.
Pubblicazione: (2025)
EndoUIC: Promptable Diffusion Transformer for Unified Illumination Correction in Capsule Endoscopy
di: Bai, Long, et al.
Pubblicazione: (2024)
di: Bai, Long, et al.
Pubblicazione: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
di: Pang, Qi, et al.
Pubblicazione: (2024)
di: Pang, Qi, et al.
Pubblicazione: (2024)
EndoMetric: Near-Light Monocular Metric Scale Estimation in Endoscopy
di: Iranzo, Raúl, et al.
Pubblicazione: (2024)
di: Iranzo, Raúl, et al.
Pubblicazione: (2024)
Endora: Video Generation Models as Endoscopy Simulators
di: Li, Chenxin, et al.
Pubblicazione: (2024)
di: Li, Chenxin, et al.
Pubblicazione: (2024)
Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench
di: Ye, Zanting, et al.
Pubblicazione: (2026)
di: Ye, Zanting, et al.
Pubblicazione: (2026)
EndoOOD: Uncertainty-aware Out-of-distribution Detection in Capsule Endoscopy Diagnosis
di: Tan, Qiaozhi, et al.
Pubblicazione: (2024)
di: Tan, Qiaozhi, et al.
Pubblicazione: (2024)
A Novel Framework for Multi-Modal Protein Representation Learning
di: Zheng, Runjie, et al.
Pubblicazione: (2025)
di: Zheng, Runjie, et al.
Pubblicazione: (2025)
MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
di: Hua, Hang, et al.
Pubblicazione: (2025)
di: Hua, Hang, et al.
Pubblicazione: (2025)
EndoGen: Conditional Autoregressive Endoscopic Video Generation
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks
di: Eslaminia, Ahmadreza, et al.
Pubblicazione: (2024)
di: Eslaminia, Ahmadreza, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Sentiment Analysis: Multi-Modal Analysis of Decentraland's MANA Token
di: Wu, Xintong, et al.
Pubblicazione: (2026)
di: Wu, Xintong, et al.
Pubblicazione: (2026)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023)
di: Chu, Zheng, et al.
Pubblicazione: (2023)
HCV Screening Before Endoscopy in Hepatogastroenterology Outpatient Clinic: The Depist C Endo Study
di: André‐Jean Remy, et al.
Pubblicazione: (2025)
di: André‐Jean Remy, et al.
Pubblicazione: (2025)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
Solving the BGK Model and Boltzmann equation by Fourier Neural Operator with conservative constraints
di: Hu, Boyun, et al.
Pubblicazione: (2025)
di: Hu, Boyun, et al.
Pubblicazione: (2025)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
di: Qiu, Han, et al.
Pubblicazione: (2024)
di: Qiu, Han, et al.
Pubblicazione: (2024)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
di: Zhang, Yazhou, et al.
Pubblicazione: (2024)
di: Zhang, Yazhou, et al.
Pubblicazione: (2024)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
EndoGaussian: Real-time Gaussian Splatting for Dynamic Endoscopic Scene Reconstruction
di: Liu, Yifan, et al.
Pubblicazione: (2024)
di: Liu, Yifan, et al.
Pubblicazione: (2024)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
di: Qian, Chen, et al.
Pubblicazione: (2024)
di: Qian, Chen, et al.
Pubblicazione: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
di: Zhang, Yongting, et al.
Pubblicazione: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
di: Chen, Jingxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TumorGen: Boundary-Aware Tumor-Mask Synthesis with Rectified Flow Matching
di: Liu, Shengyuan, et al.
Pubblicazione: (2025) -
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
di: Peng, Zhihao, et al.
Pubblicazione: (2025) -
MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
di: Liu, Shengyuan, et al.
Pubblicazione: (2026) -
MAC: Masked Agent Collaboration Boosts Large Language Model Medical Decision-Making
di: Peng, Zhihao, et al.
Pubblicazione: (2025) -
Polyp-Gen: Realistic and Diverse Polyp Image Generation for Endoscopic Dataset Expansion
di: Liu, Shengyuan, et al.
Pubblicazione: (2025)