Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
Fuente:
arXiv
Saved in:
| Main Authors: | Hamamci, Ibrahim Ethem, Er, Sezgin, Shit, Suprosanna, Reynaud, Hadrien, Yang, Dong, Guo, Pengfei, Edgar, Marc, Xu, Daguang, Kainz, Bernhard, Menze, Bjoern |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CRG Score: A Distribution-Aware Clinical Metric for Radiology Report Generation
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025)
SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning
by: Wang, Jiayi, et al.
Published: (2026)
by: Wang, Jiayi, et al.
Published: (2026)
CT2Rep: Automated Radiology Report Generation for 3D Medical Imaging
by: Hamamci, Ibrahim Ethem, et al.
Published: (2024)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2024)
vesselFM: A Foundation Model for Universal 3D Blood Vessel Segmentation
by: Wittmann, Bastian, et al.
Published: (2024)
by: Wittmann, Bastian, et al.
Published: (2024)
Semantically Consistent Discrete Diffusion for 3D Biological Graph Modeling
by: Prabhakar, Chinmay, et al.
Published: (2025)
by: Prabhakar, Chinmay, et al.
Published: (2025)
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering
by: Chen, Yixiong, et al.
Published: (2025)
by: Chen, Yixiong, et al.
Published: (2025)
GenerateCT: Text-Conditional Generation of 3D Chest CT Volumes
by: Hamamci, Ibrahim Ethem, et al.
Published: (2023)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2023)
CTFlow: Video-Inspired Latent Flow Matching for 3D CT Synthesis
by: Wang, Jiayi, et al.
Published: (2025)
by: Wang, Jiayi, et al.
Published: (2025)
Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography
by: Hamamci, Ibrahim Ethem, et al.
Published: (2024)
by: Hamamci, Ibrahim Ethem, et al.
Published: (2024)
RadDiagSeg-M: A Vision Language Model for Joint Diagnosis and Multi-Target Segmentation in Radiology
by: Li, Chengrun, et al.
Published: (2025)
by: Li, Chengrun, et al.
Published: (2025)
Uncovering Hidden Subspaces in Video Diffusion Models Using Re-Identification
by: Dombrowski, Mischa, et al.
Published: (2024)
by: Dombrowski, Mischa, et al.
Published: (2024)
Leveraging Multi-Modal Information to Enhance Dataset Distillation
by: Li, Zhe, et al.
Published: (2025)
by: Li, Zhe, et al.
Published: (2025)
VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation
by: Prabhakar, Chinmay, et al.
Published: (2026)
by: Prabhakar, Chinmay, et al.
Published: (2026)
Noise Crystallization and Liquid Noise: Zero-shot Video Generation using Image Diffusion Models
by: Khan, Muhammad Haaris, et al.
Published: (2024)
by: Khan, Muhammad Haaris, et al.
Published: (2024)
ProGiDiff: Prompt-Guided Diffusion-Based Medical Image Segmentation
by: Lin, Yuan, et al.
Published: (2026)
by: Lin, Yuan, et al.
Published: (2026)
3D Vessel Graph Generation Using Denoising Diffusion
by: Prabhakar, Chinmay, et al.
Published: (2024)
by: Prabhakar, Chinmay, et al.
Published: (2024)
DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
by: Chen, Yixiong, et al.
Published: (2026)
by: Chen, Yixiong, et al.
Published: (2026)
InfoMotion: A Graph-Based Approach to Video Dataset Distillation for Echocardiography
by: Li, Zhe, et al.
Published: (2025)
by: Li, Zhe, et al.
Published: (2025)
Sparse Representation Learning for Vessels
by: Prabhakar, Chinmay, et al.
Published: (2026)
by: Prabhakar, Chinmay, et al.
Published: (2026)
Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction
by: Bubeck, Niklas, et al.
Published: (2025)
by: Bubeck, Niklas, et al.
Published: (2025)
Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis
by: Li, Zhe, et al.
Published: (2025)
by: Li, Zhe, et al.
Published: (2025)
VariViT: A Vision Transformer for Variable Image Sizes
by: Varma, Aswathi, et al.
Published: (2026)
by: Varma, Aswathi, et al.
Published: (2026)
Graph Energy Matching: Transport-Aligned Energy-Based Modeling for Graph Generation
by: Balcerak, Michal, et al.
Published: (2026)
by: Balcerak, Michal, et al.
Published: (2026)
Circle of Willis Centerline Graphs: A Dataset and Baseline Algorithm
by: Musio, Fabio, et al.
Published: (2025)
by: Musio, Fabio, et al.
Published: (2025)
EchoFlow: A Foundation Model for Cardiac Ultrasound Image and Video Generation
by: Reynaud, Hadrien, et al.
Published: (2025)
by: Reynaud, Hadrien, et al.
Published: (2025)
Image Generation Diversity Issues and How to Tame Them
by: Dombrowski, Mischa, et al.
Published: (2024)
by: Dombrowski, Mischa, et al.
Published: (2024)
Energy Matching: Unifying Flow Matching and Energy-Based Models for Generative Modeling
by: Balcerak, Michal, et al.
Published: (2025)
by: Balcerak, Michal, et al.
Published: (2025)
MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models
by: Royer, Corentin, et al.
Published: (2024)
by: Royer, Corentin, et al.
Published: (2024)
JVID: Joint Video-Image Diffusion for Visual-Quality and Temporal-Consistency in Video Generation
by: Reynaud, Hadrien, et al.
Published: (2024)
by: Reynaud, Hadrien, et al.
Published: (2024)
EchoNet-Synthetic: Privacy-preserving Video Generation for Safe Medical Data Sharing
by: Reynaud, Hadrien, et al.
Published: (2024)
by: Reynaud, Hadrien, et al.
Published: (2024)
Whole Heart 3D+T Representation Learning Through Sparse 2D Cardiac MR Images
by: Zhang, Yundi, et al.
Published: (2024)
by: Zhang, Yundi, et al.
Published: (2024)
Video Dataset Condensation with Diffusion Models
by: Li, Zhe, et al.
Published: (2025)
by: Li, Zhe, et al.
Published: (2025)
fastWDM3D: Fast and Accurate 3D Healthy Tissue Inpainting
by: Durrer, Alicia, et al.
Published: (2025)
by: Durrer, Alicia, et al.
Published: (2025)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
by: Nützel, Felix, et al.
Published: (2025)
by: Nützel, Felix, et al.
Published: (2025)
See More, Change Less: Anatomy-Aware Diffusion for Contrast Enhancement
by: Liu, Junqi, et al.
Published: (2025)
by: Liu, Junqi, et al.
Published: (2025)
Feature-Conditioned Cascaded Video Diffusion Models for Precise Echocardiogram Synthesis
by: Reynaud, Hadrien, et al.
Published: (2023)
by: Reynaud, Hadrien, et al.
Published: (2023)
VISTA3D: A Unified Segmentation Foundation Model For 3D Medical Imaging
by: He, Yufan, et al.
Published: (2024)
by: He, Yufan, et al.
Published: (2024)
Letter to Editor: Comments on Impact of Peri‐Procedural Antibiotics on Post‐ERCP Infectious Adverse Events With Distal Malignant Biliary Obstruction
by: İbrahim Ethem Güven
Published: (2026)
by: İbrahim Ethem Güven
Published: (2026)
Denoising Diffusion Models for 3D Healthy Brain Tissue Inpainting
by: Durrer, Alicia, et al.
Published: (2024)
by: Durrer, Alicia, et al.
Published: (2024)
MInDI-3D: Iterative Deep Learning in 3D for Sparse-view Cone Beam Computed Tomography
by: Barco, Daniel, et al.
Published: (2025)
by: Barco, Daniel, et al.
Published: (2025)
Similar Items
-
CRG Score: A Distribution-Aware Clinical Metric for Radiology Report Generation
by: Hamamci, Ibrahim Ethem, et al.
Published: (2025) -
SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning
by: Wang, Jiayi, et al.
Published: (2026) -
CT2Rep: Automated Radiology Report Generation for 3D Medical Imaging
by: Hamamci, Ibrahim Ethem, et al.
Published: (2024) -
vesselFM: A Foundation Model for Universal 3D Blood Vessel Segmentation
by: Wittmann, Bastian, et al.
Published: (2024) -
Semantically Consistent Discrete Diffusion for 3D Biological Graph Modeling
by: Prabhakar, Chinmay, et al.
Published: (2025)