Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
Fuente:
arXiv
Saved in:
| Main Authors: | Lai, Yuxiang, Zhong, Jike, Li, Ming, Li, Yuheng, Yang, Xiaofeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
by: Lai, Yuxiang, et al.
Published: (2025)
by: Lai, Yuxiang, et al.
Published: (2025)
MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting
by: Li, Yuheng, et al.
Published: (2025)
by: Li, Yuheng, et al.
Published: (2025)
Context Matters: Learning Global Semantics via Object-Centric Representation
by: Zhong, Jike, et al.
Published: (2025)
by: Zhong, Jike, et al.
Published: (2025)
Patient-Specific Autoregressive Models for Organ Motion Prediction in Radiotherapy
by: Lai, Yuxiang, et al.
Published: (2025)
by: Lai, Yuxiang, et al.
Published: (2025)
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
MedDINOv3: How to adapt vision foundation models for medical image segmentation?
by: Li, Yuheng, et al.
Published: (2025)
by: Li, Yuheng, et al.
Published: (2025)
EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography
by: Li, Yuheng, et al.
Published: (2025)
by: Li, Yuheng, et al.
Published: (2025)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
Are Image-to-Video Models Good Zero-Shot Image Editors?
by: Zhang, Zechuan, et al.
Published: (2025)
by: Zhang, Zechuan, et al.
Published: (2025)
Benchmarking GPT-5 for Zero-Shot Multimodal Medical Reasoning in Radiology and Radiation Oncology
by: Hu, Mingzhe, et al.
Published: (2025)
by: Hu, Mingzhe, et al.
Published: (2025)
Towards Universal Text-driven CT Image Segmentation
by: Li, Yuheng, et al.
Published: (2025)
by: Li, Yuheng, et al.
Published: (2025)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
by: Liu, Wei, et al.
Published: (2026)
by: Liu, Wei, et al.
Published: (2026)
AnatoMask: Enhancing Medical Image Segmentation with Reconstruction-guided Self-masking
by: Li, Yuheng, et al.
Published: (2024)
by: Li, Yuheng, et al.
Published: (2024)
Noise is an Efficient Learner for Zero-Shot Vision-Language Models
by: Imam, Raza, et al.
Published: (2025)
by: Imam, Raza, et al.
Published: (2025)
Zero-Shot Personalized Camera Motion Control for Image-to-Video Synthesis
by: Guhan, Pooja, et al.
Published: (2025)
by: Guhan, Pooja, et al.
Published: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
by: Xi, Suyang, et al.
Published: (2026)
by: Xi, Suyang, et al.
Published: (2026)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
by: Li, Yunheng, et al.
Published: (2024)
by: Li, Yunheng, et al.
Published: (2024)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
by: Khezresmaeilzadeh, Tina, et al.
Published: (2026)
by: Khezresmaeilzadeh, Tina, et al.
Published: (2026)
Zero-P-to-3: Zero-Shot Partial-View Images to 3D Object
by: Lin, Yuxuan, et al.
Published: (2025)
by: Lin, Yuxuan, et al.
Published: (2025)
Adapting Foundation Models for Few-Shot Medical Image Segmentation: Actively and Sequentially
by: Yang, Jingyun, et al.
Published: (2025)
by: Yang, Jingyun, et al.
Published: (2025)
SegTTA: Training-Free Test-Time Augmentation for Zero-Shot Medical Imaging Segmentation
by: Yao, Yihong, et al.
Published: (2026)
by: Yao, Yihong, et al.
Published: (2026)
Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models
by: Cao, Cong, et al.
Published: (2026)
by: Cao, Cong, et al.
Published: (2026)
TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models
by: Ni, Haomiao, et al.
Published: (2024)
by: Ni, Haomiao, et al.
Published: (2024)
Universal CT Representations from Anatomy to Disease Phenotype through Agglomerative Pretraining
by: Li, Yuheng, et al.
Published: (2026)
by: Li, Yuheng, et al.
Published: (2026)
Zero-Shot Video Deraining with Video Diffusion Models
by: Varanka, Tuomas, et al.
Published: (2025)
by: Varanka, Tuomas, et al.
Published: (2025)
DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models
by: Yeh, Chang-Han, et al.
Published: (2024)
by: Yeh, Chang-Han, et al.
Published: (2024)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
by: Kao, Shiu-hong, et al.
Published: (2025)
by: Kao, Shiu-hong, et al.
Published: (2025)
Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models
by: Wang, Wen, et al.
Published: (2023)
by: Wang, Wen, et al.
Published: (2023)
Motion-Zero: Zero-Shot Moving Object Control Framework for Diffusion-Based Video Generation
by: Chen, Changgu, et al.
Published: (2024)
by: Chen, Changgu, et al.
Published: (2024)
LMP: Leveraging Motion Prior in Zero-Shot Video Generation with Diffusion Transformer
by: Chen, Changgu, et al.
Published: (2025)
by: Chen, Changgu, et al.
Published: (2025)
Few-Shot Learner Generalizes Across AI-Generated Image Detection
by: Wu, Shiyu, et al.
Published: (2025)
by: Wu, Shiyu, et al.
Published: (2025)
PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures
by: Shao, Yuheng, et al.
Published: (2025)
by: Shao, Yuheng, et al.
Published: (2025)
Prototype Correlation Matching and Class-Relation Reasoning for Few-Shot Medical Image Segmentation
by: Zhang, Yumin, et al.
Published: (2024)
by: Zhang, Yumin, et al.
Published: (2024)
ZeroPS: High-quality Cross-modal Knowledge Transfer for Zero-Shot 3D Part Segmentation
by: Xue, Yuheng, et al.
Published: (2023)
by: Xue, Yuheng, et al.
Published: (2023)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
by: Zhang, Wentao, et al.
Published: (2024)
by: Zhang, Wentao, et al.
Published: (2024)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
by: Tu, Rong-Cheng, et al.
Published: (2025)
by: Tu, Rong-Cheng, et al.
Published: (2025)
A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis
by: Lin, Dongheng, et al.
Published: (2025)
by: Lin, Dongheng, et al.
Published: (2025)
Pretrain like Your Inference: Masked Tuning Improves Zero-Shot Composed Image Retrieval
by: Chen, Junyang, et al.
Published: (2023)
by: Chen, Junyang, et al.
Published: (2023)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
Similar Items
-
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
by: Lai, Yuxiang, et al.
Published: (2025) -
MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting
by: Li, Yuheng, et al.
Published: (2025) -
Context Matters: Learning Global Semantics via Object-Centric Representation
by: Zhong, Jike, et al.
Published: (2025) -
Patient-Specific Autoregressive Models for Organ Motion Prediction in Radiotherapy
by: Lai, Yuxiang, et al.
Published: (2025) -
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
by: Li, Ming, et al.
Published: (2024)