Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Jianzhe, Wang, Churan, Zhang, Weiyi, Li, Jianghua, Li, Li-An, Wang, Wenguan, Zhu, Yixin, Wang, Yizhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026)
por: Gao, Jianzhe, et al.
Publicado: (2026)
Autoregressive Sequence Modeling for 3D Medical Image Representation
por: Wang, Siwen, et al.
Publicado: (2024)
por: Wang, Siwen, et al.
Publicado: (2024)
Clinical Inspired MRI Lesion Segmentation
por: Yan, Lijun, et al.
Publicado: (2025)
por: Yan, Lijun, et al.
Publicado: (2025)
Cross-Dimensional Medical Self-Supervised Representation Learning Based on a Pseudo-3D Transformation
por: Gao, Fei, et al.
Publicado: (2024)
por: Gao, Fei, et al.
Publicado: (2024)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
por: Ding, Xichen, et al.
Publicado: (2025)
por: Ding, Xichen, et al.
Publicado: (2025)
Clustering Propagation for Universal Medical Image Segmentation
por: Ding, Yuhang, et al.
Publicado: (2024)
por: Ding, Yuhang, et al.
Publicado: (2024)
DIFFVSGG: Diffusion-Driven Online Video Scene Graph Generation
por: Chen, Mu, et al.
Publicado: (2025)
por: Chen, Mu, et al.
Publicado: (2025)
Hierarchical Instruction-aware Embodied Visual Tracking
por: Wu, Kui, et al.
Publicado: (2025)
por: Wu, Kui, et al.
Publicado: (2025)
Semi- and Weakly-Supervised Learning for Mammogram Mass Segmentation with Limited Annotations
por: Xiong, Xinyu, et al.
Publicado: (2024)
por: Xiong, Xinyu, et al.
Publicado: (2024)
Enhanced MRI Representation via Cross-series Masking
por: Wang, Churan, et al.
Publicado: (2024)
por: Wang, Churan, et al.
Publicado: (2024)
Governance-Ready Small Language Models for Medical Imaging: Prompting, Abstention, and PACS Integration
por: Wang, Yiting, et al.
Publicado: (2025)
por: Wang, Yiting, et al.
Publicado: (2025)
Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models
por: Li, Liulei, et al.
Publicado: (2024)
por: Li, Liulei, et al.
Publicado: (2024)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
por: Wu, Kui, et al.
Publicado: (2025)
por: Wu, Kui, et al.
Publicado: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026)
por: Gao, Jianzhe, et al.
Publicado: (2026)
Scene Graph Generation with Role-Playing Large Language Models
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
Confusing Pair Correction Based on Category Prototype for Domain Adaptation under Noisy Environments
por: Zhi, Churan, et al.
Publicado: (2024)
por: Zhi, Churan, et al.
Publicado: (2024)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
por: Zhong, Fangwei, et al.
Publicado: (2024)
por: Zhong, Fangwei, et al.
Publicado: (2024)
General and Task-Oriented Video Segmentation
por: Chen, Mu, et al.
Publicado: (2024)
por: Chen, Mu, et al.
Publicado: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
por: Yang, Zongxin, et al.
Publicado: (2024)
por: Yang, Zongxin, et al.
Publicado: (2024)
Reasoning is All You Need for Video Generalization: A Counterfactual Benchmark with Sub-question Evaluation
por: Zhou, Qiji, et al.
Publicado: (2025)
por: Zhou, Qiji, et al.
Publicado: (2025)
Neural Clustering based Visual Representation Learning
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
por: Wang, Guoxin, et al.
Publicado: (2025)
por: Wang, Guoxin, et al.
Publicado: (2025)
Scalable Video Object Segmentation with Identification Mechanism
por: Yang, Zongxin, et al.
Publicado: (2022)
por: Yang, Zongxin, et al.
Publicado: (2022)
Med-LEGO: Editing and Adapting toward Generalist Medical Image Diagnosis
por: Zhu, Yitao, et al.
Publicado: (2025)
por: Zhu, Yitao, et al.
Publicado: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
por: Wang, Chendong, et al.
Publicado: (2025)
por: Wang, Chendong, et al.
Publicado: (2025)
R2G: Reasoning to Ground in 3D Scenes
por: Li, Yixuan, et al.
Publicado: (2024)
por: Li, Yixuan, et al.
Publicado: (2024)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
Multi-sentence Video Grounding for Long Video Generation
por: Feng, Wei, et al.
Publicado: (2024)
por: Feng, Wei, et al.
Publicado: (2024)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
por: Zheng, Zelin, et al.
Publicado: (2026)
por: Zheng, Zelin, et al.
Publicado: (2026)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
Task-oriented Sequential Grounding and Navigation in 3D Scenes
por: Zhang, Zhuofan, et al.
Publicado: (2024)
por: Zhang, Zhuofan, et al.
Publicado: (2024)
Volumetric Environment Representation for Vision-Language Navigation
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Learning Human-Object Interaction as Groups
por: Hong, Jiajun, et al.
Publicado: (2025)
por: Hong, Jiajun, et al.
Publicado: (2025)
Vision-Language Navigation with Energy-Based Policy
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
por: Li, Chenglin, et al.
Publicado: (2025)
por: Li, Chenglin, et al.
Publicado: (2025)
Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis
por: Lai, Haoran, et al.
Publicado: (2026)
por: Lai, Haoran, et al.
Publicado: (2026)
Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
por: Lai, Yuxiang, et al.
Publicado: (2025)
por: Lai, Yuxiang, et al.
Publicado: (2025)
Controllable Generative Video Compression
por: Ding, Ding, et al.
Publicado: (2026)
por: Ding, Ding, et al.
Publicado: (2026)
Ejemplares similares
-
3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026) -
Autoregressive Sequence Modeling for 3D Medical Image Representation
por: Wang, Siwen, et al.
Publicado: (2024) -
Clinical Inspired MRI Lesion Segmentation
por: Yan, Lijun, et al.
Publicado: (2025) -
Cross-Dimensional Medical Self-Supervised Representation Learning Based on a Pseudo-3D Transformation
por: Gao, Fei, et al.
Publicado: (2024) -
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
por: Ding, Xichen, et al.
Publicado: (2025)