Boosting Medical Visual Understanding From Multi-Granular Language Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zihan, Wang, Yiqing, Farsiu, Sina, Kinahan, Paul |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM
by: Wang, Yiqing, et al.
Published: (2026)
by: Wang, Yiqing, et al.
Published: (2026)
Spatial Coherence Loss: All Objects Matter in Salient and Camouflaged Object Detection
by: Yang, Ziyun, et al.
Published: (2024)
by: Yang, Ziyun, et al.
Published: (2024)
Scale-aware Adaptive Supervised Network with Limited Medical Annotations
by: Li, Zihan, et al.
Published: (2026)
by: Li, Zihan, et al.
Published: (2026)
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
by: Peng, Zhuoran, et al.
Published: (2025)
by: Peng, Zhuoran, et al.
Published: (2025)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
by: Choi, Jiho, et al.
Published: (2024)
by: Choi, Jiho, et al.
Published: (2024)
Reversible Unfolding Network for Concealed Visual Perception with Generative Refinement
by: He, Chunming, et al.
Published: (2025)
by: He, Chunming, et al.
Published: (2025)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
by: Zhao, Xiangyu, et al.
Published: (2024)
by: Zhao, Xiangyu, et al.
Published: (2024)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
by: Li, Yuhao, et al.
Published: (2024)
by: Li, Yuhao, et al.
Published: (2024)
SCALER: SAM-Enhanced Collaborative Learning for Label-Deficient Concealed Object Segmentation
by: He, Chunming, et al.
Published: (2025)
by: He, Chunming, et al.
Published: (2025)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
by: Shi, Bowen, et al.
Published: (2024)
by: Shi, Bowen, et al.
Published: (2024)
UnfoldIR: Rethinking Deep Unfolding Network in Illumination Degradation Image Restoration
by: He, Chunming, et al.
Published: (2025)
by: He, Chunming, et al.
Published: (2025)
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
by: Wang, Wenjie, et al.
Published: (2026)
by: Wang, Wenjie, et al.
Published: (2026)
IQPFR: An Image Quality Prior for Blind Face Restoration and Beyond
by: Hu, Peng, et al.
Published: (2025)
by: Hu, Peng, et al.
Published: (2025)
Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
by: Wang, Yijia, et al.
Published: (2025)
by: Wang, Yijia, et al.
Published: (2025)
Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM
by: Mao, Junyuan, et al.
Published: (2026)
by: Mao, Junyuan, et al.
Published: (2026)
Multi-Granularity Video Object Segmentation
by: Lim, Sangbeom, et al.
Published: (2024)
by: Lim, Sangbeom, et al.
Published: (2024)
Refining Context-Entangled Content Segmentation via Curriculum Selection and Anti-Curriculum Promotion
by: He, Chunming, et al.
Published: (2026)
by: He, Chunming, et al.
Published: (2026)
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding
by: Li, Zizhong, et al.
Published: (2026)
by: Li, Zizhong, et al.
Published: (2026)
Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion Model
by: He, Chunming, et al.
Published: (2023)
by: He, Chunming, et al.
Published: (2023)
VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledge
by: Li, Zihan, et al.
Published: (2024)
by: Li, Zihan, et al.
Published: (2024)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
by: Wu, Siwei, et al.
Published: (2024)
by: Wu, Siwei, et al.
Published: (2024)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
by: Zou, Minghao, et al.
Published: (2025)
by: Zou, Minghao, et al.
Published: (2025)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
by: Zohra, Fatimah, et al.
Published: (2025)
by: Zohra, Fatimah, et al.
Published: (2025)
QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration
by: Xiao, Fengyang, et al.
Published: (2026)
by: Xiao, Fengyang, et al.
Published: (2026)
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
by: Wang, Ning, et al.
Published: (2025)
by: Wang, Ning, et al.
Published: (2025)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
by: Xu, Mingjun, et al.
Published: (2025)
by: Xu, Mingjun, et al.
Published: (2025)
Nested Unfolding Network for Real-World Concealed Object Segmentation
by: He, Chunming, et al.
Published: (2025)
by: He, Chunming, et al.
Published: (2025)
Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
by: Mahdavi, Zahra, et al.
Published: (2025)
by: Mahdavi, Zahra, et al.
Published: (2025)
Multi-Granularity Representation Learning for Sketch-based Dynamic Face Image Retrieval
by: Wang, Liang, et al.
Published: (2023)
by: Wang, Liang, et al.
Published: (2023)
Boosting Medical Image Classification with Segmentation Foundation Model
by: Gu, Pengfei, et al.
Published: (2024)
by: Gu, Pengfei, et al.
Published: (2024)
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
by: Wang, Yicheng, et al.
Published: (2024)
by: Wang, Yicheng, et al.
Published: (2024)
Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents
by: Li, Jiahua, et al.
Published: (2025)
by: Li, Jiahua, et al.
Published: (2025)
Multi-Granularity Hand Action Detection
by: Zhe, Ting, et al.
Published: (2023)
by: Zhe, Ting, et al.
Published: (2023)
Spatial-Aware Self-Supervision for Medical 3D Imaging with Multi-Granularity Observable Tasks
by: Zhang, Yiqin, et al.
Published: (2025)
by: Zhang, Yiqin, et al.
Published: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
by: Peng, Xiangyu, et al.
Published: (2024)
by: Peng, Xiangyu, et al.
Published: (2024)
Distill, Diffuse, and Semanticize (DDS): Annotation-Free 3D Scene Understanding Based on Multi-Granularity Distillation and Graph-Diffusion-Based Segmentation
by: Wang, Yijing, et al.
Published: (2026)
by: Wang, Yijing, et al.
Published: (2026)
CogVLM2: Visual Language Models for Image and Video Understanding
by: Hong, Wenyi, et al.
Published: (2024)
by: Hong, Wenyi, et al.
Published: (2024)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
by: Yang, Jing, et al.
Published: (2024)
by: Yang, Jing, et al.
Published: (2024)
Similar Items
-
PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM
by: Wang, Yiqing, et al.
Published: (2026) -
Spatial Coherence Loss: All Objects Matter in Salient and Camouflaged Object Detection
by: Yang, Ziyun, et al.
Published: (2024) -
Scale-aware Adaptive Supervised Network with Limited Medical Annotations
by: Li, Zihan, et al.
Published: (2026) -
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
by: Peng, Zhuoran, et al.
Published: (2025) -
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
by: Choi, Jiho, et al.
Published: (2024)