Boosting Medical Visual Understanding From Multi-Granular Language Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zihan, Wang, Yiqing, Farsiu, Sina, Kinahan, Paul |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM
por: Wang, Yiqing, et al.
Publicado: (2026)
por: Wang, Yiqing, et al.
Publicado: (2026)
Spatial Coherence Loss: All Objects Matter in Salient and Camouflaged Object Detection
por: Yang, Ziyun, et al.
Publicado: (2024)
por: Yang, Ziyun, et al.
Publicado: (2024)
Scale-aware Adaptive Supervised Network with Limited Medical Annotations
por: Li, Zihan, et al.
Publicado: (2026)
por: Li, Zihan, et al.
Publicado: (2026)
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
por: Peng, Zhuoran, et al.
Publicado: (2025)
por: Peng, Zhuoran, et al.
Publicado: (2025)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
por: Choi, Jiho, et al.
Publicado: (2024)
por: Choi, Jiho, et al.
Publicado: (2024)
Reversible Unfolding Network for Concealed Visual Perception with Generative Refinement
por: He, Chunming, et al.
Publicado: (2025)
por: He, Chunming, et al.
Publicado: (2025)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
por: Li, Yuhao, et al.
Publicado: (2024)
por: Li, Yuhao, et al.
Publicado: (2024)
SCALER: SAM-Enhanced Collaborative Learning for Label-Deficient Concealed Object Segmentation
por: He, Chunming, et al.
Publicado: (2025)
por: He, Chunming, et al.
Publicado: (2025)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
por: Shi, Bowen, et al.
Publicado: (2024)
por: Shi, Bowen, et al.
Publicado: (2024)
UnfoldIR: Rethinking Deep Unfolding Network in Illumination Degradation Image Restoration
por: He, Chunming, et al.
Publicado: (2025)
por: He, Chunming, et al.
Publicado: (2025)
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning
por: Shen, Yiqing, et al.
Publicado: (2025)
por: Shen, Yiqing, et al.
Publicado: (2025)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
por: Wang, Wenjie, et al.
Publicado: (2026)
por: Wang, Wenjie, et al.
Publicado: (2026)
IQPFR: An Image Quality Prior for Blind Face Restoration and Beyond
por: Hu, Peng, et al.
Publicado: (2025)
por: Hu, Peng, et al.
Publicado: (2025)
Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
por: Wang, Yijia, et al.
Publicado: (2025)
por: Wang, Yijia, et al.
Publicado: (2025)
Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM
por: Mao, Junyuan, et al.
Publicado: (2026)
por: Mao, Junyuan, et al.
Publicado: (2026)
Multi-Granularity Video Object Segmentation
por: Lim, Sangbeom, et al.
Publicado: (2024)
por: Lim, Sangbeom, et al.
Publicado: (2024)
Refining Context-Entangled Content Segmentation via Curriculum Selection and Anti-Curriculum Promotion
por: He, Chunming, et al.
Publicado: (2026)
por: He, Chunming, et al.
Publicado: (2026)
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding
por: Li, Zizhong, et al.
Publicado: (2026)
por: Li, Zizhong, et al.
Publicado: (2026)
Reti-Diff: Illumination Degradation Image Restoration with Retinex-based Latent Diffusion Model
por: He, Chunming, et al.
Publicado: (2023)
por: He, Chunming, et al.
Publicado: (2023)
VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledge
por: Li, Zihan, et al.
Publicado: (2024)
por: Li, Zihan, et al.
Publicado: (2024)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
por: Wu, Siwei, et al.
Publicado: (2024)
por: Wu, Siwei, et al.
Publicado: (2024)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
por: Zou, Minghao, et al.
Publicado: (2025)
por: Zou, Minghao, et al.
Publicado: (2025)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
por: Li, Xin, et al.
Publicado: (2024)
por: Li, Xin, et al.
Publicado: (2024)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
por: Zohra, Fatimah, et al.
Publicado: (2025)
por: Zohra, Fatimah, et al.
Publicado: (2025)
QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration
por: Xiao, Fengyang, et al.
Publicado: (2026)
por: Xiao, Fengyang, et al.
Publicado: (2026)
Multi-Granularity Mutual Refinement Network for Zero-Shot Learning
por: Wang, Ning, et al.
Publicado: (2025)
por: Wang, Ning, et al.
Publicado: (2025)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
por: Xu, Mingjun, et al.
Publicado: (2025)
por: Xu, Mingjun, et al.
Publicado: (2025)
Nested Unfolding Network for Real-World Concealed Object Segmentation
por: He, Chunming, et al.
Publicado: (2025)
por: He, Chunming, et al.
Publicado: (2025)
Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
por: Mahdavi, Zahra, et al.
Publicado: (2025)
por: Mahdavi, Zahra, et al.
Publicado: (2025)
Multi-Granularity Representation Learning for Sketch-based Dynamic Face Image Retrieval
por: Wang, Liang, et al.
Publicado: (2023)
por: Wang, Liang, et al.
Publicado: (2023)
Boosting Medical Image Classification with Segmentation Foundation Model
por: Gu, Pengfei, et al.
Publicado: (2024)
por: Gu, Pengfei, et al.
Publicado: (2024)
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
por: Wang, Yicheng, et al.
Publicado: (2024)
por: Wang, Yicheng, et al.
Publicado: (2024)
Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents
por: Li, Jiahua, et al.
Publicado: (2025)
por: Li, Jiahua, et al.
Publicado: (2025)
Multi-Granularity Hand Action Detection
por: Zhe, Ting, et al.
Publicado: (2023)
por: Zhe, Ting, et al.
Publicado: (2023)
Spatial-Aware Self-Supervision for Medical 3D Imaging with Multi-Granularity Observable Tasks
por: Zhang, Yiqin, et al.
Publicado: (2025)
por: Zhang, Yiqin, et al.
Publicado: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
por: Peng, Xiangyu, et al.
Publicado: (2024)
por: Peng, Xiangyu, et al.
Publicado: (2024)
Distill, Diffuse, and Semanticize (DDS): Annotation-Free 3D Scene Understanding Based on Multi-Granularity Distillation and Graph-Diffusion-Based Segmentation
por: Wang, Yijing, et al.
Publicado: (2026)
por: Wang, Yijing, et al.
Publicado: (2026)
CogVLM2: Visual Language Models for Image and Video Understanding
por: Hong, Wenyi, et al.
Publicado: (2024)
por: Hong, Wenyi, et al.
Publicado: (2024)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
por: Yang, Jing, et al.
Publicado: (2024)
por: Yang, Jing, et al.
Publicado: (2024)
Ejemplares similares
-
PRIMA: Pre-training with Risk-integrated Image-Metadata Alignment for Medical Diagnosis via LLM
por: Wang, Yiqing, et al.
Publicado: (2026) -
Spatial Coherence Loss: All Objects Matter in Salient and Camouflaged Object Detection
por: Yang, Ziyun, et al.
Publicado: (2024) -
Scale-aware Adaptive Supervised Network with Limited Medical Annotations
por: Li, Zihan, et al.
Publicado: (2026) -
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
por: Peng, Zhuoran, et al.
Publicado: (2025) -
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
por: Choi, Jiho, et al.
Publicado: (2024)