HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Peng, Yu, Xingtong, Hu, Ming, Ju, Lie, Wang, Zhiyong, Duan, Peibo, Ge, Zongyuan |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
by: Xia, Peng, et al.
Published: (2024)
by: Xia, Peng, et al.
Published: (2024)
LMPT: Prompt Tuning with Class-Specific Embedding Loss for Long-tailed Multi-Label Visual Recognition
by: Xia, Peng, et al.
Published: (2023)
by: Xia, Peng, et al.
Published: (2023)
MONICA: Benchmarking on Long-tailed Medical Image Classification
by: Ju, Lie, et al.
Published: (2024)
by: Ju, Lie, et al.
Published: (2024)
TP-DRSeg: Improving Diabetic Retinopathy Lesion Segmentation with Explicit Text-Prompts Assisted SAM
by: Li, Wenxue, et al.
Published: (2024)
by: Li, Wenxue, et al.
Published: (2024)
Diffusion Model Driven Test-Time Image Adaptation for Robust Skin Lesion Classification
by: Hu, Ming, et al.
Published: (2024)
by: Hu, Ming, et al.
Published: (2024)
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
by: Ju, Lie, et al.
Published: (2025)
by: Ju, Lie, et al.
Published: (2025)
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
by: Yan, Siyuan, et al.
Published: (2025)
by: Yan, Siyuan, et al.
Published: (2025)
Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
by: Yan, Siyuan, et al.
Published: (2024)
by: Yan, Siyuan, et al.
Published: (2024)
DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making
by: Liu, Yize, et al.
Published: (2026)
by: Liu, Yize, et al.
Published: (2026)
Universal Semi-Supervised Learning for Medical Image Classification
by: Ju, Lie, et al.
Published: (2023)
by: Ju, Lie, et al.
Published: (2023)
Benchmarking Real-World Medical Image Classification with Noisy Labels: Challenges, Practice, and Outlook
by: Ma, Yuan, et al.
Published: (2025)
by: Ma, Yuan, et al.
Published: (2025)
Flexible Sampling for Long-tailed Skin Lesion Classification
by: Ju, Lie, et al.
Published: (2022)
by: Ju, Lie, et al.
Published: (2022)
Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology
by: Yan, Siyuan, et al.
Published: (2025)
by: Yan, Siyuan, et al.
Published: (2025)
Diversified and Personalized Multi-rater Medical Image Segmentation
by: Wu, Yicheng, et al.
Published: (2024)
by: Wu, Yicheng, et al.
Published: (2024)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
by: Wang, Weizhen, et al.
Published: (2025)
by: Wang, Weizhen, et al.
Published: (2025)
Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
by: Feng, Wei, et al.
Published: (2025)
by: Feng, Wei, et al.
Published: (2025)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
by: Kang, Hyolim, et al.
Published: (2025)
by: Kang, Hyolim, et al.
Published: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
by: Liang, Huizhi, et al.
Published: (2026)
by: Liang, Huizhi, et al.
Published: (2026)
Multi-Token Enhancing for Vision Representation Learning
by: Li, Zhong-Yu, et al.
Published: (2024)
by: Li, Zhong-Yu, et al.
Published: (2024)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
by: Yue, Junrong, et al.
Published: (2025)
by: Yue, Junrong, et al.
Published: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
by: Xu, Ming, et al.
Published: (2024)
by: Xu, Ming, et al.
Published: (2024)
Delving into Spectral Clustering with Vision-Language Representations
by: Peng, Bo, et al.
Published: (2026)
by: Peng, Bo, et al.
Published: (2026)
OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow Understanding
by: Hu, Ming, et al.
Published: (2024)
by: Hu, Ming, et al.
Published: (2024)
A General Model for Retinal Segmentation and Quantification
by: Wang, Zhonghua, et al.
Published: (2026)
by: Wang, Zhonghua, et al.
Published: (2026)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
by: Zhang, Peng-Fei, et al.
Published: (2026)
by: Zhang, Peng-Fei, et al.
Published: (2026)
EVLM: An Efficient Vision-Language Model for Visual Understanding
by: Chen, Kaibing, et al.
Published: (2024)
by: Chen, Kaibing, et al.
Published: (2024)
GaussianImage++: Boosted Image Representation and Compression with 2D Gaussian Splatting
by: Li, Tiantian, et al.
Published: (2025)
by: Li, Tiantian, et al.
Published: (2025)
Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities
by: Xia, Shiyu, et al.
Published: (2024)
by: Xia, Shiyu, et al.
Published: (2024)
Versatile Recompression-Aware Perceptual Image Super-Resolution
by: He, Mingwei, et al.
Published: (2025)
by: He, Mingwei, et al.
Published: (2025)
SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation
by: Yue, Wenxi, et al.
Published: (2023)
by: Yue, Wenxi, et al.
Published: (2023)
Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models
by: Xia, Yuexuan, et al.
Published: (2025)
by: Xia, Yuexuan, et al.
Published: (2025)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
by: Zhang, Xuesong, et al.
Published: (2024)
by: Zhang, Xuesong, et al.
Published: (2024)
Event-Priori-Based Vision-Language Model for Efficient Visual Understanding
by: Qin, Haotong, et al.
Published: (2025)
by: Qin, Haotong, et al.
Published: (2025)
OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
by: Hu, Ming, et al.
Published: (2024)
by: Hu, Ming, et al.
Published: (2024)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
by: Kelly, Chris, et al.
Published: (2024)
by: Kelly, Chris, et al.
Published: (2024)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
by: Luo, Yulin, et al.
Published: (2026)
by: Luo, Yulin, et al.
Published: (2026)
Structural Graph Probing of Vision-Language Models
by: He, Haoyu, et al.
Published: (2026)
by: He, Haoyu, et al.
Published: (2026)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
by: Lee, Jonathan, et al.
Published: (2025)
by: Lee, Jonathan, et al.
Published: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
by: Zhou, Shengchao, et al.
Published: (2025)
by: Zhou, Shengchao, et al.
Published: (2025)
Similar Items
-
Generalizing to Unseen Domains in Diabetic Retinopathy with Disentangled Representations
by: Xia, Peng, et al.
Published: (2024) -
LMPT: Prompt Tuning with Class-Specific Embedding Loss for Long-tailed Multi-Label Visual Recognition
by: Xia, Peng, et al.
Published: (2023) -
MONICA: Benchmarking on Long-tailed Medical Image Classification
by: Ju, Lie, et al.
Published: (2024) -
TP-DRSeg: Improving Diabetic Retinopathy Lesion Segmentation with Explicit Text-Prompts Assisted SAM
by: Li, Wenxue, et al.
Published: (2024) -
Diffusion Model Driven Test-Time Image Adaptation for Robust Skin Lesion Classification
by: Hu, Ming, et al.
Published: (2024)