The Underappreciated Power of Vision Models for Graph Structural Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Xinjian, Pang, Wei, Xue, Zhongkai, Jian, Xiangru, Zhang, Lei, Xu, Yaoyao, Song, Xiaozhuang, Wu, Shu, Yu, Tianshu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Graph Self-Supervised Learning with Graph Interplay
by: Zhao, Xinjian, et al.
Published: (2024)
by: Zhao, Xinjian, et al.
Published: (2024)
Boosting Protein Language Models with Negative Sample Mining
by: Xu, Yaoyao, et al.
Published: (2024)
by: Xu, Yaoyao, et al.
Published: (2024)
Rethinking Spectral Augmentation for Contrast-based Graph Self-Supervised Learning
by: Jian, Xiangru, et al.
Published: (2024)
by: Jian, Xiangru, et al.
Published: (2024)
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
by: Jian, Xiangru, et al.
Published: (2026)
by: Jian, Xiangru, et al.
Published: (2026)
Lost in UNet: Improving Infrared Small Target Detection by Underappreciated Local Features
by: Quan, Wuzhou, et al.
Published: (2024)
by: Quan, Wuzhou, et al.
Published: (2024)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
by: Wu, Xinjian, et al.
Published: (2023)
by: Wu, Xinjian, et al.
Published: (2023)
DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models
by: Wang, Yimu, et al.
Published: (2024)
by: Wang, Yimu, et al.
Published: (2024)
Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
by: Yang, Zhongyu, et al.
Published: (2025)
by: Yang, Zhongyu, et al.
Published: (2025)
Robust face recognition based on the wing loss and the $\ell_1$ regularization
by: Yun, Yaoyao, et al.
Published: (2025)
by: Yun, Yaoyao, et al.
Published: (2025)
Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization
by: Shen, Yang, et al.
Published: (2024)
by: Shen, Yang, et al.
Published: (2024)
AOT*: Efficient Synthesis Planning via LLM-Empowered AND-OR Tree Search
by: Song, Xiaozhuang, et al.
Published: (2025)
by: Song, Xiaozhuang, et al.
Published: (2025)
MCA-Bench: A Multimodal Benchmark for Evaluating CAPTCHA Robustness Against VLM-based Attacks
by: Wu, Zonglin, et al.
Published: (2025)
by: Wu, Zonglin, et al.
Published: (2025)
Structural Graph Probing of Vision-Language Models
by: He, Haoyu, et al.
Published: (2026)
by: He, Haoyu, et al.
Published: (2026)
PVG: Progressive Vision Graph for Vision Recognition
by: Wu, Jiafu, et al.
Published: (2023)
by: Wu, Jiafu, et al.
Published: (2023)
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
by: Pang, Wei, et al.
Published: (2025)
by: Pang, Wei, et al.
Published: (2025)
LazyVLM: Neuro-Symbolic Approach to Video Analytics
by: Jian, Xiangru, et al.
Published: (2025)
by: Jian, Xiangru, et al.
Published: (2025)
HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding
by: Xia, Peng, et al.
Published: (2023)
by: Xia, Peng, et al.
Published: (2023)
NEARL-CLIP: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding
by: Peng, Zelin, et al.
Published: (2025)
by: Peng, Zelin, et al.
Published: (2025)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
by: Weng, Xingxing, et al.
Published: (2026)
by: Weng, Xingxing, et al.
Published: (2026)
3D Skew-Normal Splatting
by: Wu, Xiangru, et al.
Published: (2026)
by: Wu, Xiangru, et al.
Published: (2026)
LPViT: Low-Power Semi-structured Pruning for Vision Transformers
by: Xu, Kaixin, et al.
Published: (2024)
by: Xu, Kaixin, et al.
Published: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
by: Xue, Wei, et al.
Published: (2023)
by: Xue, Wei, et al.
Published: (2023)
CVVNet: A Cross-Vertical-View Network for Gait Recognition
by: Li, Xiangru, et al.
Published: (2025)
by: Li, Xiangru, et al.
Published: (2025)
DreamPainter: Image Background Inpainting for E-commerce Scenarios
by: Zhao, Sijie, et al.
Published: (2025)
by: Zhao, Sijie, et al.
Published: (2025)
MR. Video: "MapReduce" is the Principle for Long Video Understanding
by: Pang, Ziqi, et al.
Published: (2025)
by: Pang, Ziqi, et al.
Published: (2025)
RaFE: Generative Radiance Fields Restoration
by: Wu, Zhongkai, et al.
Published: (2024)
by: Wu, Zhongkai, et al.
Published: (2024)
Semantically Grounded QFormer for Efficient Vision Language Understanding
by: Choraria, Moulik, et al.
Published: (2023)
by: Choraria, Moulik, et al.
Published: (2023)
Unveiling Context-Related Anomalies: Knowledge Graph Empowered Decoupling of Scene and Action for Human-Related Video Anomaly Detection
by: Chen, Chenglizhao, et al.
Published: (2024)
by: Chen, Chenglizhao, et al.
Published: (2024)
Improving Large Vision-Language Models' Understanding for Flow Field Data
by: Zhang, Xiaomei, et al.
Published: (2025)
by: Zhang, Xiaomei, et al.
Published: (2025)
Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives
by: Weng, Xingxing, et al.
Published: (2025)
by: Weng, Xingxing, et al.
Published: (2025)
Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound
by: Zhang, Dengming, et al.
Published: (2025)
by: Zhang, Dengming, et al.
Published: (2025)
ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding
by: Zhang, Bohan, et al.
Published: (2025)
by: Zhang, Bohan, et al.
Published: (2025)
TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models
by: Zhang, Zhifang, et al.
Published: (2025)
by: Zhang, Zhifang, et al.
Published: (2025)
Pool-Select-Refine: Allocation-Aware Generative Dataset Distillation with Soft-Label-Guided Latent Refinement
by: Li, Wenmin, et al.
Published: (2026)
by: Li, Wenmin, et al.
Published: (2026)
Towards Imbalanced Motion: Part-Decoupling Network for Video Portrait Segmentation
by: Yu, Tianshu, et al.
Published: (2023)
by: Yu, Tianshu, et al.
Published: (2023)
USV: Unified Sparsification for Accelerating Video Diffusion Models
by: Wu, Xinjian, et al.
Published: (2025)
by: Wu, Xinjian, et al.
Published: (2025)
How to Utilize Complementary Vision-Text Information for 2D Structure Understanding
by: Dong, Jiancheng, et al.
Published: (2026)
by: Dong, Jiancheng, et al.
Published: (2026)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
by: Shu, Yan, et al.
Published: (2024)
by: Shu, Yan, et al.
Published: (2024)
VisionKG: Unleashing the Power of Visual Datasets via Knowledge Graph
by: Yuan, Jicheng, et al.
Published: (2023)
by: Yuan, Jicheng, et al.
Published: (2023)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
by: Sun, Shitong, et al.
Published: (2026)
by: Sun, Shitong, et al.
Published: (2026)
Similar Items
-
Enhancing Graph Self-Supervised Learning with Graph Interplay
by: Zhao, Xinjian, et al.
Published: (2024) -
Boosting Protein Language Models with Negative Sample Mining
by: Xu, Yaoyao, et al.
Published: (2024) -
Rethinking Spectral Augmentation for Contrast-based Graph Self-Supervised Learning
by: Jian, Xiangru, et al.
Published: (2024) -
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
by: Jian, Xiangru, et al.
Published: (2026) -
Lost in UNet: Improving Infrared Small Target Detection by Underappreciated Local Features
by: Quan, Wuzhou, et al.
Published: (2024)