Graph Neural Networks in Vision-Language Image Understanding: A Survey
Fuente:
arXiv
Saved in:
| Main Authors: | Senior, Henry, Slabaugh, Gregory, Yuan, Shanxin, Rossi, Luca |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SuperCap: Multi-resolution Superpixel-based Image Captioning
by: Senior, Henry, et al.
Published: (2025)
by: Senior, Henry, et al.
Published: (2025)
STaR: Seamless Spatial-Temporal Aware Motion Retargeting with Penetration and Consistency Constraints
by: Yang, Xiaohang, et al.
Published: (2025)
by: Yang, Xiaohang, et al.
Published: (2025)
Adaptive Multi-Modal Control of Digital Human Hand Synthesis Using a Region-Aware Cycle Loss
by: Fu, Qifan, et al.
Published: (2024)
by: Fu, Qifan, et al.
Published: (2024)
HanDrawer: Leveraging Spatial Information to Render Realistic Hands Using a Conditional Diffusion Model in Single Stage
by: Fu, Qifan, et al.
Published: (2025)
by: Fu, Qifan, et al.
Published: (2025)
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
by: Chen, Chaoqi, et al.
Published: (2022)
by: Chen, Chaoqi, et al.
Published: (2022)
Explainable Concept Generation through Vision-Language Preference Learning for Understanding Neural Networks' Internal Representations
by: Taparia, Aditya, et al.
Published: (2024)
by: Taparia, Aditya, et al.
Published: (2024)
ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks
by: ALBarqawi, Ahmad, et al.
Published: (2025)
by: ALBarqawi, Ahmad, et al.
Published: (2025)
CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection
by: Senadeera, Damith Chamalke, et al.
Published: (2026)
by: Senadeera, Damith Chamalke, et al.
Published: (2026)
CUE-Net: Violence Detection Video Analytics with Spatial Cropping, Enhanced UniformerV2 and Modified Efficient Additive Attention
by: Senadeera, Damith Chamalke, et al.
Published: (2024)
by: Senadeera, Damith Chamalke, et al.
Published: (2024)
GIMS: Image Matching System Based on Adaptive Graph Construction and Graph Neural Network
by: Song, Xianfeng, et al.
Published: (2024)
by: Song, Xianfeng, et al.
Published: (2024)
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
by: Wang, Qing, et al.
Published: (2025)
by: Wang, Qing, et al.
Published: (2025)
Understanding Neural Network Systems for Image Analysis using Vector Spaces and Inverse Maps
by: Pattichis, Rebecca, et al.
Published: (2024)
by: Pattichis, Rebecca, et al.
Published: (2024)
Understanding Task Transfer in Vision-Language Models
by: Sachdeva, Bhuvan, et al.
Published: (2025)
by: Sachdeva, Bhuvan, et al.
Published: (2025)
Gaussian Rank-Based Neighborhood Degree for Graph Neural Networks in Image Classification
by: Duarte, Rafael Mendonça, et al.
Published: (2026)
by: Duarte, Rafael Mendonça, et al.
Published: (2026)
UnSegGNet: Unsupervised Image Segmentation using Graph Neural Networks
by: Reddy, Kovvuri Sai Gopal, et al.
Published: (2024)
by: Reddy, Kovvuri Sai Gopal, et al.
Published: (2024)
Accelerating Image Classification with Graph Convolutional Neural Networks using Voronoi Diagrams
by: Gharasuie, Mustafa Mohammadi, et al.
Published: (2025)
by: Gharasuie, Mustafa Mohammadi, et al.
Published: (2025)
HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting
by: Dong, Yilan, et al.
Published: (2025)
by: Dong, Yilan, et al.
Published: (2025)
Dynamic Scene Understanding from Vision-Language Representations
by: Pruss, Shahaf, et al.
Published: (2025)
by: Pruss, Shahaf, et al.
Published: (2025)
Joint Dense-Point Representation for Contour-Aware Graph Segmentation
by: Bransby, Kit Mills, et al.
Published: (2023)
by: Bransby, Kit Mills, et al.
Published: (2023)
MOB-GCN: A Novel Multiscale Object-Based Graph Neural Network for Hyperspectral Image Classification
by: Yang, Tuan-Anh, et al.
Published: (2025)
by: Yang, Tuan-Anh, et al.
Published: (2025)
Development of Skip Connection in Deep Neural Networks for Computer Vision and Medical Image Analysis: A Survey
by: Xu, Guoping, et al.
Published: (2024)
by: Xu, Guoping, et al.
Published: (2024)
Fast Graph Neural Network for Image Classification
by: Gharasuie, Mustafa Mohammadi, et al.
Published: (2025)
by: Gharasuie, Mustafa Mohammadi, et al.
Published: (2025)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
by: Liu, Jiajin, et al.
Published: (2026)
by: Liu, Jiajin, et al.
Published: (2026)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
by: Kim, Tae Hun, et al.
Published: (2026)
by: Kim, Tae Hun, et al.
Published: (2026)
TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
A Survey on Hallucination in Large Vision-Language Models
by: Liu, Hanchao, et al.
Published: (2024)
by: Liu, Hanchao, et al.
Published: (2024)
GraphMamba: An Efficient Graph Structure Learning Vision Mamba for Hyperspectral Image Classification
by: Yang, Aitao, et al.
Published: (2024)
by: Yang, Aitao, et al.
Published: (2024)
Fully Hyperbolic Convolutional Neural Networks for Computer Vision
by: Bdeir, Ahmad, et al.
Published: (2023)
by: Bdeir, Ahmad, et al.
Published: (2023)
Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis
by: Cheng, Anzhe, et al.
Published: (2025)
by: Cheng, Anzhe, et al.
Published: (2025)
Graph Neural Networks for Surgical Scene Segmentation
by: Li, Yihan, et al.
Published: (2025)
by: Li, Yihan, et al.
Published: (2025)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
by: Wang, Sudong, et al.
Published: (2025)
by: Wang, Sudong, et al.
Published: (2025)
SeafloorAI: A Large-scale Vision-Language Dataset for Seafloor Geological Survey
by: Nguyen, Kien X., et al.
Published: (2024)
by: Nguyen, Kien X., et al.
Published: (2024)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
by: Zhang, Weidong, et al.
Published: (2025)
by: Zhang, Weidong, et al.
Published: (2025)
Recurrent Neural Networks for Still Images
by: Dmitri, et al.
Published: (2024)
by: Dmitri, et al.
Published: (2024)
A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and Recommendations
by: Cheng, Hongrong, et al.
Published: (2023)
by: Cheng, Hongrong, et al.
Published: (2023)
Cross-Organ Domain Adaptive Neural Network for Pancreatic Endoscopic Ultrasound Image Segmentation
by: Yan, ZhiChao, et al.
Published: (2024)
by: Yan, ZhiChao, et al.
Published: (2024)
Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models
by: Wang, Jeffrey, et al.
Published: (2026)
by: Wang, Jeffrey, et al.
Published: (2026)
Explaining Vision GNNs: A Semantic and Visual Analysis of Graph-based Image Classification
by: Chaidos, Nikolaos, et al.
Published: (2025)
by: Chaidos, Nikolaos, et al.
Published: (2025)
Similar Items
-
SuperCap: Multi-resolution Superpixel-based Image Captioning
by: Senior, Henry, et al.
Published: (2025) -
STaR: Seamless Spatial-Temporal Aware Motion Retargeting with Penetration and Consistency Constraints
by: Yang, Xiaohang, et al.
Published: (2025) -
Adaptive Multi-Modal Control of Digital Human Hand Synthesis Using a Region-Aware Cycle Loss
by: Fu, Qifan, et al.
Published: (2024) -
HanDrawer: Leveraging Spatial Information to Render Realistic Hands Using a Conditional Diffusion Model in Single Stage
by: Fu, Qifan, et al.
Published: (2025) -
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
by: Chen, Chaoqi, et al.
Published: (2022)