Structural Graph Probing of Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Haoyu, Zhuo, Yue, Zheng, Yu, Wang, Qi R. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
par: Wang, Haoyu, et autres
Publié: (2026)
par: Wang, Haoyu, et autres
Publié: (2026)
Probing and Inducing Combinational Creativity in Vision-Language Models
par: Peng, Yongqian, et autres
Publié: (2025)
par: Peng, Yongqian, et autres
Publié: (2025)
Probing Perceptual Constancy in Large Vision-Language Models
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models
par: Han, Tiancheng, et autres
Publié: (2025)
par: Han, Tiancheng, et autres
Publié: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models
par: Li, Rongjie, et autres
Publié: (2024)
par: Li, Rongjie, et autres
Publié: (2024)
TraversalBench: Challenging Paths to Follow for Vision Language Models
par: Petrova, Clara, et autres
Publié: (2026)
par: Petrova, Clara, et autres
Publié: (2026)
Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities
par: Xia, Shiyu, et autres
Publié: (2024)
par: Xia, Shiyu, et autres
Publié: (2024)
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
par: Min, Cheolhong, et autres
Publié: (2026)
par: Min, Cheolhong, et autres
Publié: (2026)
HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding
par: Xia, Peng, et autres
Publié: (2023)
par: Xia, Peng, et autres
Publié: (2023)
Conceptual Codebook Learning for Vision-Language Models
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Joint Vision-Language Social Bias Removal for CLIP
par: Zhang, Haoyu, et autres
Publié: (2024)
par: Zhang, Haoyu, et autres
Publié: (2024)
Integrated Structural Prompt Learning for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
par: Vedernikov, Alexander, et autres
Publié: (2025)
par: Vedernikov, Alexander, et autres
Publié: (2025)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
par: He, Jiawei, et autres
Publié: (2025)
par: He, Jiawei, et autres
Publié: (2025)
RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
par: He, Xuming, et autres
Publié: (2025)
par: He, Xuming, et autres
Publié: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
par: Guan, Jiwei, et autres
Publié: (2024)
par: Guan, Jiwei, et autres
Publié: (2024)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
Language-Guided Invariance Probing of Vision-Language Models
par: Lee, Jae Joong
Publié: (2025)
par: Lee, Jae Joong
Publié: (2025)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck
par: Zhang, Feiran, et autres
Publié: (2026)
par: Zhang, Feiran, et autres
Publié: (2026)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
par: Zheng, Qi, et autres
Publié: (2023)
par: Zheng, Qi, et autres
Publié: (2023)
Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure
par: Li, Zitong, et autres
Publié: (2026)
par: Li, Zitong, et autres
Publié: (2026)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
par: Wang, Chenfeng, et autres
Publié: (2026)
par: Wang, Chenfeng, et autres
Publié: (2026)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
par: Lymperaiou, Maria, et autres
Publié: (2026)
par: Lymperaiou, Maria, et autres
Publié: (2026)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
par: Huang, Zhuo, et autres
Publié: (2023)
par: Huang, Zhuo, et autres
Publié: (2023)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
par: Lu, Fan, et autres
Publié: (2024)
par: Lu, Fan, et autres
Publié: (2024)
Enhancing Vision-Language Model with Unmasked Token Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Predicate Debiasing in Vision-Language Models Integration for Scene Graph Generation Enhancement
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
par: Zhao, Zongchuang, et autres
Publié: (2025)
par: Zhao, Zongchuang, et autres
Publié: (2025)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
par: Zhan, Guanqi, et autres
Publié: (2023)
par: Zhan, Guanqi, et autres
Publié: (2023)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
par: Qiao, Yanyuan, et autres
Publié: (2025)
par: Qiao, Yanyuan, et autres
Publié: (2025)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models
par: Reilly, Dominick, et autres
Publié: (2025)
par: Reilly, Dominick, et autres
Publié: (2025)
Documents similaires
-
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
par: Wang, Haoyu, et autres
Publié: (2026) -
Probing and Inducing Combinational Creativity in Vision-Language Models
par: Peng, Yongqian, et autres
Publié: (2025) -
Probing Perceptual Constancy in Large Vision-Language Models
par: Sun, Haoran, et autres
Publié: (2025) -
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025) -
From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models
par: Han, Tiancheng, et autres
Publié: (2025)