RelationVLM: Making Large Vision-Language Models Understand Visual Relations
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zhipeng, Zhang, Zhizheng, Zha, Zheng-Jun, Lu, Yan, Guo, Baining |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisualCritic: Making LMMs Perceive Visual Quality Like Humans
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
di: Zha, Junli, et al.
Pubblicazione: (2026)
di: Zha, Junli, et al.
Pubblicazione: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuan, et al.
Pubblicazione: (2024)
CogVLM2: Visual Language Models for Image and Video Understanding
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
di: Hong, Wenyi, et al.
Pubblicazione: (2024)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
di: Huang, Mingzhe, et al.
Pubblicazione: (2026)
di: Huang, Mingzhe, et al.
Pubblicazione: (2026)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
di: Shi, Liang, et al.
Pubblicazione: (2024)
di: Shi, Liang, et al.
Pubblicazione: (2024)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
Q-VLM: Post-training Quantization for Large Vision-Language Models
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
di: Wang, Changyuan, et al.
Pubblicazione: (2024)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
di: Liu, Jiajin, et al.
Pubblicazione: (2026)
di: Liu, Jiajin, et al.
Pubblicazione: (2026)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
di: Huang, Bowen, et al.
Pubblicazione: (2024)
di: Huang, Bowen, et al.
Pubblicazione: (2024)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
di: Xue, Wei, et al.
Pubblicazione: (2023)
di: Xue, Wei, et al.
Pubblicazione: (2023)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
di: Lu, Fan, et al.
Pubblicazione: (2024)
di: Lu, Fan, et al.
Pubblicazione: (2024)
TrojVLM: Backdoor Attack Against Vision Language Models
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
di: Lyu, Weimin, et al.
Pubblicazione: (2024)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
di: Tian, Xiaoyu, et al.
Pubblicazione: (2024)
Making Large Vision Language Models to be Good Few-shot Learners
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
di: She, Chaoyin, et al.
Pubblicazione: (2025)
di: She, Chaoyin, et al.
Pubblicazione: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
di: Chen, Pingyi, et al.
Pubblicazione: (2025)
di: Chen, Pingyi, et al.
Pubblicazione: (2025)
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
di: Wu, Wei, et al.
Pubblicazione: (2024)
di: Wu, Wei, et al.
Pubblicazione: (2024)
WalkVLM:Aid Visually Impaired People Walking by Vision Language Model
di: Yuan, Zhiqiang, et al.
Pubblicazione: (2024)
di: Yuan, Zhiqiang, et al.
Pubblicazione: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
CogVLM: Visual Expert for Pretrained Language Models
di: Wang, Weihan, et al.
Pubblicazione: (2023)
di: Wang, Weihan, et al.
Pubblicazione: (2023)
Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model
di: He, Peiqi, et al.
Pubblicazione: (2025)
di: He, Peiqi, et al.
Pubblicazione: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
U-VLM: Hierarchical Vision Language Modeling for Report Generation
di: Shi, Pengcheng, et al.
Pubblicazione: (2026)
di: Shi, Pengcheng, et al.
Pubblicazione: (2026)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
di: Shi, Liang, et al.
Pubblicazione: (2026)
di: Shi, Liang, et al.
Pubblicazione: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
Improving Large Vision-Language Models' Understanding for Flow Field Data
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
di: Li, Yuliang, et al.
Pubblicazione: (2026)
di: Li, Yuliang, et al.
Pubblicazione: (2026)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
EVLM: An Efficient Vision-Language Model for Visual Understanding
di: Chen, Kaibing, et al.
Pubblicazione: (2024)
di: Chen, Kaibing, et al.
Pubblicazione: (2024)
Generalized Visual Relation Detection with Diffusion Models
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
di: Gao, Kaifeng, et al.
Pubblicazione: (2025)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
di: Shao, Rui, et al.
Pubblicazione: (2025)
di: Shao, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VisualCritic: Making LMMs Perceive Visual Quality Like Humans
di: Huang, Zhipeng, et al.
Pubblicazione: (2024) -
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
di: Zha, Junli, et al.
Pubblicazione: (2026) -
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
di: Zhang, Yuan, et al.
Pubblicazione: (2024) -
CogVLM2: Visual Language Models for Image and Video Understanding
di: Hong, Wenyi, et al.
Pubblicazione: (2024) -
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
di: Huang, Mingzhe, et al.
Pubblicazione: (2026)