VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zhang, Tianyu, Wang, Suyuchen, Li, Lu, Zhang, Ge, Taslakian, Perouz, Rajeswar, Sai, Fu, Jie, Liu, Bang, Bengio, Yoshua
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!