V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ge, Junqi, Chen, Ziyi, Lin, Jintao, Zhu, Jinguo, Liu, Xihui, Dai, Jifeng, Zhu, Xizhou
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!