LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Li, Hongyu, Chen, Jinyu, Wei, Ziyu, Huang, Shaofei, Hui, Tianrui, Gao, Jialin, Wei, Xiaoming, Liu, Si
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!