GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Fan, Rong, Xiao, Kaiyan, Zhu, Minghao, Wang, Liuyi, Dai, Kai, Yang, Zhao
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!