VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Hanqing, Liu, Mingyu, Chen, Xiaoyu, MA, Chengwei, Zhong, Yiming, Yin, Wenti, Liu, Yuhao, Cui, Zhiqing, Yuan, Jiahao, Dai, Lu, Ma, Zhiyuan, Xiong, Hui
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!