VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Wang, Hanqing, Liu, Mingyu, Chen, Xiaoyu, MA, Chengwei, Zhong, Yiming, Yin, Wenti, Liu, Yuhao, Cui, Zhiqing, Yuan, Jiahao, Dai, Lu, Ma, Zhiyuan, Xiong, Hui
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge