PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Rouhi, Amirreza, Sakurikar, Parikshit, Reddy, Satya Sai, Menga, Narsimha, Govil, Anirudh, Chittajallu, Sri Harsha, Aggarwal, Rajat, Namboodiri, Anoop, Reddi, Sashi
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!

Ejemplares similares