HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhao, Jiaxing, Yang, Qize, Peng, Yixing, Bai, Detao, Yao, Shimin, Sun, Boyuan, Chen, Xiang, Fu, Shenghao, chen, Weixuan, Wei, Xihan, Bo, Liefeng
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!