VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Shahgir, Haz Sameen, Chen, Xiaofu, Fu, Yu, Shayegani, Erfan, Abu-Ghazaleh, Nael, Kementchedjhieva, Yova, Dong, Yue
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!