NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Cai, Zhixi, Ke, Fucai, Jahangard, Simindokht, de la Banda, Maria Garcia, Haffari, Reza, Stuckey, Peter J., Rezatofighi, Hamid
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866916897189003264
author Cai, Zhixi
Ke, Fucai
Jahangard, Simindokht
de la Banda, Maria Garcia
Haffari, Reza
Stuckey, Peter J.
Rezatofighi, Hamid
author_facet Cai, Zhixi
Ke, Fucai
Jahangard, Simindokht
de la Banda, Maria Garcia
Haffari, Reza
Stuckey, Peter J.
Rezatofighi, Hamid
contents Visual Grounding (VG) tasks, such as referring expression detection and segmentation tasks are important for linking visual entities to context, especially in complex reasoning tasks that require detailed query interpretation. This paper explores VG beyond basic perception, highlighting challenges for methods that require reasoning like human cognition. Recent advances in large language methods (LLMs) and Vision-Language methods (VLMs) have improved abilities for visual comprehension, contextual understanding, and reasoning. These methods are mainly split into end-to-end and compositional methods, with the latter offering more flexibility. Compositional approaches that integrate LLMs and foundation models show promising performance but still struggle with complex reasoning with language-based logical representations. To address these limitations, we propose NAVER, a compositional visual grounding method that integrates explicit probabilistic logic reasoning within a finite-state automaton, equipped with a self-correcting mechanism. This design improves robustness and interpretability in inference through explicit logic reasoning. Our results show that NAVER achieves SoTA performance comparing to recent end-to-end and compositional baselines. The code is available at https://github.com/ControlNet/NAVER .
format Preprint
id arxiv_https___arxiv_org_abs_2502_00372
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning
Cai, Zhixi
Ke, Fucai
Jahangard, Simindokht
de la Banda, Maria Garcia
Haffari, Reza
Stuckey, Peter J.
Rezatofighi, Hamid
Computer Vision and Pattern Recognition
Visual Grounding (VG) tasks, such as referring expression detection and segmentation tasks are important for linking visual entities to context, especially in complex reasoning tasks that require detailed query interpretation. This paper explores VG beyond basic perception, highlighting challenges for methods that require reasoning like human cognition. Recent advances in large language methods (LLMs) and Vision-Language methods (VLMs) have improved abilities for visual comprehension, contextual understanding, and reasoning. These methods are mainly split into end-to-end and compositional methods, with the latter offering more flexibility. Compositional approaches that integrate LLMs and foundation models show promising performance but still struggle with complex reasoning with language-based logical representations. To address these limitations, we propose NAVER, a compositional visual grounding method that integrates explicit probabilistic logic reasoning within a finite-state automaton, equipped with a self-correcting mechanism. This design improves robustness and interpretability in inference through explicit logic reasoning. Our results show that NAVER achieves SoTA performance comparing to recent end-to-end and compositional baselines. The code is available at https://github.com/ControlNet/NAVER .
title NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2502.00372