Affordance Perception by a Knowledge-Guided Vision-Language Model with Efficient Error Correction
Fuente:
arXiv
Guardado en:
| Autores principales: | Burghouts, Gertjan, Schaaphok, Marianne, van Bekkum, Michael, Meijer, Wouter, Hillerström, Fieke, van Mil, Jelle |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Which objects help me to act effectively? Reasoning about physically-grounded affordances
por: Kemmeren, Anne, et al.
Publicado: (2024)
por: Kemmeren, Anne, et al.
Publicado: (2024)
Towards Probabilistic Inductive Logic Programming with Neurosymbolic Inference and Relaxation
por: Hillerstrom, Fieke, et al.
Publicado: (2024)
por: Hillerstrom, Fieke, et al.
Publicado: (2024)
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
por: Burghouts, Gertjan, et al.
Publicado: (2024)
por: Burghouts, Gertjan, et al.
Publicado: (2024)
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
por: Ruis, Frank, et al.
Publicado: (2025)
por: Ruis, Frank, et al.
Publicado: (2025)
Guided SAM: Label-Efficient Part Segmentation
por: van Rooij, S. B., et al.
Publicado: (2025)
por: van Rooij, S. B., et al.
Publicado: (2025)
Language-Based Augmentation to Address Shortcut Learning in Object Goal Navigation
por: Hoftijzer, Dennis, et al.
Publicado: (2024)
por: Hoftijzer, Dennis, et al.
Publicado: (2024)
Adaptive Prompt Tuning: Vision Guided Prompt Tuning with Cross-Attention for Fine-Grained Few-Shot Learning
por: Brouwer, Eric, et al.
Publicado: (2024)
por: Brouwer, Eric, et al.
Publicado: (2024)
Self-Supervised Partial Cycle-Consistency for Multi-View Matching
por: Taggenbrock, Fedor, et al.
Publicado: (2025)
por: Taggenbrock, Fedor, et al.
Publicado: (2025)
Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries
por: Mezzi, Emanuele, et al.
Publicado: (2025)
por: Mezzi, Emanuele, et al.
Publicado: (2025)
Anticipating Future Object Compositions without Forgetting
por: Zahran, Youssef, et al.
Publicado: (2024)
por: Zahran, Youssef, et al.
Publicado: (2024)
Better Language Models Exhibit Higher Visual Alignment
por: Ruthardt, Jona, et al.
Publicado: (2024)
por: Ruthardt, Jona, et al.
Publicado: (2024)
OASIC: Occlusion-Agnostic and Severity-Informed Classification
por: Gijzen, Kay, et al.
Publicado: (2026)
por: Gijzen, Kay, et al.
Publicado: (2026)
AffordanceLLM: Grounding Affordance from Vision Language Models
por: Qian, Shengyi, et al.
Publicado: (2024)
por: Qian, Shengyi, et al.
Publicado: (2024)
Incremental Learning of Affordances using Markov Logic Networks
por: Potter, George, et al.
Publicado: (2024)
por: Potter, George, et al.
Publicado: (2024)
Near, far: Patch-ordering enhances vision foundation models' scene understanding
por: Pariza, Valentinos, et al.
Publicado: (2024)
por: Pariza, Valentinos, et al.
Publicado: (2024)
Occlusion Robustness of CLIP for Military Vehicle Classification
por: van Woerden, Jan Erik, et al.
Publicado: (2025)
por: van Woerden, Jan Erik, et al.
Publicado: (2025)
Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
por: Alam, Md Tanvirul
Publicado: (2026)
por: Alam, Md Tanvirul
Publicado: (2026)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
por: Sun, Xiaowen, et al.
Publicado: (2026)
por: Sun, Xiaowen, et al.
Publicado: (2026)
Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
por: Quan, Rong, et al.
Publicado: (2026)
por: Quan, Rong, et al.
Publicado: (2026)
Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding
por: Gao, Xianqiang, et al.
Publicado: (2024)
por: Gao, Xianqiang, et al.
Publicado: (2024)
Lightweight Uncertainty Quantification with Simplex Semantic Segmentation for Terrain Traversability
por: Dijk, Judith, et al.
Publicado: (2024)
por: Dijk, Judith, et al.
Publicado: (2024)
ORacle: Large Vision-Language Models for Knowledge-Guided Holistic OR Domain Modeling
por: Özsoy, Ege, et al.
Publicado: (2024)
por: Özsoy, Ege, et al.
Publicado: (2024)
PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model
por: Liu, Shang-Ching, et al.
Publicado: (2024)
por: Liu, Shang-Ching, et al.
Publicado: (2024)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
por: AlJunaid, Reem, et al.
Publicado: (2025)
por: AlJunaid, Reem, et al.
Publicado: (2025)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
por: Yuan, Wentao, et al.
Publicado: (2024)
por: Yuan, Wentao, et al.
Publicado: (2024)
Attention Guided Alignment in Efficient Vision-Language Models
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
por: Wang, Hanqing, et al.
Publicado: (2025)
por: Wang, Hanqing, et al.
Publicado: (2025)
Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models
por: Zhang, Qing, et al.
Publicado: (2026)
por: Zhang, Qing, et al.
Publicado: (2026)
HemBLIP: A Vision-Language Model for Interpretable Leukemia Cell Morphology Analysis
por: van Logtestijn, Julie, et al.
Publicado: (2026)
por: van Logtestijn, Julie, et al.
Publicado: (2026)
$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
por: Zhu, Yijie, et al.
Publicado: (2026)
por: Zhu, Yijie, et al.
Publicado: (2026)
NaturalVLM: Leveraging Fine-grained Natural Language for Affordance-Guided Visual Manipulation
por: Xu, Ran, et al.
Publicado: (2024)
por: Xu, Ran, et al.
Publicado: (2024)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
Scaling 3D Reasoning with LMMs to Large Robot Mission Environments Using Datagraphs
por: Meijer, W. J., et al.
Publicado: (2024)
por: Meijer, W. J., et al.
Publicado: (2024)
Same or Not? Enhancing Visual Perception in Vision-Language Models
por: Marsili, Damiano, et al.
Publicado: (2025)
por: Marsili, Damiano, et al.
Publicado: (2025)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
por: Suzuki, Naru, et al.
Publicado: (2025)
por: Suzuki, Naru, et al.
Publicado: (2025)
Resource Efficient Perception for Vision Systems
por: Subramanyam, A V, et al.
Publicado: (2024)
por: Subramanyam, A V, et al.
Publicado: (2024)
On Error Propagation of Diffusion Models
por: Li, Yangming, et al.
Publicado: (2023)
por: Li, Yangming, et al.
Publicado: (2023)
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
por: Huang, Lianming, et al.
Publicado: (2025)
por: Huang, Lianming, et al.
Publicado: (2025)
Ejemplares similares
-
Which objects help me to act effectively? Reasoning about physically-grounded affordances
por: Kemmeren, Anne, et al.
Publicado: (2024) -
Towards Probabilistic Inductive Logic Programming with Neurosymbolic Inference and Relaxation
por: Hillerstrom, Fieke, et al.
Publicado: (2024) -
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
por: Burghouts, Gertjan, et al.
Publicado: (2024) -
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
por: Ruis, Frank, et al.
Publicado: (2025) -
Guided SAM: Label-Efficient Part Segmentation
por: van Rooij, S. B., et al.
Publicado: (2025)