Affordance Perception by a Knowledge-Guided Vision-Language Model with Efficient Error Correction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Burghouts, Gertjan, Schaaphok, Marianne, van Bekkum, Michael, Meijer, Wouter, Hillerström, Fieke, van Mil, Jelle |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Which objects help me to act effectively? Reasoning about physically-grounded affordances
par: Kemmeren, Anne, et autres
Publié: (2024)
par: Kemmeren, Anne, et autres
Publié: (2024)
Towards Probabilistic Inductive Logic Programming with Neurosymbolic Inference and Relaxation
par: Hillerstrom, Fieke, et autres
Publié: (2024)
par: Hillerstrom, Fieke, et autres
Publié: (2024)
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
par: Burghouts, Gertjan, et autres
Publié: (2024)
par: Burghouts, Gertjan, et autres
Publié: (2024)
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
par: Ruis, Frank, et autres
Publié: (2025)
par: Ruis, Frank, et autres
Publié: (2025)
Guided SAM: Label-Efficient Part Segmentation
par: van Rooij, S. B., et autres
Publié: (2025)
par: van Rooij, S. B., et autres
Publié: (2025)
Language-Based Augmentation to Address Shortcut Learning in Object Goal Navigation
par: Hoftijzer, Dennis, et autres
Publié: (2024)
par: Hoftijzer, Dennis, et autres
Publié: (2024)
Adaptive Prompt Tuning: Vision Guided Prompt Tuning with Cross-Attention for Fine-Grained Few-Shot Learning
par: Brouwer, Eric, et autres
Publié: (2024)
par: Brouwer, Eric, et autres
Publié: (2024)
Self-Supervised Partial Cycle-Consistency for Multi-View Matching
par: Taggenbrock, Fedor, et autres
Publié: (2025)
par: Taggenbrock, Fedor, et autres
Publié: (2025)
Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries
par: Mezzi, Emanuele, et autres
Publié: (2025)
par: Mezzi, Emanuele, et autres
Publié: (2025)
Anticipating Future Object Compositions without Forgetting
par: Zahran, Youssef, et autres
Publié: (2024)
par: Zahran, Youssef, et autres
Publié: (2024)
Better Language Models Exhibit Higher Visual Alignment
par: Ruthardt, Jona, et autres
Publié: (2024)
par: Ruthardt, Jona, et autres
Publié: (2024)
OASIC: Occlusion-Agnostic and Severity-Informed Classification
par: Gijzen, Kay, et autres
Publié: (2026)
par: Gijzen, Kay, et autres
Publié: (2026)
AffordanceLLM: Grounding Affordance from Vision Language Models
par: Qian, Shengyi, et autres
Publié: (2024)
par: Qian, Shengyi, et autres
Publié: (2024)
Incremental Learning of Affordances using Markov Logic Networks
par: Potter, George, et autres
Publié: (2024)
par: Potter, George, et autres
Publié: (2024)
Near, far: Patch-ordering enhances vision foundation models' scene understanding
par: Pariza, Valentinos, et autres
Publié: (2024)
par: Pariza, Valentinos, et autres
Publié: (2024)
Occlusion Robustness of CLIP for Military Vehicle Classification
par: van Woerden, Jan Erik, et autres
Publié: (2025)
par: van Woerden, Jan Erik, et autres
Publié: (2025)
Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
par: Alam, Md Tanvirul
Publié: (2026)
par: Alam, Md Tanvirul
Publié: (2026)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
par: Sun, Xiaowen, et autres
Publié: (2026)
par: Sun, Xiaowen, et autres
Publié: (2026)
Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
par: Quan, Rong, et autres
Publié: (2026)
par: Quan, Rong, et autres
Publié: (2026)
Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding
par: Gao, Xianqiang, et autres
Publié: (2024)
par: Gao, Xianqiang, et autres
Publié: (2024)
Lightweight Uncertainty Quantification with Simplex Semantic Segmentation for Terrain Traversability
par: Dijk, Judith, et autres
Publié: (2024)
par: Dijk, Judith, et autres
Publié: (2024)
ORacle: Large Vision-Language Models for Knowledge-Guided Holistic OR Domain Modeling
par: Özsoy, Ege, et autres
Publié: (2024)
par: Özsoy, Ege, et autres
Publié: (2024)
PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model
par: Liu, Shang-Ching, et autres
Publié: (2024)
par: Liu, Shang-Ching, et autres
Publié: (2024)
Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model
par: AlJunaid, Reem, et autres
Publié: (2025)
par: AlJunaid, Reem, et autres
Publié: (2025)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
par: Yuan, Wentao, et autres
Publié: (2024)
par: Yuan, Wentao, et autres
Publié: (2024)
Attention Guided Alignment in Efficient Vision-Language Models
par: Mahajan, Shweta, et autres
Publié: (2025)
par: Mahajan, Shweta, et autres
Publié: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models
par: Zhang, Qing, et autres
Publié: (2026)
par: Zhang, Qing, et autres
Publié: (2026)
HemBLIP: A Vision-Language Model for Interpretable Leukemia Cell Morphology Analysis
par: van Logtestijn, Julie, et autres
Publié: (2026)
par: van Logtestijn, Julie, et autres
Publié: (2026)
$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
par: Zhu, Yijie, et autres
Publié: (2026)
par: Zhu, Yijie, et autres
Publié: (2026)
NaturalVLM: Leveraging Fine-grained Natural Language for Affordance-Guided Visual Manipulation
par: Xu, Ran, et autres
Publié: (2024)
par: Xu, Ran, et autres
Publié: (2024)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
Scaling 3D Reasoning with LMMs to Large Robot Mission Environments Using Datagraphs
par: Meijer, W. J., et autres
Publié: (2024)
par: Meijer, W. J., et autres
Publié: (2024)
Same or Not? Enhancing Visual Perception in Vision-Language Models
par: Marsili, Damiano, et autres
Publié: (2025)
par: Marsili, Damiano, et autres
Publié: (2025)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
par: Suzuki, Naru, et autres
Publié: (2025)
par: Suzuki, Naru, et autres
Publié: (2025)
Resource Efficient Perception for Vision Systems
par: Subramanyam, A V, et autres
Publié: (2024)
par: Subramanyam, A V, et autres
Publié: (2024)
On Error Propagation of Diffusion Models
par: Li, Yangming, et autres
Publié: (2023)
par: Li, Yangming, et autres
Publié: (2023)
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
par: Huang, Lianming, et autres
Publié: (2025)
par: Huang, Lianming, et autres
Publié: (2025)
Documents similaires
-
Which objects help me to act effectively? Reasoning about physically-grounded affordances
par: Kemmeren, Anne, et autres
Publié: (2024) -
Towards Probabilistic Inductive Logic Programming with Neurosymbolic Inference and Relaxation
par: Hillerstrom, Fieke, et autres
Publié: (2024) -
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
par: Burghouts, Gertjan, et autres
Publié: (2024) -
Textual Inversion for Efficient Adaptation of Open-Vocabulary Object Detectors Without Forgetting
par: Ruis, Frank, et autres
Publié: (2025) -
Guided SAM: Label-Efficient Part Segmentation
par: van Rooij, S. B., et autres
Publié: (2025)