Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Qing, Li, Xuesong, Zhang, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
di: Qi, Yukun, et al.
Pubblicazione: (2026)
di: Qi, Yukun, et al.
Pubblicazione: (2026)
AffordanceLLM: Grounding Affordance from Vision Language Models
di: Qian, Shengyi, et al.
Pubblicazione: (2024)
di: Qian, Shengyi, et al.
Pubblicazione: (2024)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
di: Sun, Xiaowen, et al.
Pubblicazione: (2026)
di: Sun, Xiaowen, et al.
Pubblicazione: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
Informative Text-Image Alignment for Visual Affordance Learning with Foundation Models
di: Zhang, Qian, et al.
Pubblicazione: (2025)
di: Zhang, Qian, et al.
Pubblicazione: (2025)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Leveraging Semantic Cues from Foundation Vision Models for Enhanced Local Feature Correspondence
di: Cadar, Felipe, et al.
Pubblicazione: (2024)
di: Cadar, Felipe, et al.
Pubblicazione: (2024)
Structural Energy Guidance for View-Consistent Text-to-3D Generation
di: Zhang, Qing, et al.
Pubblicazione: (2026)
di: Zhang, Qing, et al.
Pubblicazione: (2026)
Improving Viewpoint Consistency in 3D Generation via Structure Feature and CLIP Guidance
di: Zhang, Qing, et al.
Pubblicazione: (2024)
di: Zhang, Qing, et al.
Pubblicazione: (2024)
Structural Energy-Guided Sampling for View-Consistent Text-to-3D
di: Zhang, Qing, et al.
Pubblicazione: (2025)
di: Zhang, Qing, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
di: Liang, Dayong, et al.
Pubblicazione: (2025)
di: Liang, Dayong, et al.
Pubblicazione: (2025)
From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
di: He, Xuming, et al.
Pubblicazione: (2025)
di: He, Xuming, et al.
Pubblicazione: (2025)
IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments
di: Zhang, Can, et al.
Pubblicazione: (2025)
di: Zhang, Can, et al.
Pubblicazione: (2025)
Bridging the Vision-Brain Gap with an Uncertainty-Aware Blur Prior
di: Wu, Haitao, et al.
Pubblicazione: (2025)
di: Wu, Haitao, et al.
Pubblicazione: (2025)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
Task-Specific Knowledge Distillation from the Vision Foundation Model for Enhanced Medical Image Segmentation
di: Liang, Pengchen, et al.
Pubblicazione: (2025)
di: Liang, Pengchen, et al.
Pubblicazione: (2025)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation
di: Xiong, Lingyu, et al.
Pubblicazione: (2026)
di: Xiong, Lingyu, et al.
Pubblicazione: (2026)
Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion
di: Li, Bohan, et al.
Pubblicazione: (2023)
di: Li, Bohan, et al.
Pubblicazione: (2023)
Multimodal Latent Reasoning via Hierarchical Visual Cues Injection
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
di: Zhang, Yiming, et al.
Pubblicazione: (2026)
Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions
di: Wang, Xuesong, et al.
Pubblicazione: (2026)
di: Wang, Xuesong, et al.
Pubblicazione: (2026)
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models
di: Danier, Duolikun, et al.
Pubblicazione: (2024)
di: Danier, Duolikun, et al.
Pubblicazione: (2024)
GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization
di: Song, Zixuan, et al.
Pubblicazione: (2025)
di: Song, Zixuan, et al.
Pubblicazione: (2025)
Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging
di: Li, Yitong, et al.
Pubblicazione: (2025)
di: Li, Yitong, et al.
Pubblicazione: (2025)
EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery
di: Xiao, Nan, et al.
Pubblicazione: (2026)
di: Xiao, Nan, et al.
Pubblicazione: (2026)
PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model
di: Liu, Shang-Ching, et al.
Pubblicazione: (2024)
di: Liu, Shang-Ching, et al.
Pubblicazione: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
General Flow as Foundation Affordance for Scalable Robot Learning
di: Yuan, Chengbo, et al.
Pubblicazione: (2024)
di: Yuan, Chengbo, et al.
Pubblicazione: (2024)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
di: Wang, Shijing, et al.
Pubblicazione: (2026)
di: Wang, Shijing, et al.
Pubblicazione: (2026)
A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
di: Zhang, Zixin, et al.
Pubblicazione: (2025)
ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
di: Feng, X., et al.
Pubblicazione: (2025)
di: Feng, X., et al.
Pubblicazione: (2025)
Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance
di: Wang, Zan, et al.
Pubblicazione: (2024)
di: Wang, Zan, et al.
Pubblicazione: (2024)
MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model
di: Tong, Jinguang, et al.
Pubblicazione: (2026)
di: Tong, Jinguang, et al.
Pubblicazione: (2026)
InteractAnything: Zero-shot Human Object Interaction Synthesis via LLM Feedback and Object Affordance Parsing
di: Zhang, Jinlu, et al.
Pubblicazione: (2025)
di: Zhang, Jinlu, et al.
Pubblicazione: (2025)
Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
di: Chen, Xuyang, et al.
Pubblicazione: (2026)
Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
di: Qi, Yukun, et al.
Pubblicazione: (2026) -
AffordanceLLM: Grounding Affordance from Vision Language Models
di: Qian, Shengyi, et al.
Pubblicazione: (2024) -
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
di: Sun, Xiaowen, et al.
Pubblicazione: (2026) -
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026) -
Informative Text-Image Alignment for Visual Affordance Learning with Foundation Models
di: Zhang, Qian, et al.
Pubblicazione: (2025)