Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Yuchen, Gong, Junli, Cai, Hongmin, Cheung, Yiu-ming, Su, Weifeng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
by: Guo, Yuchen, et al.
Published: (2024)
by: Guo, Yuchen, et al.
Published: (2024)
LumiVideo: An Intelligent Agentic System for Video Color Grading
by: Guo, Yuchen, et al.
Published: (2026)
by: Guo, Yuchen, et al.
Published: (2026)
PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
by: Guo, Yuchen, et al.
Published: (2026)
by: Guo, Yuchen, et al.
Published: (2026)
Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models
by: Guo, Yuchen, et al.
Published: (2026)
by: Guo, Yuchen, et al.
Published: (2026)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
by: Guo, Yuchen, et al.
Published: (2026)
by: Guo, Yuchen, et al.
Published: (2026)
Semantic-guided Fine-tuning of Foundation Model for Long-tailed Visual Recognition
by: Peng, Yufei, et al.
Published: (2025)
by: Peng, Yufei, et al.
Published: (2025)
TYrPPG: Uncomplicated and Enhanced Learning Capability rPPG for Remote Heart Rate Estimation
by: Chen, Taixi, et al.
Published: (2025)
by: Chen, Taixi, et al.
Published: (2025)
Adapt PointFormer: 3D Point Cloud Analysis via Adapting 2D Visual Transformers
by: Li, Mengke, et al.
Published: (2024)
by: Li, Mengke, et al.
Published: (2024)
Long-Tailed Visual Recognition via Permutation-Invariant Head-to-Tail Feature Fusion
by: Li, Mengke, et al.
Published: (2025)
by: Li, Mengke, et al.
Published: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
by: Chen, Xinyan, et al.
Published: (2025)
by: Chen, Xinyan, et al.
Published: (2025)
Improving Visual Prompt Tuning by Gaussian Neighborhood Minimization for Long-Tailed Visual Recognition
by: Li, Mengke, et al.
Published: (2024)
by: Li, Mengke, et al.
Published: (2024)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
by: Lu, Yi, et al.
Published: (2025)
by: Lu, Yi, et al.
Published: (2025)
Feature Fusion from Head to Tail for Long-Tailed Visual Recognition
by: Li, Mengke, et al.
Published: (2023)
by: Li, Mengke, et al.
Published: (2023)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
by: Lim, Byeonggeuk, et al.
Published: (2026)
by: Lim, Byeonggeuk, et al.
Published: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
by: Zhao, Kesen, et al.
Published: (2025)
by: Zhao, Kesen, et al.
Published: (2025)
Adjusting Logit in Gaussian Form for Long-Tailed Visual Recognition
by: Li, Mengke, et al.
Published: (2023)
by: Li, Mengke, et al.
Published: (2023)
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models
by: Zeng, Qingyuan, et al.
Published: (2024)
by: Zeng, Qingyuan, et al.
Published: (2024)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
by: Huo, Yu, et al.
Published: (2026)
by: Huo, Yu, et al.
Published: (2026)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
by: Guo, Guangfu, et al.
Published: (2026)
by: Guo, Guangfu, et al.
Published: (2026)
Adaptive Point-Prompt Tuning: Fine-Tuning Heterogeneous Foundation Models for 3D Point Cloud Analysis
by: Li, Mengke, et al.
Published: (2025)
by: Li, Mengke, et al.
Published: (2025)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
by: Zhong, Zhide, et al.
Published: (2026)
by: Zhong, Zhide, et al.
Published: (2026)
PRO-VPT: Distribution-Adaptive Visual Prompt Tuning via Prompt Relocation
by: Shang, Chikai, et al.
Published: (2025)
by: Shang, Chikai, et al.
Published: (2025)
GaussianMarker: Uncertainty-Aware Copyright Protection of 3D Gaussian Splatting
by: Huang, Xiufeng, et al.
Published: (2024)
by: Huang, Xiufeng, et al.
Published: (2024)
GBRIP: Granular Ball Representation for Imbalanced Partial Label Learning
by: Huang, Jintao, et al.
Published: (2024)
by: Huang, Jintao, et al.
Published: (2024)
TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement
by: Jia, Wanjun, et al.
Published: (2026)
by: Jia, Wanjun, et al.
Published: (2026)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
by: Wen, Junwei, et al.
Published: (2026)
by: Wen, Junwei, et al.
Published: (2026)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
by: Cheng, Zihui, et al.
Published: (2025)
by: Cheng, Zihui, et al.
Published: (2025)
Uncertainty Estimation in Instance Segmentation of Affordances via Bayesian Visual Transformers
by: Mur-Labadia, Lorenzo, et al.
Published: (2026)
by: Mur-Labadia, Lorenzo, et al.
Published: (2026)
MOKD: Cross-domain Finetuning for Few-shot Classification via Maximizing Optimized Kernel Dependence
by: Tian, Hongduan, et al.
Published: (2024)
by: Tian, Hongduan, et al.
Published: (2024)
Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
by: Kao, Shiu-hong, et al.
Published: (2025)
by: Kao, Shiu-hong, et al.
Published: (2025)
CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
by: Kao, Shiu-hong, et al.
Published: (2025)
by: Kao, Shiu-hong, et al.
Published: (2025)
CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction
by: Kao, Shiu-hong, et al.
Published: (2026)
by: Kao, Shiu-hong, et al.
Published: (2026)
CoT-Segmenter: Enhancing OOD Detection in Dense Road Scenes via Chain-of-Thought Reasoning
by: Song, Jeonghyo, et al.
Published: (2025)
by: Song, Jeonghyo, et al.
Published: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
by: Zhang, Jusheng, et al.
Published: (2025)
by: Zhang, Jusheng, et al.
Published: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
by: Wang, Yifan, et al.
Published: (2026)
by: Wang, Yifan, et al.
Published: (2026)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
by: Qin, Luozheng, et al.
Published: (2025)
by: Qin, Luozheng, et al.
Published: (2025)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
by: Zhou, Yiyang, et al.
Published: (2025)
by: Zhou, Yiyang, et al.
Published: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
by: Chen, Wei, et al.
Published: (2026)
by: Chen, Wei, et al.
Published: (2026)
Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
by: Huang, Chao, et al.
Published: (2025)
by: Huang, Chao, et al.
Published: (2025)
AffordanceLLM: Grounding Affordance from Vision Language Models
by: Qian, Shengyi, et al.
Published: (2024)
by: Qian, Shengyi, et al.
Published: (2024)
Similar Items
-
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
by: Guo, Yuchen, et al.
Published: (2024) -
LumiVideo: An Intelligent Agentic System for Video Color Grading
by: Guo, Yuchen, et al.
Published: (2026) -
PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
by: Guo, Yuchen, et al.
Published: (2026) -
Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models
by: Guo, Yuchen, et al.
Published: (2026) -
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
by: Guo, Yuchen, et al.
Published: (2026)