SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Chunlin, Wang, Hanqing, Shi, Ye, Luo, Haoyang, Yang, Sibei, Yu, Jingyi, Wang, Jingya |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting
by: Li, Di, et al.
Published: (2025)
by: Li, Di, et al.
Published: (2025)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
by: Wang, Hanqing, et al.
Published: (2026)
by: Wang, Hanqing, et al.
Published: (2026)
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
by: Wu, Shijie, et al.
Published: (2024)
by: Wu, Shijie, et al.
Published: (2024)
Contextually Affinitive Neighborhood Refinery for Deep Clustering
by: Yu, Chunlin, et al.
Published: (2023)
by: Yu, Chunlin, et al.
Published: (2023)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
by: Wang, Hanqing, et al.
Published: (2025)
by: Wang, Hanqing, et al.
Published: (2025)
AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
by: Wang, Xinyi, et al.
Published: (2025)
by: Wang, Xinyi, et al.
Published: (2025)
Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation
by: Zhu, Xiaomeng, et al.
Published: (2025)
by: Zhu, Xiaomeng, et al.
Published: (2025)
AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers
by: Vu, Nghia, et al.
Published: (2026)
by: Vu, Nghia, et al.
Published: (2026)
Vision Function Layer in Multimodal LLMs
by: Shi, Cheng, et al.
Published: (2025)
by: Shi, Cheng, et al.
Published: (2025)
WorldAfford: Affordance Grounding based on Natural Language Instructions
by: Chen, Changmao, et al.
Published: (2024)
by: Chen, Changmao, et al.
Published: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
by: Zhang, Zhenhao, et al.
Published: (2025)
by: Zhang, Zhenhao, et al.
Published: (2025)
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
by: Wu, Xiaofei, et al.
Published: (2026)
by: Wu, Xiaofei, et al.
Published: (2026)
THOR: Text to Human-Object Interaction Diffusion via Relation Intervention
by: Wu, Qianyang, et al.
Published: (2024)
by: Wu, Qianyang, et al.
Published: (2024)
EqvAfford: SE(3) Equivariance for Point-Level Affordance Learning
by: Chen, Yue, et al.
Published: (2024)
by: Chen, Yue, et al.
Published: (2024)
Diffusion Bridge or Flow Matching? A Unifying Framework and Comparative Analysis
by: Zhu, Kaizhen, et al.
Published: (2025)
by: Zhu, Kaizhen, et al.
Published: (2025)
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
by: Tang, Jiajin, et al.
Published: (2025)
by: Tang, Jiajin, et al.
Published: (2025)
VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection
by: Sun, Haowen, et al.
Published: (2026)
by: Sun, Haowen, et al.
Published: (2026)
O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation
by: Tian, Tongxuan, et al.
Published: (2025)
by: Tian, Tongxuan, et al.
Published: (2025)
AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction
by: Maksutova, Aiza, et al.
Published: (2026)
by: Maksutova, Aiza, et al.
Published: (2026)
Unsupervised Cross-Domain Image Retrieval via Prototypical Optimal Transport
by: Li, Bin, et al.
Published: (2024)
by: Li, Bin, et al.
Published: (2024)
Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances
by: Wang, Qirui, et al.
Published: (2026)
by: Wang, Qirui, et al.
Published: (2026)
ModeSeq: Taming Sparse Multimodal Motion Prediction with Sequential Mode Modeling
by: Zhou, Zikang, et al.
Published: (2024)
by: Zhou, Zikang, et al.
Published: (2024)
A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse Signals
by: Tang, Jiangnan, et al.
Published: (2024)
by: Tang, Jiangnan, et al.
Published: (2024)
PreAfford: Universal Affordance-Based Pre-Grasping for Diverse Objects and Environments
by: Ding, Kairui, et al.
Published: (2024)
by: Ding, Kairui, et al.
Published: (2024)
StackFLOW: Monocular Human-Object Reconstruction by Stacked Normalizing Flow with Offset
by: Huo, Chaofan, et al.
Published: (2024)
by: Huo, Chaofan, et al.
Published: (2024)
3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians
by: Wei, Zeming, et al.
Published: (2025)
by: Wei, Zeming, et al.
Published: (2025)
MedSeqFT: Sequential Fine-tuning Foundation Models for 3D Medical Image Segmentation
by: Ye, Yiwen, et al.
Published: (2025)
by: Ye, Yiwen, et al.
Published: (2025)
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)
by: Shi, Cheng, et al.
Published: (2026)
A Unified and Fast-Sampling Diffusion Bridge Framework via Stochastic Optimal Control
by: Pan, Mokai, et al.
Published: (2025)
by: Pan, Mokai, et al.
Published: (2025)
UniDB: A Unified Diffusion Bridge Framework via Stochastic Optimal Control
by: Zhu, Kaizhen, et al.
Published: (2025)
by: Zhu, Kaizhen, et al.
Published: (2025)
Dissecting and Mitigating Diffusion Bias via Mechanistic Interpretability
by: Shi, Yingdong, et al.
Published: (2025)
by: Shi, Yingdong, et al.
Published: (2025)
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
by: Wang, Runze, et al.
Published: (2026)
by: Wang, Runze, et al.
Published: (2026)
HybridGait: A Benchmark for Spatial-Temporal Cloth-Changing Gait Recognition with Hybrid Explorations
by: Dong, Yilan, et al.
Published: (2023)
by: Dong, Yilan, et al.
Published: (2023)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
by: Zhang, YiFan, et al.
Published: (2024)
by: Zhang, YiFan, et al.
Published: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
by: Pan, Yu, et al.
Published: (2026)
by: Pan, Yu, et al.
Published: (2026)
Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding
by: Gao, Xianqiang, et al.
Published: (2024)
by: Gao, Xianqiang, et al.
Published: (2024)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
by: Chu, Hengshuo, et al.
Published: (2025)
by: Chu, Hengshuo, et al.
Published: (2025)
HOI-M3:Capture Multiple Humans and Objects Interaction within Contextual Environment
by: Zhang, Juze, et al.
Published: (2024)
by: Zhang, Juze, et al.
Published: (2024)
A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
by: Zhang, Zixin, et al.
Published: (2025)
by: Zhang, Zixin, et al.
Published: (2025)
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
by: Shi, Cheng, et al.
Published: (2024)
by: Shi, Cheng, et al.
Published: (2024)
Similar Items
-
SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting
by: Li, Di, et al.
Published: (2025) -
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
by: Wang, Hanqing, et al.
Published: (2026) -
AffordDP: Generalizable Diffusion Policy with Transferable Affordance
by: Wu, Shijie, et al.
Published: (2024) -
Contextually Affinitive Neighborhood Refinery for Deep Clustering
by: Yu, Chunlin, et al.
Published: (2023) -
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
by: Wang, Hanqing, et al.
Published: (2025)