AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xinyi, Yang, Xun, Xu, Yanlong, Wu, Yuchen, Li, Zhen, Zhao, Na |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
di: Wang, Hanqing, et al.
Pubblicazione: (2026)
di: Wang, Hanqing, et al.
Pubblicazione: (2026)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
di: Xing, Shangyu, et al.
Pubblicazione: (2024)
di: Xing, Shangyu, et al.
Pubblicazione: (2024)
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
di: Pan, Yining, et al.
Pubblicazione: (2026)
di: Pan, Yining, et al.
Pubblicazione: (2026)
Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations
di: Yuan, Zhihao, et al.
Pubblicazione: (2025)
di: Yuan, Zhihao, et al.
Pubblicazione: (2025)
Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
WorldAfford: Affordance Grounding based on Natural Language Instructions
di: Chen, Changmao, et al.
Pubblicazione: (2024)
di: Chen, Changmao, et al.
Pubblicazione: (2024)
AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
di: Liao, Jingyi, et al.
Pubblicazione: (2025)
di: Liao, Jingyi, et al.
Pubblicazione: (2025)
SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting
di: Li, Di, et al.
Pubblicazione: (2025)
di: Li, Di, et al.
Pubblicazione: (2025)
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
di: Yan, Hao, et al.
Pubblicazione: (2025)
di: Yan, Hao, et al.
Pubblicazione: (2025)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
di: Peng, Jihua, et al.
Pubblicazione: (2025)
di: Peng, Jihua, et al.
Pubblicazione: (2025)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
di: Shi, Yiming, et al.
Pubblicazione: (2024)
di: Shi, Yiming, et al.
Pubblicazione: (2024)
Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation
di: Zhu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Zhu, Xiaomeng, et al.
Pubblicazione: (2025)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
di: Qiao, Yanyuan, et al.
Pubblicazione: (2025)
di: Qiao, Yanyuan, et al.
Pubblicazione: (2025)
CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection
di: Wu, Yuchen, et al.
Pubblicazione: (2026)
di: Wu, Yuchen, et al.
Pubblicazione: (2026)
Embody 3D: A Large-scale Multimodal Motion and Behavior Dataset
di: McLean, Claire, et al.
Pubblicazione: (2025)
di: McLean, Claire, et al.
Pubblicazione: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
Cyc3D: Fine-grained Controllable 3D Generation via Cycle Consistency Regularization
di: Xu, Hongbin, et al.
Pubblicazione: (2025)
di: Xu, Hongbin, et al.
Pubblicazione: (2025)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
di: Yi, Huahui, et al.
Pubblicazione: (2025)
di: Yi, Huahui, et al.
Pubblicazione: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
di: Zhu, Wenxin, et al.
Pubblicazione: (2025)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
di: Li, Zhenshi, et al.
Pubblicazione: (2024)
AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers
di: Vu, Nghia, et al.
Pubblicazione: (2026)
di: Vu, Nghia, et al.
Pubblicazione: (2026)
ADVEDM:Fine-grained Adversarial Attack against VLM-based Embodied Agents
di: Wang, Yichen, et al.
Pubblicazione: (2025)
di: Wang, Yichen, et al.
Pubblicazione: (2025)
AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
di: AgiBot-World-Contributors, et al.
Pubblicazione: (2025)
di: AgiBot-World-Contributors, et al.
Pubblicazione: (2025)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
di: Xue, Junxiao, et al.
Pubblicazione: (2026)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
di: Luo, Yulin, et al.
Pubblicazione: (2025)
di: Luo, Yulin, et al.
Pubblicazione: (2025)
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
di: Li, Xueheng, et al.
Pubblicazione: (2026)
di: Li, Xueheng, et al.
Pubblicazione: (2026)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
Democratizing Fine-grained Visual Recognition with Large Language Models
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
di: Liu, Mingxuan, et al.
Pubblicazione: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
di: Chen, Honghao, et al.
Pubblicazione: (2025)
di: Chen, Honghao, et al.
Pubblicazione: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
CMMLoc: Advancing Text-to-PointCloud Localization with Cauchy-Mixture-Model Based Framework
di: Xu, Yanlong, et al.
Pubblicazione: (2025)
di: Xu, Yanlong, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
di: Yu, Chunlin, et al.
Pubblicazione: (2024) -
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
di: Wang, Hanqing, et al.
Pubblicazione: (2026) -
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
di: Wang, Xinyi, et al.
Pubblicazione: (2025) -
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
di: Xing, Shangyu, et al.
Pubblicazione: (2024) -
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
di: Pan, Yining, et al.
Pubblicazione: (2026)