3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ogunleye, Makanjuola, Abdelrahman, Eman, Lourentzou, Ismini |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
par: Shen, Ying, et autres
Publié: (2023)
par: Shen, Ying, et autres
Publié: (2023)
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
RoboLayout: Differentiable 3D Scene Generation for Embodied Agents
par: Shamsaddinlou, Ali
Publié: (2026)
par: Shamsaddinlou, Ali
Publié: (2026)
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
par: Zhang, Zihui, et autres
Publié: (2025)
par: Zhang, Zihui, et autres
Publié: (2025)
Commonsense for Zero-Shot Natural Language Video Localization
par: Holla, Meghana, et autres
Publié: (2023)
par: Holla, Meghana, et autres
Publié: (2023)
SPA: 3D Spatial-Awareness Enables Effective Embodied Representation
par: Zhu, Haoyi, et autres
Publié: (2024)
par: Zhu, Haoyi, et autres
Publié: (2024)
PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AI
par: Yang, Yandan, et autres
Publié: (2024)
par: Yang, Yandan, et autres
Publié: (2024)
ConVis: Contrastive Decoding with Hallucination Visualization for Mitigating Hallucinations in Multimodal Large Language Models
par: Park, Yeji, et autres
Publié: (2024)
par: Park, Yeji, et autres
Publié: (2024)
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
par: Yu, Tianjiao, et autres
Publié: (2026)
par: Yu, Tianjiao, et autres
Publié: (2026)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
par: Li, Xinzhuo, et autres
Publié: (2025)
par: Li, Xinzhuo, et autres
Publié: (2025)
g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
par: Choi, Wonje, et autres
Publié: (2024)
par: Choi, Wonje, et autres
Publié: (2024)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
par: Lee, Jihoon, et autres
Publié: (2025)
par: Lee, Jihoon, et autres
Publié: (2025)
VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs
par: Yuan, Haoran, et autres
Publié: (2026)
par: Yuan, Haoran, et autres
Publié: (2026)
PlaceIt3D: Language-Guided Object Placement in Real 3D Scenes
par: Abdelreheem, Ahmed, et autres
Publié: (2025)
par: Abdelreheem, Ahmed, et autres
Publié: (2025)
3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination
par: Yang, Jianing, et autres
Publié: (2024)
par: Yang, Jianing, et autres
Publié: (2024)
CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
par: Cao-Dinh, Duc, et autres
Publié: (2025)
par: Cao-Dinh, Duc, et autres
Publié: (2025)
Non-rigid Relative Placement through 3D Dense Diffusion
par: Cai, Eric, et autres
Publié: (2024)
par: Cai, Eric, et autres
Publié: (2024)
Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?
par: Majumdar, Arjun, et autres
Publié: (2023)
par: Majumdar, Arjun, et autres
Publié: (2023)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
par: Han, Mingfei, et autres
Publié: (2024)
par: Han, Mingfei, et autres
Publié: (2024)
RoboFactory: Exploring Embodied Agent Collaboration with Compositional Constraints
par: Qin, Yiran, et autres
Publié: (2025)
par: Qin, Yiran, et autres
Publié: (2025)
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
par: Ke, Tsung-Wei, et autres
Publié: (2024)
par: Ke, Tsung-Wei, et autres
Publié: (2024)
GSplatLoc: Grounding Keypoint Descriptors into 3D Gaussian Splatting for Improved Visual Localization
par: Sidorov, Gennady, et autres
Publié: (2024)
par: Sidorov, Gennady, et autres
Publié: (2024)
Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
par: Zhang, Zhizhen, et autres
Publié: (2025)
par: Zhang, Zhizhen, et autres
Publié: (2025)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
par: Man, Yunze, et autres
Publié: (2024)
par: Man, Yunze, et autres
Publié: (2024)
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
par: Hong, Yining, et autres
Publié: (2024)
par: Hong, Yining, et autres
Publié: (2024)
CL3R: 3D Reconstruction and Contrastive Learning for Enhanced Robotic Manipulation Representations
par: Cui, Wenbo, et autres
Publié: (2025)
par: Cui, Wenbo, et autres
Publié: (2025)
HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents
par: Tomilin, Tristan, et autres
Publié: (2025)
par: Tomilin, Tristan, et autres
Publié: (2025)
Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
par: Bharadwaj, Sagar, et autres
Publié: (2026)
par: Bharadwaj, Sagar, et autres
Publié: (2026)
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
par: Nguyen, Kiet A., et autres
Publié: (2024)
par: Nguyen, Kiet A., et autres
Publié: (2024)
ODIN: A Single Model for 2D and 3D Segmentation
par: Jain, Ayush, et autres
Publié: (2024)
par: Jain, Ayush, et autres
Publié: (2024)
BelHouse3D: A Benchmark Dataset for Assessing Occlusion Robustness in 3D Point Cloud Semantic Segmentation
par: Kumar, Umamaheswaran Raman, et autres
Publié: (2024)
par: Kumar, Umamaheswaran Raman, et autres
Publié: (2024)
Learning the RoPEs: Better 2D and 3D Position Encodings with STRING
par: Schenck, Connor, et autres
Publié: (2025)
par: Schenck, Connor, et autres
Publié: (2025)
RadarOcc: Robust 3D Occupancy Prediction with 4D Imaging Radar
par: Ding, Fangqiang, et autres
Publié: (2024)
par: Ding, Fangqiang, et autres
Publié: (2024)
LEGENT: Open Platform for Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2024)
par: Cheng, Zhili, et autres
Publié: (2024)
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
par: Xu, Tianling, et autres
Publié: (2025)
par: Xu, Tianling, et autres
Publié: (2025)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
par: Yang, Yue, et autres
Publié: (2023)
par: Yang, Yue, et autres
Publié: (2023)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
par: Zhong, Fangwei, et autres
Publié: (2024)
par: Zhong, Fangwei, et autres
Publié: (2024)
Documents similaires
-
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
par: Yu, Tianjiao, et autres
Publié: (2025) -
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
par: Shen, Ying, et autres
Publié: (2023) -
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
par: Yu, Tianjiao, et autres
Publié: (2025) -
RoboLayout: Differentiable 3D Scene Generation for Embodied Agents
par: Shamsaddinlou, Ali
Publié: (2026) -
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
par: Zhang, Zihui, et autres
Publié: (2025)