Diffusion as Reasoning: Enhancing Object Navigation via Diffusion Model Conditioned on LLM-based Object-Room Knowledge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Yiming, Yun, Kaijie, Liu, Yang, Wang, Zhengpu, Ma, Boyu, Xie, Zongwu, Liu, Hong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mars Traversability Prediction: A Multi-modal Self-supervised Approach for Costmap Generation
par: Xie, Zongwu, et autres
Publié: (2025)
par: Xie, Zongwu, et autres
Publié: (2025)
NEDS-SLAM: A Neural Explicit Dense Semantic SLAM Framework using 3D Gaussian Splatting
par: Ji, Yiming, et autres
Publié: (2024)
par: Ji, Yiming, et autres
Publié: (2024)
DCIRNet: Depth Completion with Iterative Refinement for Dexterous Grasping of Transparent and Reflective Objects
par: Xie, Guanghu, et autres
Publié: (2025)
par: Xie, Guanghu, et autres
Publié: (2025)
HTMNet: A Hybrid Network with Transformer-Mamba Bottleneck Multimodal Fusion for Transparent and Reflective Objects Depth Completion
par: Xie, Guanghu, et autres
Publié: (2025)
par: Xie, Guanghu, et autres
Publié: (2025)
Leveraging Large Language Model-based Room-Object Relationships Knowledge for Enhancing Multimodal-Input Object Goal Navigation
par: Sun, Leyuan, et autres
Publié: (2024)
par: Sun, Leyuan, et autres
Publié: (2024)
CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
DiffusionTrack: Diffusion Model For Multi-Object Tracking
par: Luo, Run, et autres
Publié: (2023)
par: Luo, Run, et autres
Publié: (2023)
Neural-Network-Driven Reward Prediction as a Heuristic: Advancing Q-Learning for Mobile Robot Path Planning
par: Ji, Yiming, et autres
Publié: (2024)
par: Ji, Yiming, et autres
Publié: (2024)
Object Style Diffusion for Generalized Object Detection in Urban Scene
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion
par: Zhang, Ziyue, et autres
Publié: (2024)
par: Zhang, Ziyue, et autres
Publié: (2024)
Marine Saliency Segmenter: Object-Focused Conditional Diffusion with Region-Level Semantic Knowledge Distillation
par: Chang, Laibin, et autres
Publié: (2025)
par: Chang, Laibin, et autres
Publié: (2025)
Diffusion Domain Teacher: Diffusion Guided Domain Adaptive Object Detector
par: He, Boyong, et autres
Publié: (2025)
par: He, Boyong, et autres
Publié: (2025)
IOR: Inversed Objects Replay for Incremental Object Detection
par: An, Zijia, et autres
Publié: (2024)
par: An, Zijia, et autres
Publié: (2024)
WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion
par: Schneider, Manuel-Andreas, et autres
Publié: (2026)
par: Schneider, Manuel-Andreas, et autres
Publié: (2026)
Object Fidelity Diffusion for Remote Sensing Image Generation
par: Ye, Ziqi, et autres
Publié: (2025)
par: Ye, Ziqi, et autres
Publié: (2025)
DiffPop: Plausibility-Guided Object Placement Diffusion for Image Composition
par: Liu, Jiacheng, et autres
Publié: (2024)
par: Liu, Jiacheng, et autres
Publié: (2024)
VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
par: Taioli, Francesco, et autres
Publié: (2026)
par: Taioli, Francesco, et autres
Publié: (2026)
D-SCo: Dual-Stream Conditional Diffusion for Monocular Hand-Held Object Reconstruction
par: Fu, Bowen, et autres
Publié: (2023)
par: Fu, Bowen, et autres
Publié: (2023)
DiffusionFake: Enhancing Generalization in Deepfake Detection via Guided Stable Diffusion
par: Sun, Ke, et autres
Publié: (2024)
par: Sun, Ke, et autres
Publié: (2024)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
par: Zhu, Hongyang, et autres
Publié: (2025)
par: Zhu, Hongyang, et autres
Publié: (2025)
Rethinking Video Tokenization: A Conditioned Diffusion-based Approach
par: Yang, Nianzu, et autres
Publié: (2025)
par: Yang, Nianzu, et autres
Publié: (2025)
From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning
par: Zeng, Yuhui, et autres
Publié: (2025)
par: Zeng, Yuhui, et autres
Publié: (2025)
DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
par: Li, Weiran, et autres
Publié: (2025)
par: Li, Weiran, et autres
Publié: (2025)
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
par: He, Jixuan, et autres
Publié: (2024)
par: He, Jixuan, et autres
Publié: (2024)
Extreme Two-View Geometry From Object Poses with Diffusion Models
par: Sun, Yujing, et autres
Publié: (2024)
par: Sun, Yujing, et autres
Publié: (2024)
HOI-Diff: Text-Driven Synthesis of 3D Human-Object Interactions using Diffusion Models
par: Peng, Xiaogang, et autres
Publié: (2023)
par: Peng, Xiaogang, et autres
Publié: (2023)
MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer
par: Teodoro, Samuel, et autres
Publié: (2026)
par: Teodoro, Samuel, et autres
Publié: (2026)
Joint Diffusion for Universal Hand-Object Grasp Generation
par: Cao, Jinkun, et autres
Publié: (2024)
par: Cao, Jinkun, et autres
Publié: (2024)
FocusDiffuser: Perceiving Local Disparities for Camouflaged Object Detection
par: Zhao, Jianwei, et autres
Publié: (2024)
par: Zhao, Jianwei, et autres
Publié: (2024)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
par: Huang, Jun, et autres
Publié: (2025)
par: Huang, Jun, et autres
Publié: (2025)
DynamicPose: Real-time and Robust 6D Object Pose Tracking for Fast-Moving Cameras and Objects
par: Liang, Tingbang, et autres
Publié: (2025)
par: Liang, Tingbang, et autres
Publié: (2025)
ODGEN: Domain-specific Object Detection Data Generation with Diffusion Models
par: Zhu, Jingyuan, et autres
Publié: (2024)
par: Zhu, Jingyuan, et autres
Publié: (2024)
Diffusion-based Data Augmentation for Object Counting Problems
par: Wang, Zhen, et autres
Publié: (2024)
par: Wang, Zhen, et autres
Publié: (2024)
AirRoom: Objects Matter in Room Reidentification
par: Yao, Runmao, et autres
Publié: (2025)
par: Yao, Runmao, et autres
Publié: (2025)
Reasoning-Enhanced Object-Centric Learning for Videos
par: Li, Jian, et autres
Publié: (2024)
par: Li, Jian, et autres
Publié: (2024)
Adaptive Guidance Semantically Enhanced via Multimodal LLM for Edge-Cloud Object Detection
par: Hu, Yunqing, et autres
Publié: (2025)
par: Hu, Yunqing, et autres
Publié: (2025)
Object Pose Estimation via the Aggregation of Diffusion Features
par: Wang, Tianfu, et autres
Publié: (2024)
par: Wang, Tianfu, et autres
Publié: (2024)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
par: Gu, Chenyang, et autres
Publié: (2026)
par: Gu, Chenyang, et autres
Publié: (2026)
Erase Diffusion: Empowering Object Removal Through Calibrating Diffusion Pathways
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
Documents similaires
-
Mars Traversability Prediction: A Multi-modal Self-supervised Approach for Costmap Generation
par: Xie, Zongwu, et autres
Publié: (2025) -
NEDS-SLAM: A Neural Explicit Dense Semantic SLAM Framework using 3D Gaussian Splatting
par: Ji, Yiming, et autres
Publié: (2024) -
DCIRNet: Depth Completion with Iterative Refinement for Dexterous Grasping of Transparent and Reflective Objects
par: Xie, Guanghu, et autres
Publié: (2025) -
HTMNet: A Hybrid Network with Transformer-Mamba Bottleneck Multimodal Fusion for Transparent and Reflective Objects Depth Completion
par: Xie, Guanghu, et autres
Publié: (2025) -
Leveraging Large Language Model-based Room-Object Relationships Knowledge for Enhancing Multimodal-Input Object Goal Navigation
par: Sun, Leyuan, et autres
Publié: (2024)