DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhaowei, Zhang, Hongming, Fang, Tianqing, Tian, Ye, Yang, Yue, Ma, Kaixin, Pan, Xiaoman, Song, Yangqiu, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Getting Sick After Seeing a Doctor? Diagnosing and Mitigating Knowledge Conflicts in Event Temporal Reasoning
par: Fang, Tianqing, et autres
Publié: (2023)
par: Fang, Tianqing, et autres
Publié: (2023)
Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction
par: Han, Kaiqiao, et autres
Publié: (2024)
par: Han, Kaiqiao, et autres
Publié: (2024)
LASER: LLM Agent with State-Space Exploration for Web Navigation
par: Ma, Kaixin, et autres
Publié: (2023)
par: Ma, Kaixin, et autres
Publié: (2023)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
par: Do, Quyet V., et autres
Publié: (2024)
par: Do, Quyet V., et autres
Publié: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
AbsPyramid: Benchmarking the Abstraction Ability of Language Models with a Unified Entailment Graph
par: Wang, Zhaowei, et autres
Publié: (2023)
par: Wang, Zhaowei, et autres
Publié: (2023)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
par: Zhang, Liyu, et autres
Publié: (2024)
par: Zhang, Liyu, et autres
Publié: (2024)
On the Potential of Open-Vocabulary Models for Object Detection in Unusual Street Scenes
par: Ilyas, Sadia, et autres
Publié: (2024)
par: Ilyas, Sadia, et autres
Publié: (2024)
On-the-fly Denoising for Data Augmentation in Natural Language Understanding
par: Fang, Tianqing, et autres
Publié: (2022)
par: Fang, Tianqing, et autres
Publié: (2022)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
par: Zhao, Dong, et autres
Publié: (2026)
par: Zhao, Dong, et autres
Publié: (2026)
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
par: Werby, Abdelrhman, et autres
Publié: (2024)
par: Werby, Abdelrhman, et autres
Publié: (2024)
DualMap: Online Open-Vocabulary Semantic Mapping for Natural Language Navigation in Dynamic Changing Scenes
par: Jiang, Jiajun, et autres
Publié: (2025)
par: Jiang, Jiajun, et autres
Publié: (2025)
State and Scene Enhanced Prototypes for Weakly Supervised Open-Vocabulary Object Detection
par: Zhou, Jiaying, et autres
Publié: (2025)
par: Zhou, Jiaying, et autres
Publié: (2025)
Open-Vocabulary Indoor Object Grounding with 3D Hierarchical Scene Graph
par: Linok, Sergey, et autres
Publié: (2025)
par: Linok, Sergey, et autres
Publié: (2025)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
par: Tai, Hanchen, et autres
Publié: (2024)
par: Tai, Hanchen, et autres
Publié: (2024)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
par: Yu, Wenhao, et autres
Publié: (2023)
par: Yu, Wenhao, et autres
Publié: (2023)
Open Vocabulary Semantic Scene Sketch Understanding
par: Bourouis, Ahmed, et autres
Publié: (2023)
par: Bourouis, Ahmed, et autres
Publié: (2023)
Taking A Closer Look at Interacting Objects: Interaction-Aware Open Vocabulary Scene Graph Generation
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
par: Jia, Mengzhao, et autres
Publié: (2024)
par: Jia, Mengzhao, et autres
Publié: (2024)
AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility Estimation
par: Wang, Zhaowei, et autres
Publié: (2024)
par: Wang, Zhaowei, et autres
Publié: (2024)
Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?
par: Mütze, Annika, et autres
Publié: (2025)
par: Mütze, Annika, et autres
Publié: (2025)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
SD-OVON: A Semantics-aware Dataset and Benchmark Generation Pipeline for Open-Vocabulary Object Navigation in Dynamic Scenes
par: Qiu, Dicong, et autres
Publié: (2025)
par: Qiu, Dicong, et autres
Publié: (2025)
CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population
par: Fang, Tianqing, et autres
Publié: (2023)
par: Fang, Tianqing, et autres
Publié: (2023)
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
par: Zhao, Youjun, et autres
Publié: (2024)
par: Zhao, Youjun, et autres
Publié: (2024)
Semantic Gaussians: Open-Vocabulary Scene Understanding with 3D Gaussian Splatting
par: Guo, Jun, et autres
Publié: (2024)
par: Guo, Jun, et autres
Publié: (2024)
From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models
par: Li, Rongjie, et autres
Publié: (2024)
par: Li, Rongjie, et autres
Publié: (2024)
DOZE: A Dataset for Open-Vocabulary Zero-Shot Object Navigation in Dynamic Environments
par: Ma, Ji, et autres
Publié: (2024)
par: Ma, Ji, et autres
Publié: (2024)
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes
par: Zhou, Changqing, et autres
Publié: (2026)
par: Zhou, Changqing, et autres
Publié: (2026)
Complex Reasoning over Logical Queries on Commonsense Knowledge Graphs
par: Fang, Tianqing, et autres
Publié: (2024)
par: Fang, Tianqing, et autres
Publié: (2024)
Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization
par: He, Mutian, et autres
Publié: (2022)
par: He, Mutian, et autres
Publié: (2022)
Beyond Bare Queries: Open-Vocabulary Object Grounding with 3D Scene Graph
par: Linok, Sergey, et autres
Publié: (2024)
par: Linok, Sergey, et autres
Publié: (2024)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
par: Zheng, Tianshi, et autres
Publié: (2024)
par: Zheng, Tianshi, et autres
Publié: (2024)
Retrieving Objects from 3D Scenes with Box-Guided Open-Vocabulary Instance Segmentation
par: Nguyen, Khanh, et autres
Publié: (2025)
par: Nguyen, Khanh, et autres
Publié: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas
par: Xu, Baixuan, et autres
Publié: (2025)
par: Xu, Baixuan, et autres
Publié: (2025)
SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation
par: Luo, Jun, et autres
Publié: (2026)
par: Luo, Jun, et autres
Publié: (2026)
Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation
par: Li, Lin, et autres
Publié: (2025)
par: Li, Lin, et autres
Publié: (2025)
General Scene Adaptation for Vision-and-Language Navigation
par: Hong, Haodong, et autres
Publié: (2025)
par: Hong, Haodong, et autres
Publié: (2025)
Documents similaires
-
Getting Sick After Seeing a Doctor? Diagnosing and Mitigating Knowledge Conflicts in Event Temporal Reasoning
par: Fang, Tianqing, et autres
Publié: (2023) -
Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction
par: Han, Kaiqiao, et autres
Publié: (2024) -
LASER: LLM Agent with State-Space Exploration for Web Navigation
par: Ma, Kaixin, et autres
Publié: (2023) -
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
par: Do, Quyet V., et autres
Publié: (2024) -
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)