VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Taioli, Francesco, Yang, Shiping, Raychaudhuri, Sonia, Cristani, Marco, Jain, Unnat, Chang, Angel X |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MOPA: Modular Object Navigation with PointGoal Agents
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2023)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2023)
Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation
di: Zorzi, Edoardo, et al.
Pubblicazione: (2026)
di: Zorzi, Edoardo, et al.
Pubblicazione: (2026)
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024)
Semantic Mapping in Indoor Embodied AI -- A Survey on Advances, Challenges, and Future Directions
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025)
MLFM: Multi-Layered Feature Maps for Richer Language Understanding in Zero-Shot Semantic Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025)
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025)
VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2025)
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2025)
VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
di: Phute, Mansi, et al.
Pubblicazione: (2025)
di: Phute, Mansi, et al.
Pubblicazione: (2025)
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
di: Shen, Yucheng, et al.
Pubblicazione: (2026)
di: Shen, Yucheng, et al.
Pubblicazione: (2026)
Diffusion as Reasoning: Enhancing Object Navigation via Diffusion Model Conditioned on LLM-based Object-Room Knowledge
di: Ji, Yiming, et al.
Pubblicazione: (2024)
di: Ji, Yiming, et al.
Pubblicazione: (2024)
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
di: Qi, Zekun, et al.
Pubblicazione: (2025)
di: Qi, Zekun, et al.
Pubblicazione: (2025)
TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation
di: Zhong, Linqing, et al.
Pubblicazione: (2024)
di: Zhong, Linqing, et al.
Pubblicazione: (2024)
CRAFT: A Tendon-Driven Hand with Hybrid Hard-Soft Compliance
di: Lin, Leo, et al.
Pubblicazione: (2026)
di: Lin, Leo, et al.
Pubblicazione: (2026)
LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation
di: Guan, Tianrui, et al.
Pubblicazione: (2024)
di: Guan, Tianrui, et al.
Pubblicazione: (2024)
Anomaly-Aware Vision-Language Adapters for Zero-Shot Anomaly Detection
di: Aqeel, Muhammad, et al.
Pubblicazione: (2026)
di: Aqeel, Muhammad, et al.
Pubblicazione: (2026)
R3DS: Reality-linked 3D Scenes for Panoramic Scene Understanding
di: Wu, Qirui, et al.
Pubblicazione: (2024)
di: Wu, Qirui, et al.
Pubblicazione: (2024)
Seeing the Abstract: Translating the Abstract Language for Vision Language Models
di: Talon, Davide, et al.
Pubblicazione: (2025)
di: Talon, Davide, et al.
Pubblicazione: (2025)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
di: Huang, Bowen, et al.
Pubblicazione: (2024)
di: Huang, Bowen, et al.
Pubblicazione: (2024)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
di: Pothiraj, Atin, et al.
Pubblicazione: (2025)
di: Pothiraj, Atin, et al.
Pubblicazione: (2025)
Tag Map: A Text-Based Map for Spatial Reasoning and Navigation with Large Language Models
di: Zhang, Mike, et al.
Pubblicazione: (2024)
di: Zhang, Mike, et al.
Pubblicazione: (2024)
Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations
di: Patel, Shivansh, et al.
Pubblicazione: (2025)
di: Patel, Shivansh, et al.
Pubblicazione: (2025)
Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
Diffusion-based Image Generation for In-distribution Data Augmentation in Surface Defect Detection
di: Capogrosso, Luigi, et al.
Pubblicazione: (2024)
di: Capogrosso, Luigi, et al.
Pubblicazione: (2024)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
Leveraging Large Language Model-based Room-Object Relationships Knowledge for Enhancing Multimodal-Input Object Goal Navigation
di: Sun, Leyuan, et al.
Pubblicazione: (2024)
di: Sun, Leyuan, et al.
Pubblicazione: (2024)
Learning Spatial-Semantic Features for Robust Video Object Segmentation
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects
di: Li, Shujia, et al.
Pubblicazione: (2025)
di: Li, Shujia, et al.
Pubblicazione: (2025)
Leveraging Unknown Objects to Construct Labeled-Unlabeled Meta-Relationships for Zero-Shot Object Navigation
di: Zheng, Yanwei, et al.
Pubblicazione: (2024)
di: Zheng, Yanwei, et al.
Pubblicazione: (2024)
VISTANet: VIsual Spoken Textual Additive Net for Interpretable Multimodal Emotion Recognition
di: Kumar, Puneet, et al.
Pubblicazione: (2022)
di: Kumar, Puneet, et al.
Pubblicazione: (2022)
Spatial-Frequency Aware for Object Detection in RAW Image
di: Ye, Zhuohua, et al.
Pubblicazione: (2025)
di: Ye, Zhuohua, et al.
Pubblicazione: (2025)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
di: Zhu, Younan, et al.
Pubblicazione: (2025)
di: Zhu, Younan, et al.
Pubblicazione: (2025)
Reasoning-Enhanced Object-Centric Learning for Videos
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
ViPRA: Video Prediction for Robot Actions
di: Routray, Sandeep, et al.
Pubblicazione: (2025)
di: Routray, Sandeep, et al.
Pubblicazione: (2025)
SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models
di: Zantout, Nader, et al.
Pubblicazione: (2025)
di: Zantout, Nader, et al.
Pubblicazione: (2025)
Latent Distillation for Continual Object Detection at the Edge
di: Pasti, Francesco, et al.
Pubblicazione: (2024)
di: Pasti, Francesco, et al.
Pubblicazione: (2024)
Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues
di: Taioli, Francesco, et al.
Pubblicazione: (2024)
di: Taioli, Francesco, et al.
Pubblicazione: (2024)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MOPA: Modular Object Navigation with PointGoal Agents
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2023) -
Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation
di: Zorzi, Edoardo, et al.
Pubblicazione: (2026) -
Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2024) -
Semantic Mapping in Indoor Embodied AI -- A Survey on Advances, Challenges, and Future Directions
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025) -
MLFM: Multi-Layered Feature Maps for Richer Language Understanding in Zero-Shot Semantic Navigation
di: Raychaudhuri, Sonia, et al.
Pubblicazione: (2025)