Resolving Positional Ambiguity in Dialogues by Vision-Language Models for Robot Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Kuan-Lin, Wei, Tzu-Ti, Yeh, Li-Tzu, Kao, Elaine, Tseng, Yu-Chee, Chen, Jen-Jee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
Multi-User Multi-Key Image Steganography with Key Isolation
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
por: Wei, Tzu-Ti, et al.
Publicado: (2026)
Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
por: Lin, Xingyao, et al.
Publicado: (2025)
por: Lin, Xingyao, et al.
Publicado: (2025)
Proprioceptive Invariant Robot State Estimation
por: Lin, Tzu-Yuan, et al.
Publicado: (2023)
por: Lin, Tzu-Yuan, et al.
Publicado: (2023)
T-araVLN: Translator for Agricultural Robotic Agents on Vision-and-Language Navigation
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance
por: Lee, Tzu-Hsien, et al.
Publicado: (2025)
por: Lee, Tzu-Hsien, et al.
Publicado: (2025)
PANav: Toward Privacy-Aware Robot Navigation via Vision-Language Models
por: Yu, Bangguo, et al.
Publicado: (2024)
por: Yu, Bangguo, et al.
Publicado: (2024)
Resolving State Ambiguity in Robot Manipulation via Adaptive Working Memory Recoding
por: Hu, Qingda, et al.
Publicado: (2025)
por: Hu, Qingda, et al.
Publicado: (2025)
Adaptive Reinforcement and Model Predictive Control Switching for Safe Human-Robot Cooperative Navigation
por: Liu, Ning, et al.
Publicado: (2026)
por: Liu, Ning, et al.
Publicado: (2026)
Online Robot Navigation and Manipulation with Distilled Vision-Language Models
por: Liu, Kangcheng
Publicado: (2024)
por: Liu, Kangcheng
Publicado: (2024)
Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models
por: Xia, Xingyu, et al.
Publicado: (2026)
por: Xia, Xingyu, et al.
Publicado: (2026)
Theory and Explicit Design of a Path Planner for an SE(3) Robot
por: Zhang, Zhaoqi, et al.
Publicado: (2024)
por: Zhang, Zhaoqi, et al.
Publicado: (2024)
TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments
por: Huang, Zhiyu, et al.
Publicado: (2026)
por: Huang, Zhiyu, et al.
Publicado: (2026)
Debiasing 6-DOF IMU via Hierarchical Learning of Continuous Bias Dynamics
por: Liu, Ben, et al.
Publicado: (2025)
por: Liu, Ben, et al.
Publicado: (2025)
Tensegrity Robot Proprioceptive State Estimation with Geometric Constraints
por: Tong, Wenzhe, et al.
Publicado: (2024)
por: Tong, Wenzhe, et al.
Publicado: (2024)
LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
por: Ding, Hongyu, et al.
Publicado: (2025)
por: Ding, Hongyu, et al.
Publicado: (2025)
Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models
por: Xiao, Ling, et al.
Publicado: (2026)
por: Xiao, Ling, et al.
Publicado: (2026)
Robot Navigation Using Physically Grounded Vision-Language Models in Outdoor Environments
por: Elnoor, Mohamed, et al.
Publicado: (2024)
por: Elnoor, Mohamed, et al.
Publicado: (2024)
VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation
por: Zhao, Wentao, et al.
Publicado: (2024)
por: Zhao, Wentao, et al.
Publicado: (2024)
A Deployable Embodied Vision-Language Navigation System with Hierarchical Cognition and Context-Aware Exploration
por: Xu, Kuan, et al.
Publicado: (2026)
por: Xu, Kuan, et al.
Publicado: (2026)
Legged Robot State Estimation within Non-inertial Environments
por: He, Zijian, et al.
Publicado: (2024)
por: He, Zijian, et al.
Publicado: (2024)
Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models
por: Yu, Bangguo, et al.
Publicado: (2023)
por: Yu, Bangguo, et al.
Publicado: (2023)
Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought
por: Huang, Yu Ti
Publicado: (2025)
por: Huang, Yu Ti
Publicado: (2025)
Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
por: Chen, Jiaqi, et al.
Publicado: (2024)
por: Chen, Jiaqi, et al.
Publicado: (2024)
Multi-Robot Reliable Navigation in Uncertain Topological Environments with Graph Attention Networks
por: Yu, Zhuoyuan, et al.
Publicado: (2024)
por: Yu, Zhuoyuan, et al.
Publicado: (2024)
Robotic Task Ambiguity Resolution via Natural Language Interaction
por: Chisari, Eugenio, et al.
Publicado: (2025)
por: Chisari, Eugenio, et al.
Publicado: (2025)
Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation
por: Lin, Tzu-Jung, et al.
Publicado: (2025)
por: Lin, Tzu-Jung, et al.
Publicado: (2025)
Zero-shot Object Navigation with Vision-Language Models Reasoning
por: Wen, Congcong, et al.
Publicado: (2024)
por: Wen, Congcong, et al.
Publicado: (2024)
Learning Dynamic Weight Adjustment for Spatial-Temporal Trajectory Planning in Crowd Navigation
por: Cao, Muqing, et al.
Publicado: (2024)
por: Cao, Muqing, et al.
Publicado: (2024)
Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?
por: Subedi, Nitesh, et al.
Publicado: (2025)
por: Subedi, Nitesh, et al.
Publicado: (2025)
Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models
por: Song, Zijian, et al.
Publicado: (2026)
por: Song, Zijian, et al.
Publicado: (2026)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
por: Hirose, Noriaki, et al.
Publicado: (2025)
por: Hirose, Noriaki, et al.
Publicado: (2025)
A Multimodal Data Collection Framework for Dialogue-Driven Assistive Robotics to Clarify Ambiguities: A Wizard-of-Oz Pilot Study
por: Liu, Guangping, et al.
Publicado: (2026)
por: Liu, Guangping, et al.
Publicado: (2026)
Prompt a Robot to Walk with Large Language Models
por: Wang, Yen-Jen, et al.
Publicado: (2023)
por: Wang, Yen-Jen, et al.
Publicado: (2023)
MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System
por: Liu, Haokun, et al.
Publicado: (2025)
por: Liu, Haokun, et al.
Publicado: (2025)
LAMP: Implicit Language Map for Robot Navigation
por: Lee, Sibaek, et al.
Publicado: (2026)
por: Lee, Sibaek, et al.
Publicado: (2026)
Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents
por: Yang, Zhejian, et al.
Publicado: (2025)
por: Yang, Zhejian, et al.
Publicado: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization
por: Wei, Tzu-Ti, et al.
Publicado: (2026) -
WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment
por: Wei, Tzu-Ti, et al.
Publicado: (2026) -
Multi-User Multi-Key Image Steganography with Key Isolation
por: Wei, Tzu-Ti, et al.
Publicado: (2026) -
Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
por: Lin, Xingyao, et al.
Publicado: (2025) -
Proprioceptive Invariant Robot State Estimation
por: Lin, Tzu-Yuan, et al.
Publicado: (2023)