Enregistré dans:
| Auteurs principaux: | Byun, Ye Won, Jiao, Cathy, Noroozizadeh, Shahriar, Sun, Jimin, Vitiello, Rosa |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.17876 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
par: Wang, Zhaowei, et autres
Publié: (2024)
par: Wang, Zhaowei, et autres
Publié: (2024)
DVMNet++: Rethinking Relative Pose Estimation for Unseen Objects
par: Zhao, Chen, et autres
Publié: (2024)
par: Zhao, Chen, et autres
Publié: (2024)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
Scalable Unseen Objects 6-DoF Absolute Pose Estimation with Robotic Integration
par: Liu, Jian, et autres
Publié: (2025)
par: Liu, Jian, et autres
Publié: (2025)
Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments
par: Meng, Xiangqi, et autres
Publié: (2026)
par: Meng, Xiangqi, et autres
Publié: (2026)
FoundPose: Unseen Object Pose Estimation with Foundation Features
par: Örnek, Evin Pınar, et autres
Publié: (2023)
par: Örnek, Evin Pınar, et autres
Publié: (2023)
Adapting Segment Anything Model for Unseen Object Instance Segmentation
par: Cao, Rui, et autres
Publié: (2024)
par: Cao, Rui, et autres
Publié: (2024)
NextBestPath: Efficient 3D Mapping of Unseen Environments
par: Li, Shiyao, et autres
Publié: (2025)
par: Li, Shiyao, et autres
Publié: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
par: Hong, Haodong, et autres
Publié: (2024)
par: Hong, Haodong, et autres
Publié: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)
par: An, Dong, et autres
Publié: (2023)
UAS Visual Navigation in Large and Unseen Environments via a Meta Agent
par: Han, Yuci, et autres
Publié: (2025)
par: Han, Yuci, et autres
Publié: (2025)
LocPoseNet: Robust Location Prior for Unseen Object Pose Estimation
par: Zhao, Chen, et autres
Publié: (2022)
par: Zhao, Chen, et autres
Publié: (2022)
Enhancing Underwater Object Detection through Spatio-Temporal Analysis and Spatial Attention Networks
par: Karri, Sai Likhith, et autres
Publié: (2025)
par: Karri, Sai Likhith, et autres
Publié: (2025)
DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions
par: Korekata, Ryosuke, et autres
Publié: (2024)
par: Korekata, Ryosuke, et autres
Publié: (2024)
ArtReg: Visuo-Tactile based Pose Tracking and Manipulation of Unseen Articulated Objects
par: Murali, Prajval Kumar, et autres
Publié: (2025)
par: Murali, Prajval Kumar, et autres
Publié: (2025)
BOP Challenge 2023 on Detection, Segmentation and Pose Estimation of Seen and Unseen Rigid Objects
par: Hodan, Tomas, et autres
Publié: (2024)
par: Hodan, Tomas, et autres
Publié: (2024)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
par: Yang, Yue, et autres
Publié: (2023)
par: Yang, Yue, et autres
Publié: (2023)
Segmenting Known Objects and Unseen Unknowns without Prior Knowledge
par: Gasperini, Stefano, et autres
Publié: (2022)
par: Gasperini, Stefano, et autres
Publié: (2022)
FLAME: Learning to Navigate with Multimodal LLM in Urban Environments
par: Xu, Yunzhe, et autres
Publié: (2024)
par: Xu, Yunzhe, et autres
Publié: (2024)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
par: Qian, Kangan, et autres
Publié: (2025)
par: Qian, Kangan, et autres
Publié: (2025)
CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
CLIP-Loc: Multi-modal Landmark Association for Global Localization in Object-based Maps
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
GFreeDet: Exploiting Gaussian Splatting and Foundation Models for Model-free Unseen Object Detection in the BOP Challenge 2024
par: Liu, Xingyu, et autres
Publié: (2024)
par: Liu, Xingyu, et autres
Publié: (2024)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
par: Long, Yuxing, et autres
Publié: (2024)
par: Long, Yuxing, et autres
Publié: (2024)
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
par: Su, Hung-Ting, et autres
Publié: (2026)
par: Su, Hung-Ting, et autres
Publié: (2026)
Language-Based Augmentation to Address Shortcut Learning in Object Goal Navigation
par: Hoftijzer, Dennis, et autres
Publié: (2024)
par: Hoftijzer, Dennis, et autres
Publié: (2024)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
par: Jiang, Titong, et autres
Publié: (2025)
par: Jiang, Titong, et autres
Publié: (2025)
Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps
par: Qiu, Dicong, et autres
Publié: (2024)
par: Qiu, Dicong, et autres
Publié: (2024)
UncertaintyTrack: Exploiting Detection and Localization Uncertainty in Multi-Object Tracking
par: Lee, Chang Won, et autres
Publié: (2024)
par: Lee, Chang Won, et autres
Publié: (2024)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
par: Nguyen, Nghia, et autres
Publié: (2024)
par: Nguyen, Nghia, et autres
Publié: (2024)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
par: Lu, Jinghui, et autres
Publié: (2026)
par: Lu, Jinghui, et autres
Publié: (2026)
Virtual Community: An Open World for Humans, Robots, and Society
par: Zhou, Qinhong, et autres
Publié: (2025)
par: Zhou, Qinhong, et autres
Publié: (2025)
CLIP-Clique: Graph-based Correspondence Matching Augmented by Vision Language Models for Object-based Global Localization
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
par: Matsuzaki, Shigemichi, et autres
Publié: (2024)
Online Mapping for Autonomous Driving: Addressing Sensor Generalization and Dynamic Map Updates in Campus Environments
par: Zhang, Zihan, et autres
Publié: (2025)
par: Zhang, Zihan, et autres
Publié: (2025)
Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
par: Hong, Yining, et autres
Publié: (2026)
par: Hong, Yining, et autres
Publié: (2026)
A Language Agent for Autonomous Driving
par: Mao, Jiageng, et autres
Publié: (2023)
par: Mao, Jiageng, et autres
Publié: (2023)
An Efficient Method for Accurate Pose Estimation and Error Correction of Cuboidal Objects
par: Rai, Utsav, et autres
Publié: (2025)
par: Rai, Utsav, et autres
Publié: (2025)
Documents similaires
-
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
par: Wang, Zhaowei, et autres
Publié: (2024) -
DVMNet++: Rethinking Relative Pose Estimation for Unseen Objects
par: Zhao, Chen, et autres
Publié: (2024) -
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025) -
Scalable Unseen Objects 6-DoF Absolute Pose Estimation with Robotic Integration
par: Liu, Jian, et autres
Publié: (2025) -
Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments
par: Meng, Xiangqi, et autres
Publié: (2026)