WoMAP: World Models For Embodied Open-Vocabulary Object Localization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Tenny, Mei, Zhiting, Sun, Tao, Zha, Lihan, Zhou, Emily, Bao, Jeremy, Yamane, Miyu, Shorinwa, Ola, Majumdar, Anirudha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
PlayWorld: Learning Robot World Models from Autonomous Play
par: Yin, Tenny, et autres
Publié: (2026)
par: Yin, Tenny, et autres
Publié: (2026)
How Confident are Video Models? Empowering Video Models to Express their Uncertainty
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
Geometry Meets Vision: Revisiting Pretrained Semantics in Distilled Fields
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions
par: Shorinwa, Ola, et autres
Publié: (2024)
par: Shorinwa, Ola, et autres
Publié: (2024)
Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions
par: Mei, Zhiting, et autres
Publié: (2026)
par: Mei, Zhiting, et autres
Publié: (2026)
SIREN: Semantic, Initialization-Free Registration of Multi-Robot Gaussian Splatting Maps
par: Shorinwa, Ola, et autres
Publié: (2025)
par: Shorinwa, Ola, et autres
Publié: (2025)
Perceive With Confidence: Statistical Safety Assurances for Navigation with Learning-Based Perception
par: Mei, Zhiting, et autres
Publié: (2024)
par: Mei, Zhiting, et autres
Publié: (2024)
LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer
par: Zha, Lihan, et autres
Publié: (2026)
par: Zha, Lihan, et autres
Publié: (2026)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
par: Li, Huiqiong, et autres
Publié: (2026)
par: Li, Huiqiong, et autres
Publié: (2026)
Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
par: Hancock, Asher J., et autres
Publié: (2025)
par: Hancock, Asher J., et autres
Publié: (2025)
Guiding Data Collection via Factored Scaling Curves
par: Zha, Lihan, et autres
Publié: (2025)
par: Zha, Lihan, et autres
Publié: (2025)
Distributed Conjugate Gradient Method via Conjugate Direction Tracking
par: Shorinwa, Ola, et autres
Publié: (2023)
par: Shorinwa, Ola, et autres
Publié: (2023)
Distributed Quasi-Newton Method for Multi-Agent Optimization
par: Shorinwa, Ola, et autres
Publié: (2024)
par: Shorinwa, Ola, et autres
Publié: (2024)
Deceptive Risk Minimization: Out-of-Distribution Generalization by Deceiving Distribution Shift Detectors
par: Majumdar, Anirudha
Publié: (2025)
par: Majumdar, Anirudha
Publié: (2025)
VISTA: Open-Vocabulary, Task-Relevant Robot Exploration with Online Semantic Gaussian Splatting
par: Nagami, Keiko, et autres
Publié: (2025)
par: Nagami, Keiko, et autres
Publié: (2025)
Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators
par: Badithela, Apurva, et autres
Publié: (2025)
par: Badithela, Apurva, et autres
Publié: (2025)
Splat-MOVER: Multi-Stage, Open-Vocabulary Robotic Manipulation via Editable Gaussian Splatting
par: Shorinwa, Ola, et autres
Publié: (2024)
par: Shorinwa, Ola, et autres
Publié: (2024)
FAST-Splat: Fast, Ambiguity-Free Semantics Transfer in Gaussian Splatting
par: Shorinwa, Ola, et autres
Publié: (2024)
par: Shorinwa, Ola, et autres
Publié: (2024)
WoW: Towards a World omniscient World model Through Embodied Interaction
par: Chi, Xiaowei, et autres
Publié: (2025)
par: Chi, Xiaowei, et autres
Publié: (2025)
OVI-MAP:Open-Vocabulary Instance-Semantic Mapping
par: Deng, Zilong, et autres
Publié: (2026)
par: Deng, Zilong, et autres
Publié: (2026)
Unsupervised Open-Vocabulary Object Localization in Videos
par: Fan, Ke, et autres
Publié: (2023)
par: Fan, Ke, et autres
Publié: (2023)
VERDI: VLM-Embedded Reasoning for Autonomous Driving
par: Feng, Bowen, et autres
Publié: (2025)
par: Feng, Bowen, et autres
Publié: (2025)
Safe, Out-of-Distribution-Adaptive MPC with Conformalized Neural Network Ensembles
par: Contreras, Jose Leopoldo, et autres
Publié: (2024)
par: Contreras, Jose Leopoldo, et autres
Publié: (2024)
Explore until Confident: Efficient Exploration for Embodied Question Answering
par: Ren, Allen Z., et autres
Publié: (2024)
par: Ren, Allen Z., et autres
Publié: (2024)
Learning to Detect and Segment for Open Vocabulary Object Detection
par: Wang, Tao, et autres
Publié: (2022)
par: Wang, Tao, et autres
Publié: (2022)
Distributed Optimization Methods for Multi-Robot Systems: Part I -- A Tutorial
par: Shorinwa, Ola, et autres
Publié: (2023)
par: Shorinwa, Ola, et autres
Publié: (2023)
Distributed Optimization Methods for Multi-Robot Systems: Part II -- A Survey
par: Shorinwa, Ola, et autres
Publié: (2023)
par: Shorinwa, Ola, et autres
Publié: (2023)
YOLO-World: Real-Time Open-Vocabulary Object Detection
par: Cheng, Tianheng, et autres
Publié: (2024)
par: Cheng, Tianheng, et autres
Publié: (2024)
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
par: Goko, Miyu, et autres
Publié: (2024)
par: Goko, Miyu, et autres
Publié: (2024)
SINGER: An Onboard Generalist Vision-Language Navigation Policy for Drones
par: Adang, Maximilian, et autres
Publié: (2025)
par: Adang, Maximilian, et autres
Publié: (2025)
DisCo: Distributed Contact-Rich Trajectory Optimization for Forceful Multi-Robot Collaboration
par: Shorinwa, Ola, et autres
Publié: (2024)
par: Shorinwa, Ola, et autres
Publié: (2024)
SciFi-Benchmark: Leveraging Science Fiction To Improve Robot Behavior
par: Sermanet, Pierre, et autres
Publié: (2025)
par: Sermanet, Pierre, et autres
Publié: (2025)
GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance Grounding
par: Shao, Yawen, et autres
Publié: (2024)
par: Shao, Yawen, et autres
Publié: (2024)
From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects
par: Li, Zizhao, et autres
Publié: (2024)
par: Li, Zizhao, et autres
Publié: (2024)
OV-MAP : Open-Vocabulary Zero-Shot 3D Instance Segmentation Map for Robots
par: Kim, Juno, et autres
Publié: (2025)
par: Kim, Juno, et autres
Publié: (2025)
Open-Vocabulary Camouflaged Object Segmentation
par: Pang, Youwei, et autres
Publié: (2023)
par: Pang, Youwei, et autres
Publié: (2023)
Scaling Open-Vocabulary Object Detection
par: Minderer, Matthias, et autres
Publié: (2023)
par: Minderer, Matthias, et autres
Publié: (2023)
OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with Transformer
par: Li, Jinyang, et autres
Publié: (2025)
par: Li, Jinyang, et autres
Publié: (2025)
Documents similaires
-
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
par: Mei, Zhiting, et autres
Publié: (2025) -
PlayWorld: Learning Robot World Models from Autonomous Play
par: Yin, Tenny, et autres
Publié: (2026) -
How Confident are Video Models? Empowering Video Models to Express their Uncertainty
par: Mei, Zhiting, et autres
Publié: (2025) -
Geometry Meets Vision: Revisiting Pretrained Semantics in Distilled Fields
par: Mei, Zhiting, et autres
Publié: (2025) -
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
par: Mei, Zhiting, et autres
Publié: (2025)