Open-Vocabulary Action Localization with Iterative Visual Prompting
Fuente:
arXiv
Guardado en:
| Autores principales: | Wake, Naoki, Kanehira, Atsushi, Sasabuchi, Kazuhiro, Takamatsu, Jun, Ikeuchi, Katsushi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Taxonomy of Self-Handover
por: Wake, Naoki, et al.
Publicado: (2025)
por: Wake, Naoki, et al.
Publicado: (2025)
VLM-driven Behavior Tree for Context-aware Task Planning
por: Wake, Naoki, et al.
Publicado: (2025)
por: Wake, Naoki, et al.
Publicado: (2025)
GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration
por: Wake, Naoki, et al.
Publicado: (2023)
por: Wake, Naoki, et al.
Publicado: (2023)
Modality-Driven Design for Multi-Step Dexterous Manipulation: Insights from Neuroscience
por: Wake, Naoki, et al.
Publicado: (2024)
por: Wake, Naoki, et al.
Publicado: (2024)
Plan-and-Act using Large Language Models for Interactive Agreement
por: Sasabuchi, Kazuhiro, et al.
Publicado: (2025)
por: Sasabuchi, Kazuhiro, et al.
Publicado: (2025)
IK Seed Generator for Dual-Arm Human-like Physicality Robot with Mobile Base
por: Takamatsu, Jun, et al.
Publicado: (2025)
por: Takamatsu, Jun, et al.
Publicado: (2025)
Agreeing to Interact in Human-Robot Interaction using Large Language Models and Vision Language Models
por: Sasabuchi, Kazuhiro, et al.
Publicado: (2025)
por: Sasabuchi, Kazuhiro, et al.
Publicado: (2025)
RL-Driven Data Generation for Robust Vision-Based Dexterous Grasping
por: Kanehira, Atsushi, et al.
Publicado: (2025)
por: Kanehira, Atsushi, et al.
Publicado: (2025)
Designing Library of Skill-Agents for Hardware-Level Reusability
por: Takamatsu, Jun, et al.
Publicado: (2024)
por: Takamatsu, Jun, et al.
Publicado: (2024)
APriCoT: Action Primitives based on Contact-state Transition for In-Hand Tool Manipulation
por: Saito, Daichi, et al.
Publicado: (2024)
por: Saito, Daichi, et al.
Publicado: (2024)
WoMAP: World Models For Embodied Open-Vocabulary Object Localization
por: Yin, Tenny, et al.
Publicado: (2025)
por: Yin, Tenny, et al.
Publicado: (2025)
HomeRobot: Open-Vocabulary Mobile Manipulation
por: Yenamandra, Sriram, et al.
Publicado: (2023)
por: Yenamandra, Sriram, et al.
Publicado: (2023)
Dynamic Open Vocabulary Enhanced Safe-landing with Intelligence (DOVESEI)
por: Bong, Haechan Mark, et al.
Publicado: (2023)
por: Bong, Haechan Mark, et al.
Publicado: (2023)
OpenObj: Open-Vocabulary Object-Level Neural Radiance Fields with Fine-Grained Understanding
por: Deng, Yinan, et al.
Publicado: (2024)
por: Deng, Yinan, et al.
Publicado: (2024)
EfficientEQA: An Efficient Approach to Open-Vocabulary Embodied Question Answering
por: Cheng, Kai, et al.
Publicado: (2024)
por: Cheng, Kai, et al.
Publicado: (2024)
OpenGraph: Open-Vocabulary Hierarchical 3D Graph Representation in Large-Scale Outdoor Environments
por: Deng, Yinan, et al.
Publicado: (2024)
por: Deng, Yinan, et al.
Publicado: (2024)
FindAnything: Open-Vocabulary and Object-Centric Mapping for Robot Exploration in Any Environment
por: Laina, Sebastián Barbas, et al.
Publicado: (2025)
por: Laina, Sebastián Barbas, et al.
Publicado: (2025)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
por: Li, Yi, et al.
Publicado: (2025)
por: Li, Yi, et al.
Publicado: (2025)
SD-OVON: A Semantics-aware Dataset and Benchmark Generation Pipeline for Open-Vocabulary Object Navigation in Dynamic Scenes
por: Qiu, Dicong, et al.
Publicado: (2025)
por: Qiu, Dicong, et al.
Publicado: (2025)
Point2Graph: An End-to-end Point Cloud-based 3D Open-Vocabulary Scene Graph for Robot Navigation
por: Xu, Yifan, et al.
Publicado: (2024)
por: Xu, Yifan, et al.
Publicado: (2024)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
por: Zheng, Jinliang, et al.
Publicado: (2025)
por: Zheng, Jinliang, et al.
Publicado: (2025)
Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization
por: Hyun, Jeongseok, et al.
Publicado: (2024)
por: Hyun, Jeongseok, et al.
Publicado: (2024)
Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V
por: Zhi, Peiyuan, et al.
Publicado: (2024)
por: Zhi, Peiyuan, et al.
Publicado: (2024)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
por: Wang, Boyang, et al.
Publicado: (2026)
por: Wang, Boyang, et al.
Publicado: (2026)
EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
por: Yang, Zhaoyang, et al.
Publicado: (2026)
por: Yang, Zhaoyang, et al.
Publicado: (2026)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
por: Zhou, Zhongyi, et al.
Publicado: (2025)
por: Zhou, Zhongyi, et al.
Publicado: (2025)
Semantic-Drive: Democratizing Long-Tail Data Curation via Open-Vocabulary Grounding and Neuro-Symbolic VLM Consensus
por: Guillen-Perez, Antonio
Publicado: (2025)
por: Guillen-Perez, Antonio
Publicado: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
por: Li, Zaijing, et al.
Publicado: (2026)
por: Li, Zaijing, et al.
Publicado: (2026)
Recognizing Actions from Robotic View for Natural Human-Robot Interaction
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
Learning to Visually Connect Actions and their Effects
por: Parmar, Paritosh, et al.
Publicado: (2024)
por: Parmar, Paritosh, et al.
Publicado: (2024)
Visual Self-paced Iterative Learning for Unsupervised Temporal Action Localization
por: Hu, Yupeng, et al.
Publicado: (2023)
por: Hu, Yupeng, et al.
Publicado: (2023)
Toward Reliable AR-Guided Surgical Navigation: Interactive Deformation Modeling with Data-Driven Biomechanics and Prompts
por: Han, Zheng, et al.
Publicado: (2025)
por: Han, Zheng, et al.
Publicado: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
por: Tang, Zuojin, et al.
Publicado: (2026)
por: Tang, Zuojin, et al.
Publicado: (2026)
RVN-Bench: A Benchmark for Reactive Visual Navigation
por: Lee, Jaewon, et al.
Publicado: (2026)
por: Lee, Jaewon, et al.
Publicado: (2026)
Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
por: Guo, Jun, et al.
Publicado: (2026)
por: Guo, Jun, et al.
Publicado: (2026)
Mixture of Horizons in Action Chunking
por: Jing, Dong, et al.
Publicado: (2025)
por: Jing, Dong, et al.
Publicado: (2025)
Visual Prompt Discovery via Semantic Exploration
por: Kim, Jaechang, et al.
Publicado: (2026)
por: Kim, Jaechang, et al.
Publicado: (2026)
From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
por: Zhang, Jiajie, et al.
Publicado: (2025)
por: Zhang, Jiajie, et al.
Publicado: (2025)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
por: Wang, Hanzhen, et al.
Publicado: (2025)
por: Wang, Hanzhen, et al.
Publicado: (2025)
Ejemplares similares
-
A Taxonomy of Self-Handover
por: Wake, Naoki, et al.
Publicado: (2025) -
VLM-driven Behavior Tree for Context-aware Task Planning
por: Wake, Naoki, et al.
Publicado: (2025) -
GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration
por: Wake, Naoki, et al.
Publicado: (2023) -
Modality-Driven Design for Multi-Step Dexterous Manipulation: Insights from Neuroscience
por: Wake, Naoki, et al.
Publicado: (2024) -
Plan-and-Act using Large Language Models for Interactive Agreement
por: Sasabuchi, Kazuhiro, et al.
Publicado: (2025)