Towards Unified Interactive Visual Grounding in The Wild
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Jie, Zhang, Hanbo, Si, Qingyi, Li, Yifeng, Lan, Xuguang, Kong, Tao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction
par: Xu, Jie, et autres
Publié: (2024)
par: Xu, Jie, et autres
Publié: (2024)
INVIGORATE: Interactive Visual Grounding and Grasping in Clutter
par: Zhang, Hanbo, et autres
Publié: (2021)
par: Zhang, Hanbo, et autres
Publié: (2021)
DexDiff: Towards Extrinsic Dexterity Manipulation of Ungraspable Objects in Unrestricted Environments
par: Ma, Chengzhong, et autres
Publié: (2024)
par: Ma, Chengzhong, et autres
Publié: (2024)
REGNet V2: End-to-End REgion-based Grasp Detection Network for Grippers of Different Sizes in Point Clouds
par: Zhao, Binglei, et autres
Publié: (2024)
par: Zhao, Binglei, et autres
Publié: (2024)
Event-Based Visual Odometry on Non-Holonomic Ground Vehicles
par: Xu, Wanting, et autres
Publié: (2024)
par: Xu, Wanting, et autres
Publié: (2024)
Towards Robust Sensor-Fusion Ground SLAM: A Comprehensive Benchmark and A Resilient Framework
par: Zhang, Deteng, et autres
Publié: (2025)
par: Zhang, Deteng, et autres
Publié: (2025)
LLM-GROP: Visually Grounded Robot Task and Motion Planning with Large Language Models
par: Zhang, Xiaohan, et autres
Publié: (2025)
par: Zhang, Xiaohan, et autres
Publié: (2025)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
par: Li, Rong, et autres
Publié: (2024)
par: Li, Rong, et autres
Publié: (2024)
OmniUMI: Towards Physically Grounded Robot Learning via Human-Aligned Multimodal Interaction
par: Luo, Shaqi, et autres
Publié: (2026)
par: Luo, Shaqi, et autres
Publié: (2026)
Grounding 3D Object Affordance with Language Instructions, Visual Observations and Interactions
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding
par: Su, Yuejiao, et autres
Publié: (2026)
par: Su, Yuejiao, et autres
Publié: (2026)
Scaling World Model for Hierarchical Manipulation Policies
par: Long, Qian, et autres
Publié: (2026)
par: Long, Qian, et autres
Publié: (2026)
InfiniteWorld: A Unified Scalable Simulation Framework for General Visual-Language Robot Interaction
par: Ren, Pengzhen, et autres
Publié: (2024)
par: Ren, Pengzhen, et autres
Publié: (2024)
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
par: Luo, Hao, et autres
Publié: (2026)
par: Luo, Hao, et autres
Publié: (2026)
PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation
par: Zhang, Xu, et autres
Publié: (2023)
par: Zhang, Xu, et autres
Publié: (2023)
Towards Long-term Robotics in the Wild
par: Hausler, Stephen, et autres
Publié: (2024)
par: Hausler, Stephen, et autres
Publié: (2024)
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
par: Cheang, Chi-Lam, et autres
Publié: (2024)
par: Cheang, Chi-Lam, et autres
Publié: (2024)
Toward Reliable Sim-to-Real Predictability for MoE-based Robust Quadrupedal Locomotion
par: Wu, Tianyang, et autres
Publié: (2026)
par: Wu, Tianyang, et autres
Publié: (2026)
TrackVLA: Embodied Visual Tracking in the Wild
par: Wang, Shaoan, et autres
Publié: (2025)
par: Wang, Shaoan, et autres
Publié: (2025)
Vision-Language Foundation Models as Effective Robot Imitators
par: Li, Xinghang, et autres
Publié: (2023)
par: Li, Xinghang, et autres
Publié: (2023)
Spatially Grounded Long-Horizon Task Planning in the Wild
par: Jung, Sehun, et autres
Publié: (2026)
par: Jung, Sehun, et autres
Publié: (2026)
Visibility-Aware Mobile Grasping in Dynamic Environments
par: Hu, Tianrun, et autres
Publié: (2026)
par: Hu, Tianrun, et autres
Publié: (2026)
MAGIC-VFM: Meta-learning Adaptation for Ground Interaction Control with Visual Foundation Models
par: Lupu, Elena Sorina, et autres
Publié: (2024)
par: Lupu, Elena Sorina, et autres
Publié: (2024)
Zero-Shot 3D Visual Grounding from Vision-Language Models
par: Li, Rong, et autres
Publié: (2025)
par: Li, Rong, et autres
Publié: (2025)
GroundSLAM: A Robust Visual SLAM System for Warehouse Robots Using Ground Textures
par: Xu, Kuan, et autres
Publié: (2017)
par: Xu, Kuan, et autres
Publié: (2017)
Visual Grounding from Event Cameras
par: Kong, Lingdong, et autres
Publié: (2025)
par: Kong, Lingdong, et autres
Publié: (2025)
DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies
par: Tao, Tony, et autres
Publié: (2025)
par: Tao, Tony, et autres
Publié: (2025)
DexFlow: A Unified Approach for Dexterous Hand Pose Retargeting and Interaction
par: Lin, Xiaoyi, et autres
Publié: (2025)
par: Lin, Xiaoyi, et autres
Publié: (2025)
NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Agent Motion Planning
par: Chen, Qingyi, et autres
Publié: (2025)
par: Chen, Qingyi, et autres
Publié: (2025)
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
par: Dong, Yifei, et autres
Publié: (2025)
par: Dong, Yifei, et autres
Publié: (2025)
Navigating the Wild: Pareto-Optimal Visual Decision-Making in Image Space
par: Pushp, Durgakant, et autres
Publié: (2025)
par: Pushp, Durgakant, et autres
Publié: (2025)
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
par: Sun, Xiaolou, et autres
Publié: (2026)
par: Sun, Xiaolou, et autres
Publié: (2026)
Bridging Simulation and Reality: Cross-Domain Transfer with Semantic 2D Gaussian Splatting
par: Tang, Jian, et autres
Publié: (2025)
par: Tang, Jian, et autres
Publié: (2025)
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
par: Zhang, Jiaxi, et autres
Publié: (2026)
par: Zhang, Jiaxi, et autres
Publié: (2026)
BEVPlace++: Fast, Robust, and Lightweight LiDAR Global Localization for Unmanned Ground Vehicles
par: Luo, Lun, et autres
Publié: (2024)
par: Luo, Lun, et autres
Publié: (2024)
MetAdv: A Unified and Interactive Adversarial Testing Platform for Autonomous Driving
par: Liu, Aishan, et autres
Publié: (2025)
par: Liu, Aishan, et autres
Publié: (2025)
iTeach: In the Wild Interactive Teaching for Failure-Driven Adaptation of Robot Perception
par: P, Jishnu Jaykumar, et autres
Publié: (2024)
par: P, Jishnu Jaykumar, et autres
Publié: (2024)
Ground-Fusion: A Low-cost Ground SLAM System Robust to Corner Cases
par: Yin, Jie, et autres
Publié: (2024)
par: Yin, Jie, et autres
Publié: (2024)
Bootstrapped Model Predictive Control
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
Documents similaires
-
SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction
par: Xu, Jie, et autres
Publié: (2024) -
INVIGORATE: Interactive Visual Grounding and Grasping in Clutter
par: Zhang, Hanbo, et autres
Publié: (2021) -
DexDiff: Towards Extrinsic Dexterity Manipulation of Ungraspable Objects in Unrestricted Environments
par: Ma, Chengzhong, et autres
Publié: (2024) -
REGNet V2: End-to-End REgion-based Grasp Detection Network for Grippers of Different Sizes in Point Clouds
par: Zhao, Binglei, et autres
Publié: (2024) -
Event-Based Visual Odometry on Non-Holonomic Ground Vehicles
par: Xu, Wanting, et autres
Publié: (2024)