Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tsagkas, Nikolaos, Rome, Jack, Ramamoorthy, Subramanian, Mac Aodha, Oisin, Lu, Chris Xiaoxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
ZeroGrasp: Zero-Shot Shape Reconstruction Enabled Robotic Grasping
par: Iwase, Shun, et autres
Publié: (2025)
par: Iwase, Shun, et autres
Publié: (2025)
Learning to unfold cloth: Scaling up world models to deformable object manipulation
par: Rome, Jack, et autres
Publié: (2026)
par: Rome, Jack, et autres
Publié: (2026)
Interpretable Text-Guided Image Clustering via Iterative Search
par: Zhao, Bingchen, et autres
Publié: (2025)
par: Zhao, Bingchen, et autres
Publié: (2025)
Representational Similarity via Interpretable Visual Concepts
par: Kondapaneni, Neehar, et autres
Publié: (2025)
par: Kondapaneni, Neehar, et autres
Publié: (2025)
DreamGrasp: Zero-Shot 3D Multi-Object Reconstruction from Partial-View Images for Robotic Manipulation
par: Kim, Young Hun, et autres
Publié: (2025)
par: Kim, Young Hun, et autres
Publié: (2025)
SAOR: Single-View Articulated Object Reconstruction
par: Aygün, Mehmet, et autres
Publié: (2023)
par: Aygün, Mehmet, et autres
Publié: (2023)
GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion
par: Xiang, Enda, et autres
Publié: (2026)
par: Xiang, Enda, et autres
Publié: (2026)
DegustaBot: Zero-Shot Visual Preference Estimation for Personalized Multi-Object Rearrangement
par: Newman, Benjamin A., et autres
Publié: (2024)
par: Newman, Benjamin A., et autres
Publié: (2024)
FastGrasp: Efficient Grasp Synthesis with Diffusion
par: Wu, Xiaofei, et autres
Publié: (2024)
par: Wu, Xiaofei, et autres
Publié: (2024)
Robust 3D Object Detection from LiDAR-Radar Point Clouds via Cross-Modal Feature Augmentation
par: Deng, Jianning, et autres
Publié: (2023)
par: Deng, Jianning, et autres
Publié: (2023)
Improving Semantic Correspondence with Viewpoint-Guided Spherical Maps
par: Mariotti, Octave, et autres
Publié: (2023)
par: Mariotti, Octave, et autres
Publié: (2023)
D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement
par: Wang, Yixuan, et autres
Publié: (2023)
par: Wang, Yixuan, et autres
Publié: (2023)
An Integrated Approach to Robotic Object Grasping and Manipulation
par: Ahmed, Owais, et autres
Publié: (2024)
par: Ahmed, Owais, et autres
Publié: (2024)
RAM: Retrieval-Based Affordance Transfer for Generalizable Zero-Shot Robotic Manipulation
par: Kuang, Yuxuan, et autres
Publié: (2024)
par: Kuang, Yuxuan, et autres
Publié: (2024)
MVSAnywhere: Zero-Shot Multi-View Stereo
par: Izquierdo, Sergio, et autres
Publié: (2025)
par: Izquierdo, Sergio, et autres
Publié: (2025)
NavigateDiff: Visual Predictors are Zero-Shot Navigation Assistants
par: Qin, Yiran, et autres
Publié: (2025)
par: Qin, Yiran, et autres
Publié: (2025)
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
par: Wu, Xiaofei, et autres
Publié: (2026)
par: Wu, Xiaofei, et autres
Publié: (2026)
Online Descriptor Enhancement via Self-Labelling Triplets for Visual Data Association
par: Shaoul, Yorai, et autres
Publié: (2020)
par: Shaoul, Yorai, et autres
Publié: (2020)
NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
par: Li, Hongyu, et autres
Publié: (2025)
par: Li, Hongyu, et autres
Publié: (2025)
Need for Speed: Zero-Shot Depth Completion with Single-Step Diffusion
par: Gregorek, Jakub, et autres
Publié: (2026)
par: Gregorek, Jakub, et autres
Publié: (2026)
SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
par: Sun, Xuefei, et autres
Publié: (2026)
par: Sun, Xuefei, et autres
Publié: (2026)
Zero-Shot 3D Visual Grounding from Vision-Language Models
par: Li, Rong, et autres
Publié: (2025)
par: Li, Rong, et autres
Publié: (2025)
Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation
par: Jiang, Zebin, et autres
Publié: (2025)
par: Jiang, Zebin, et autres
Publié: (2025)
Task-Oriented Human Grasp Synthesis via Context- and Task-Aware Diffusers
par: Liu, An-Lun, et autres
Publié: (2025)
par: Liu, An-Lun, et autres
Publié: (2025)
UnPose: Uncertainty-Guided Diffusion Priors for Zero-Shot Pose Estimation
par: Jiang, Zhaodong, et autres
Publié: (2025)
par: Jiang, Zhaodong, et autres
Publié: (2025)
Graspness Discovery in Clutters for Fast and Accurate Grasp Detection
par: Wang, Chenxi, et autres
Publié: (2024)
par: Wang, Chenxi, et autres
Publié: (2024)
NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning
par: Fu, Jiahui, et autres
Publié: (2026)
par: Fu, Jiahui, et autres
Publié: (2026)
VISC: mmWave Radar Scene Flow Estimation using Pervasive Visual-Inertial Supervision
par: Liu, Kezhong, et autres
Publié: (2025)
par: Liu, Kezhong, et autres
Publié: (2025)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
par: Xu, Runsen, et autres
Publié: (2024)
par: Xu, Runsen, et autres
Publié: (2024)
Monocular One-Shot Metric-Depth Alignment for RGB-Based Robot Grasping
par: Guo, Teng, et autres
Publié: (2025)
par: Guo, Teng, et autres
Publié: (2025)
Robust Bayesian Scene Reconstruction with Retrieval-Augmented Priors for Precise Grasping and Planning
par: Wright, Herbert, et autres
Publié: (2024)
par: Wright, Herbert, et autres
Publié: (2024)
Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols
par: Zeng, Xianchao, et autres
Publié: (2025)
par: Zeng, Xianchao, et autres
Publié: (2025)
Visually-grounded Humanoid Agents
par: Ye, Hang, et autres
Publié: (2026)
par: Ye, Hang, et autres
Publié: (2026)
RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation
par: Yu, Ming-Ming, et autres
Publié: (2025)
par: Yu, Ming-Ming, et autres
Publié: (2025)
TDANet: Target-Directed Attention Network For Object-Goal Visual Navigation With Zero-Shot Ability
par: Lian, Shiwei, et autres
Publié: (2024)
par: Lian, Shiwei, et autres
Publié: (2024)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
par: Li, Rong, et autres
Publié: (2024)
par: Li, Rong, et autres
Publié: (2024)
Less is More: Discovering Concise Network Explanations
par: Kondapaneni, Neehar, et autres
Publié: (2024)
par: Kondapaneni, Neehar, et autres
Publié: (2024)
Documents similaires
-
The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
par: Tsagkas, Nikolaos, et autres
Publié: (2025) -
Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
par: Tsagkas, Nikolaos, et autres
Publié: (2025) -
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
par: Li, Gen, et autres
Publié: (2024) -
ZeroGrasp: Zero-Shot Shape Reconstruction Enabled Robotic Grasping
par: Iwase, Shun, et autres
Publié: (2025) -
Learning to unfold cloth: Scaling up world models to deformable object manipulation
par: Rome, Jack, et autres
Publié: (2026)