Choose What to Observe: Task-Aware Semantic-Geometric Representations for Visuomotor Policy
Fuente:
arXiv
Saved in:
| Main Authors: | Ding, Haoran, Ma, Liang, Yang, Yaxun, Yang, Wen, Liu, Tianyu, Duan, Anqing, Liang, Xiaodan, Song, Dezhen, Laptev, Ivan, Nakamura, Yoshihiko |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference
by: Ding, Haoran, et al.
Published: (2025)
by: Ding, Haoran, et al.
Published: (2025)
3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning
by: Chen, Chenyuan, et al.
Published: (2025)
by: Chen, Chenyuan, et al.
Published: (2025)
Towards Safe Imitation Learning via Potential Field-Guided Flow Matching
by: Ding, Haoran, et al.
Published: (2025)
by: Ding, Haoran, et al.
Published: (2025)
World2Act: Latent Action Post-Training from World Model Dynamics
by: Vuong, An Dinh, et al.
Published: (2026)
by: Vuong, An Dinh, et al.
Published: (2026)
Task-Specified Compliance Bounds for Humanoids via Lipschitz-Constrained Policies
by: He, Zewen, et al.
Published: (2026)
by: He, Zewen, et al.
Published: (2026)
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
by: Ma, Jiahua, et al.
Published: (2026)
by: Ma, Jiahua, et al.
Published: (2026)
Spatial-Temporal Aware Visuomotor Diffusion Policy Learning
by: Liu, Zhenyang, et al.
Published: (2025)
by: Liu, Zhenyang, et al.
Published: (2025)
Fast and Robust Visuomotor Riemannian Flow Matching Policy
by: Ding, Haoran, et al.
Published: (2024)
by: Ding, Haoran, et al.
Published: (2024)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
by: Han, Mingfei, et al.
Published: (2024)
by: Han, Mingfei, et al.
Published: (2024)
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
by: Guo, Minghao, et al.
Published: (2025)
by: Guo, Minghao, et al.
Published: (2025)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
by: Han, Mingfei, et al.
Published: (2026)
by: Han, Mingfei, et al.
Published: (2026)
FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy
by: He, Qian, et al.
Published: (2026)
by: He, Qian, et al.
Published: (2026)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
by: Yang, Tianyu, et al.
Published: (2024)
by: Yang, Tianyu, et al.
Published: (2024)
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
by: Lei, Yuheng, et al.
Published: (2026)
by: Lei, Yuheng, et al.
Published: (2026)
Fast Visuomotor Policy for Robotic Manipulation
by: Jia, Jingkai, et al.
Published: (2025)
by: Jia, Jingkai, et al.
Published: (2025)
Do You Need Proprioceptive States in Visuomotor Policies?
by: Zhao, Juntu, et al.
Published: (2025)
by: Zhao, Juntu, et al.
Published: (2025)
ReEx-SQL: Reasoning with Execution-Aware Reinforcement Learning for Text-to-SQL
by: Dai, Yaxun, et al.
Published: (2025)
by: Dai, Yaxun, et al.
Published: (2025)
Embodied Visuomotor Representation
by: Burner, Levi, et al.
Published: (2024)
by: Burner, Levi, et al.
Published: (2024)
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
by: Cai, Shaofei, et al.
Published: (2025)
by: Cai, Shaofei, et al.
Published: (2025)
Out-of-Distribution Recovery with Object-Centric Keypoint Inverse Policy for Visuomotor Imitation Learning
by: Gao, George Jiayuan, et al.
Published: (2024)
by: Gao, George Jiayuan, et al.
Published: (2024)
History-Aware Visuomotor Policy Learning via Point Tracking
by: Chen, Jingjing, et al.
Published: (2025)
by: Chen, Jingjing, et al.
Published: (2025)
Adaptive Policy Learning to Additional Tasks
by: Hao, Wenjian, et al.
Published: (2023)
by: Hao, Wenjian, et al.
Published: (2023)
FreqPolicy: Frequency Autoregressive Visuomotor Policy with Continuous Tokens
by: Zhong, Yiming, et al.
Published: (2025)
by: Zhong, Yiming, et al.
Published: (2025)
Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents
by: Cai, Shaofei, et al.
Published: (2025)
by: Cai, Shaofei, et al.
Published: (2025)
GAP: Geometric Anchor Pre-training for Data-Efficient Visuomotor Learning of Manipulation Tasks
by: Buoso, Davide, et al.
Published: (2026)
by: Buoso, Davide, et al.
Published: (2026)
AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies
by: Dai, Yinpei, et al.
Published: (2025)
by: Dai, Yinpei, et al.
Published: (2025)
A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots
by: Ruan, Daniel, et al.
Published: (2026)
by: Ruan, Daniel, et al.
Published: (2026)
Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation
by: Zhao, Yinuo, et al.
Published: (2024)
by: Zhao, Yinuo, et al.
Published: (2024)
UMI-on-Air: Embodiment-Aware Guidance for Embodiment-Agnostic Visuomotor Policies
by: Gupta, Harsh, et al.
Published: (2025)
by: Gupta, Harsh, et al.
Published: (2025)
SAGE: Semantic-Aware Shared Sampling for Efficient Diffusion
by: Zhao, Haoran, et al.
Published: (2025)
by: Zhao, Haoran, et al.
Published: (2025)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
by: Liang, Junbang, et al.
Published: (2024)
by: Liang, Junbang, et al.
Published: (2024)
CaesarNeRF: Calibrated Semantic Representation for Few-shot Generalizable Neural Rendering
by: Zhu, Haidong, et al.
Published: (2023)
by: Zhu, Haidong, et al.
Published: (2023)
FLASH: Efficient Visuomotor Policy via Sparse Sampling
by: Bai, Jiaqi, et al.
Published: (2026)
by: Bai, Jiaqi, et al.
Published: (2026)
KineDex: Learning Tactile-Informed Visuomotor Policies via Kinesthetic Teaching for Dexterous Manipulation
by: Zhang, Di, et al.
Published: (2025)
by: Zhang, Di, et al.
Published: (2025)
The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
by: Tsagkas, Nikolaos, et al.
Published: (2025)
by: Tsagkas, Nikolaos, et al.
Published: (2025)
Falcon: Fast Visuomotor Policies via Partial Denoising
by: Chen, Haojun, et al.
Published: (2025)
by: Chen, Haojun, et al.
Published: (2025)
Task-oriented Time Series Imputation Evaluation via Generalized Representers
by: Wang, Zhixian, et al.
Published: (2024)
by: Wang, Zhixian, et al.
Published: (2024)
Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning
by: Liu, Yijun, et al.
Published: (2025)
by: Liu, Yijun, et al.
Published: (2025)
RASTP: Representation-Aware Semantic Token Pruning for Generative Recommendation with Semantic Identifiers
by: Zhan, Tianyu, et al.
Published: (2025)
by: Zhan, Tianyu, et al.
Published: (2025)
SUGAR: Pre-training 3D Visual Representations for Robotics
by: Chen, Shizhe, et al.
Published: (2024)
by: Chen, Shizhe, et al.
Published: (2024)
Similar Items
-
Imagination at Inference: Synthesizing In-Hand Views for Robust Visuomotor Policy Inference
by: Ding, Haoran, et al.
Published: (2025) -
3D-CovDiffusion: 3D-Aware Diffusion Policy for Coverage Path Planning
by: Chen, Chenyuan, et al.
Published: (2025) -
Towards Safe Imitation Learning via Potential Field-Guided Flow Matching
by: Ding, Haoran, et al.
Published: (2025) -
World2Act: Latent Action Post-Training from World Model Dynamics
by: Vuong, An Dinh, et al.
Published: (2026) -
Task-Specified Compliance Bounds for Humanoids via Lipschitz-Constrained Policies
by: He, Zewen, et al.
Published: (2026)