Pixel Motion as Universal Representation for Robot Control
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ranasinghe, Kanchana, Li, Xiang, Nguyen, E-Ro, Mata, Cristina, Park, Jongwoo, Ryoo, Michael S |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pixel Motion Diffusion is What We Need for Robot Control
par: Nguyen, E-Ro, et autres
Publié: (2025)
par: Nguyen, E-Ro, et autres
Publié: (2025)
Language Repository for Long Video Understanding
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
par: Mata, Cristina, et autres
Publié: (2025)
par: Mata, Cristina, et autres
Publié: (2025)
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
par: Park, Jongwoo, et autres
Publié: (2024)
par: Park, Jongwoo, et autres
Publié: (2024)
Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
par: Fang, Yu, et autres
Publié: (2025)
par: Fang, Yu, et autres
Publié: (2025)
Understanding Long Videos with Multimodal Language Models
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance
par: Park, Jongwoo, et autres
Publié: (2026)
par: Park, Jongwoo, et autres
Publié: (2026)
SMF-VO: Direct Ego-Motion Estimation via Sparse Motion Fields
par: Yang, Sangheon, et autres
Publié: (2025)
par: Yang, Sangheon, et autres
Publié: (2025)
Universal Humanoid Motion Representations for Physics-Based Control
par: Luo, Zhengyi, et autres
Publié: (2023)
par: Luo, Zhengyi, et autres
Publié: (2023)
Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
RoboGrasp: A Universal Grasping Policy for Robust Robotic Control
par: Huang, Yiqi, et autres
Publié: (2025)
par: Huang, Yiqi, et autres
Publié: (2025)
Future Optical Flow Prediction Improves Robot Control & Video Generation
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
par: Liu, Mingyu, et autres
Publié: (2025)
par: Liu, Mingyu, et autres
Publié: (2025)
Grasp-and-Lift: Executable 3D Hand-Object Interaction Reconstruction via Physics-in-the-Loop Optimization
par: Choi, Byeonggyeol, et autres
Publié: (2026)
par: Choi, Byeonggyeol, et autres
Publié: (2026)
FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation
par: Guo, Jun, et autres
Publié: (2025)
par: Guo, Jun, et autres
Publié: (2025)
MambaGlue: Fast and Robust Local Feature Matching With Mamba
par: Ryoo, Kihwan, et autres
Publié: (2025)
par: Ryoo, Kihwan, et autres
Publié: (2025)
SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation
par: Hanyu, Taisei, et autres
Publié: (2025)
par: Hanyu, Taisei, et autres
Publié: (2025)
Camera Calibration via Circular Patterns: A Comprehensive Framework with Detection Uncertainty and Unbiased Projection Model
par: Song, Chaehyeon, et autres
Publié: (2025)
par: Song, Chaehyeon, et autres
Publié: (2025)
Image Translation with Kernel Prediction Networks for Semantic Segmentation
par: Mata, Cristina, et autres
Publié: (2025)
par: Mata, Cristina, et autres
Publié: (2025)
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
par: Bao, Muyi, et autres
Publié: (2026)
par: Bao, Muyi, et autres
Publié: (2026)
CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control
par: Shi, Jiaqi, et autres
Publié: (2026)
par: Shi, Jiaqi, et autres
Publié: (2026)
Pixel-wise Smoothing for Certified Robustness against Camera Motion Perturbations
par: Hu, Hanjiang, et autres
Publié: (2023)
par: Hu, Hanjiang, et autres
Publié: (2023)
UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
Radar and Event Camera Fusion for Agile Robot Ego-Motion Estimation
par: Lyu, Yang, et autres
Publié: (2025)
par: Lyu, Yang, et autres
Publié: (2025)
Disentangled Object-Centric Image Representation for Robotic Manipulation
par: Emukpere, David, et autres
Publié: (2025)
par: Emukpere, David, et autres
Publié: (2025)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
par: Chai, Ying, et autres
Publié: (2025)
par: Chai, Ying, et autres
Publié: (2025)
Spatial RoboGrasp: Generalized Robotic Grasping Control Policy
par: Huang, Yiqi, et autres
Publié: (2025)
par: Huang, Yiqi, et autres
Publié: (2025)
ARC-Calib: Autonomous Markerless Camera-to-Robot Calibration via Exploratory Robot Motions
par: Chanrungmaneekul, Podshara, et autres
Publié: (2025)
par: Chanrungmaneekul, Podshara, et autres
Publié: (2025)
LatentCRF: Continuous CRF for Efficient Latent Diffusion
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
par: Liang, Wenqi, et autres
Publié: (2025)
par: Liang, Wenqi, et autres
Publié: (2025)
MotionBits: Video Segmentation through Motion-Level Analysis of Rigid Bodies
par: Qian, Howard H., et autres
Publié: (2026)
par: Qian, Howard H., et autres
Publié: (2026)
Latent Representations for Visual Proprioception in Inexpensive Robots
par: Sheikholeslami, Sahara, et autres
Publié: (2025)
par: Sheikholeslami, Sahara, et autres
Publié: (2025)
DiffPixelFormer: Differential Pixel-Aware Transformer for RGB-D Indoor Scene Segmentation
par: Gong, Yan, et autres
Publié: (2025)
par: Gong, Yan, et autres
Publié: (2025)
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
par: Nguyen, Nghia, et autres
Publié: (2024)
par: Nguyen, Nghia, et autres
Publié: (2024)
Causal World Modeling for Robot Control
par: Li, Lin, et autres
Publié: (2026)
par: Li, Lin, et autres
Publié: (2026)
Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
par: Ma, Junyi, et autres
Publié: (2025)
par: Ma, Junyi, et autres
Publié: (2025)
From Motion to Behavior: Hierarchical Modeling of Humanoid Generative Behavior Control
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Kimodo: Scaling Controllable Human Motion Generation
par: Rempe, Davis, et autres
Publié: (2026)
par: Rempe, Davis, et autres
Publié: (2026)
Documents similaires
-
Pixel Motion Diffusion is What We Need for Robot Control
par: Nguyen, E-Ro, et autres
Publié: (2025) -
Language Repository for Long Video Understanding
par: Kahatapitiya, Kumara, et autres
Publié: (2024) -
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
par: Mata, Cristina, et autres
Publié: (2025) -
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
par: Li, Xiang, et autres
Publié: (2024) -
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
par: Park, Jongwoo, et autres
Publié: (2024)