The Temporal Trap: Entanglement in Pre-Trained Visual Representations for Visuomotor Policy Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tsagkas, Nikolaos, Sochopoulos, Andreas, Danier, Duolikun, Lu, Chris Xiaoxuan, Mac Aodha, Oisin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
par: Tsagkas, Nikolaos, et autres
Publié: (2025)
Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors
par: Tsagkas, Nikolaos, et autres
Publié: (2024)
par: Tsagkas, Nikolaos, et autres
Publié: (2024)
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models
par: Danier, Duolikun, et autres
Publié: (2024)
par: Danier, Duolikun, et autres
Publié: (2024)
Fast Flow-based Visuomotor Policies via Conditional Optimal Transport Couplings
par: Sochopoulos, Andreas, et autres
Publié: (2025)
par: Sochopoulos, Andreas, et autres
Publié: (2025)
View-Consistent Diffusion Representations for 3D-Consistent Video Generation
par: Danier, Duolikun, et autres
Publié: (2025)
par: Danier, Duolikun, et autres
Publié: (2025)
Bridging the Sim2Real Gap: Vision Encoder Pre-Training for Visuomotor Policy Transfer
par: Yardi, Yash, et autres
Publié: (2025)
par: Yardi, Yash, et autres
Publié: (2025)
Representational Similarity via Interpretable Visual Concepts
par: Kondapaneni, Neehar, et autres
Publié: (2025)
par: Kondapaneni, Neehar, et autres
Publié: (2025)
DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning
par: Egbe, ThankGod, et autres
Publié: (2025)
par: Egbe, ThankGod, et autres
Publié: (2025)
ST-MFNet: A Spatio-Temporal Multi-Flow Network for Frame Interpolation
par: Danier, Duolikun, et autres
Publié: (2021)
par: Danier, Duolikun, et autres
Publié: (2021)
Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation
par: Zhao, Yinuo, et autres
Publié: (2024)
par: Zhao, Yinuo, et autres
Publié: (2024)
SAOR: Single-View Articulated Object Reconstruction
par: Aygün, Mehmet, et autres
Publié: (2023)
par: Aygün, Mehmet, et autres
Publié: (2023)
Interpretable Text-Guided Image Clustering via Iterative Search
par: Zhao, Bingchen, et autres
Publié: (2025)
par: Zhao, Bingchen, et autres
Publié: (2025)
Fast Visuomotor Policy for Robotic Manipulation
par: Jia, Jingkai, et autres
Publié: (2025)
par: Jia, Jingkai, et autres
Publié: (2025)
Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation
par: Ma, Jiahua, et autres
Publié: (2026)
par: Ma, Jiahua, et autres
Publié: (2026)
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
par: Ze, Yanjie, et autres
Publié: (2024)
par: Ze, Yanjie, et autres
Publié: (2024)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
par: Liang, Junbang, et autres
Publié: (2024)
par: Liang, Junbang, et autres
Publié: (2024)
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
par: Gong, Zhefei, et autres
Publié: (2024)
par: Gong, Zhefei, et autres
Publié: (2024)
Representational Difference Explanations
par: Kondapaneni, Neehar, et autres
Publié: (2025)
par: Kondapaneni, Neehar, et autres
Publié: (2025)
H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
par: Lu, Yiyang, et autres
Publié: (2025)
par: Lu, Yiyang, et autres
Publié: (2025)
CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion
par: Ma, Jiahua, et autres
Publié: (2025)
par: Ma, Jiahua, et autres
Publié: (2025)
FLASH: Efficient Visuomotor Policy via Sparse Sampling
par: Bai, Jiaqi, et autres
Publié: (2026)
par: Bai, Jiaqi, et autres
Publié: (2026)
Learning Precise Affordances from Egocentric Videos for Robotic Manipulation
par: Li, Gen, et autres
Publié: (2024)
par: Li, Gen, et autres
Publié: (2024)
Learning Predictive Visuomotor Coordination
par: Jia, Wenqi, et autres
Publié: (2025)
par: Jia, Wenqi, et autres
Publié: (2025)
Enhancing 2D Representation Learning with a 3D Prior
par: Aygün, Mehmet, et autres
Publié: (2024)
par: Aygün, Mehmet, et autres
Publié: (2024)
FreqPolicy: Frequency Autoregressive Visuomotor Policy with Continuous Tokens
par: Zhong, Yiming, et autres
Publié: (2025)
par: Zhong, Yiming, et autres
Publié: (2025)
BVI-VFI: A Video Quality Database for Video Frame Interpolation
par: Danier, Duolikun, et autres
Publié: (2022)
par: Danier, Duolikun, et autres
Publié: (2022)
Enhancing Deformable Convolution based Video Frame Interpolation with Coarse-to-fine 3D CNN
par: Danier, Duolikun, et autres
Publié: (2022)
par: Danier, Duolikun, et autres
Publié: (2022)
LDMVFI: Video Frame Interpolation with Latent Diffusion Models
par: Danier, Duolikun, et autres
Publié: (2023)
par: Danier, Duolikun, et autres
Publié: (2023)
A Subjective Quality Study for Video Frame Interpolation
par: Danier, Duolikun, et autres
Publié: (2022)
par: Danier, Duolikun, et autres
Publié: (2022)
Improving Semantic Correspondence with Viewpoint-Guided Spherical Maps
par: Mariotti, Octave, et autres
Publié: (2023)
par: Mariotti, Octave, et autres
Publié: (2023)
ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning
par: Tian, Yufeng, et autres
Publié: (2026)
par: Tian, Yufeng, et autres
Publié: (2026)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
par: Hu, Yucheng, et autres
Publié: (2024)
par: Hu, Yucheng, et autres
Publié: (2024)
Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation
par: Ren, Hao, et autres
Publié: (2026)
par: Ren, Hao, et autres
Publié: (2026)
Robust 3D Object Detection from LiDAR-Radar Point Clouds via Cross-Modal Feature Augmentation
par: Deng, Jianning, et autres
Publié: (2023)
par: Deng, Jianning, et autres
Publié: (2023)
Adapting by Analogy: OOD Generalization of Visuomotor Policies via Functional Correspondence
par: Gupta, Pranay, et autres
Publié: (2025)
par: Gupta, Pranay, et autres
Publié: (2025)
Beyond the Patch: Exploring Vulnerabilities of Visuomotor Policies via Viewpoint-Consistent 3D Adversarial Object
par: Lee, Chanmi, et autres
Publié: (2026)
par: Lee, Chanmi, et autres
Publié: (2026)
VISC: mmWave Radar Scene Flow Estimation using Pervasive Visual-Inertial Supervision
par: Liu, Kezhong, et autres
Publié: (2025)
par: Liu, Kezhong, et autres
Publié: (2025)
Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
Visually-grounded Humanoid Agents
par: Ye, Hang, et autres
Publié: (2026)
par: Ye, Hang, et autres
Publié: (2026)
Documents similaires
-
Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
par: Tsagkas, Nikolaos, et autres
Publié: (2025) -
Click to Grasp: Zero-Shot Precise Manipulation via Visual Diffusion Descriptors
par: Tsagkas, Nikolaos, et autres
Publié: (2024) -
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models
par: Danier, Duolikun, et autres
Publié: (2024) -
Fast Flow-based Visuomotor Policies via Conditional Optimal Transport Couplings
par: Sochopoulos, Andreas, et autres
Publié: (2025) -
View-Consistent Diffusion Representations for 3D-Consistent Video Generation
par: Danier, Duolikun, et autres
Publié: (2025)