CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Liudi, Bai, Yang, Eskandar, George, Shen, Fengyi, Altillawi, Mohammad, Chen, Dong, Liu, Ziyuan, Valada, Abhinav |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
by: Yang, Liudi, et al.
Published: (2026)
by: Yang, Liudi, et al.
Published: (2026)
RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation
by: Yang, Liudi, et al.
Published: (2025)
by: Yang, Liudi, et al.
Published: (2025)
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
by: Eskandar, George, et al.
Published: (2026)
by: Eskandar, George, et al.
Published: (2026)
RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping
by: Bai, Yang, et al.
Published: (2025)
by: Bai, Yang, et al.
Published: (2025)
DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos
by: Bai, Yang, et al.
Published: (2025)
by: Bai, Yang, et al.
Published: (2025)
CE-NPBG: Connectivity Enhanced Neural Point-Based Graphics for Novel View Synthesis in Autonomous Driving Scenes
by: Altillawi, Mohammad, et al.
Published: (2025)
by: Altillawi, Mohammad, et al.
Published: (2025)
ConsistentDreamer: View-Consistent Meshes Through Balanced Multi-View Gaussian Optimization
by: Şahin, Onat, et al.
Published: (2025)
by: Şahin, Onat, et al.
Published: (2025)
Physics-Informed Video Diffusion For Shallow Water Equations
by: Bai, Yang, et al.
Published: (2026)
by: Bai, Yang, et al.
Published: (2026)
ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries
by: Li, Hang, et al.
Published: (2026)
by: Li, Hang, et al.
Published: (2026)
Task-Driven Co-Design of Mobile Manipulators
by: Schneider, Raphael, et al.
Published: (2024)
by: Schneider, Raphael, et al.
Published: (2024)
Lifelong 3D Mapping Framework for Hand-held & Robot-mounted LiDAR Mapping Systems
by: Yang, Liudi, et al.
Published: (2025)
by: Yang, Liudi, et al.
Published: (2025)
MSG: Multi-Stream Generative Policies for Sample-Efficient Robotic Manipulation
by: von Hartz, Jan Ole, et al.
Published: (2025)
by: von Hartz, Jan Ole, et al.
Published: (2025)
ParkDiffusion: Heterogeneous Multi-Agent Multi-Modal Trajectory Prediction for Automated Parking using Diffusion Models
by: Wei, Jiarong, et al.
Published: (2025)
by: Wei, Jiarong, et al.
Published: (2025)
LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers
by: Schmidt, Fabian, et al.
Published: (2026)
by: Schmidt, Fabian, et al.
Published: (2026)
Semantic Scene Segmentation for Robotics
by: Hurtado, Juana Valeria, et al.
Published: (2024)
by: Hurtado, Juana Valeria, et al.
Published: (2024)
Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
by: Hu, Yuxuan, et al.
Published: (2026)
by: Hu, Yuxuan, et al.
Published: (2026)
Imagine2touch: Predictive Tactile Sensing for Robotic Manipulation using Efficient Low-Dimensional Signals
by: Ayad, Abdallah, et al.
Published: (2024)
by: Ayad, Abdallah, et al.
Published: (2024)
Bayesian Optimization for Sample-Efficient Policy Improvement in Robotic Manipulation
by: Röfer, Adrian, et al.
Published: (2024)
by: Röfer, Adrian, et al.
Published: (2024)
CoDEPS: Online Continual Learning for Depth Estimation and Panoptic Segmentation
by: Vödisch, Niclas, et al.
Published: (2023)
by: Vödisch, Niclas, et al.
Published: (2023)
Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving
by: Mayank, Mayank, et al.
Published: (2026)
by: Mayank, Mayank, et al.
Published: (2026)
Progressive Multi-Modal Fusion for Robust 3D Object Detection
by: Mohan, Rohit, et al.
Published: (2024)
by: Mohan, Rohit, et al.
Published: (2024)
PseudoTouch: Efficiently Imaging the Surface Feel of Objects for Robotic Manipulation
by: Röfer, Adrian, et al.
Published: (2024)
by: Röfer, Adrian, et al.
Published: (2024)
Evidential Uncertainty Estimation for Multi-Modal Trajectory Prediction
by: Marvi, Sajad, et al.
Published: (2025)
by: Marvi, Sajad, et al.
Published: (2025)
ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models
by: Wei, Jiarong, et al.
Published: (2026)
by: Wei, Jiarong, et al.
Published: (2026)
The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search
by: Somaschini, Gabriele, et al.
Published: (2026)
by: Somaschini, Gabriele, et al.
Published: (2026)
Learning Robotic Manipulation Policies from Point Clouds with Conditional Flow Matching
by: Chisari, Eugenio, et al.
Published: (2024)
by: Chisari, Eugenio, et al.
Published: (2024)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
by: Rasheed, Hanoona, et al.
Published: (2025)
by: Rasheed, Hanoona, et al.
Published: (2025)
Lightweight Learning from Actuation-Space Demonstrations via Flow Matching for Whole-Body Soft Robotic Grasping
by: Yang, Liudi, et al.
Published: (2025)
by: Yang, Liudi, et al.
Published: (2025)
CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
by: Fang, Fengyi, et al.
Published: (2025)
by: Fang, Fengyi, et al.
Published: (2025)
Robotic Task Ambiguity Resolution via Natural Language Interaction
by: Chisari, Eugenio, et al.
Published: (2025)
by: Chisari, Eugenio, et al.
Published: (2025)
CMRNext: Camera to LiDAR Matching in the Wild for Localization and Extrinsic Calibration
by: Cattaneo, Daniele, et al.
Published: (2024)
by: Cattaneo, Daniele, et al.
Published: (2024)
Online Estimation and Manipulation of Articulated Objects
by: Buchanan, Russell, et al.
Published: (2026)
by: Buchanan, Russell, et al.
Published: (2026)
CoCoDiff: Diversifying Skeleton Action Features via Coarse-Fine Text-Co-Guided Latent Diffusion
by: Zhao, Zhifu, et al.
Published: (2025)
by: Zhao, Zhifu, et al.
Published: (2025)
CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation
by: Songwei, Wu, et al.
Published: (2026)
by: Songwei, Wu, et al.
Published: (2026)
Diffusion map particle systems for generative modeling
by: Li, Fengyi, et al.
Published: (2023)
by: Li, Fengyi, et al.
Published: (2023)
Preference-Based Long-Horizon Robotic Stacking with Multimodal Large Language Models
by: Yu, Wanming, et al.
Published: (2025)
by: Yu, Wanming, et al.
Published: (2025)
Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution
by: Shi, Guoxin, et al.
Published: (2026)
by: Shi, Guoxin, et al.
Published: (2026)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
by: Hayakawa, Akio, et al.
Published: (2024)
by: Hayakawa, Akio, et al.
Published: (2024)
Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition
by: Liu, Jinfu, et al.
Published: (2024)
by: Liu, Jinfu, et al.
Published: (2024)
Language-Grounded Dynamic Scene Graphs for Interactive Object Search with Mobile Manipulation
by: Honerkamp, Daniel, et al.
Published: (2024)
by: Honerkamp, Daniel, et al.
Published: (2024)
Similar Items
-
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
by: Yang, Liudi, et al.
Published: (2026) -
RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation
by: Yang, Liudi, et al.
Published: (2025) -
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
by: Eskandar, George, et al.
Published: (2026) -
RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping
by: Bai, Yang, et al.
Published: (2025) -
DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos
by: Bai, Yang, et al.
Published: (2025)