MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiaxu, Jiang, Yicheng, He, Tianlun, Sun, Jingkai, Zhang, Qiang, He, Junhao, Cao, Jiahang, Gan, Zesen, Sun, Mingyuan, Shao, Qiming, Yue, Xiangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation
par: Jiang, Yicheng, et autres
Publié: (2026)
par: Jiang, Yicheng, et autres
Publié: (2026)
DEL: Discrete Element Learner for Learning 3D Particle Dynamics with Neural Rendering
par: Wang, Jiaxu, et autres
Publié: (2024)
par: Wang, Jiaxu, et autres
Publié: (2024)
DEGS: Deformable Event-based 3D Gaussian Splatting from RGB and Event Stream
par: He, Junhao, et autres
Publié: (2025)
par: He, Junhao, et autres
Publié: (2025)
Event Masked Autoencoder: Point-wise Action Recognition with Event-Based Cameras
par: Sun, Jingkai, et autres
Publié: (2025)
par: Sun, Jingkai, et autres
Publié: (2025)
EvGGS: A Collaborative Learning Framework for Event-based Generalizable Gaussian Splatting
par: Wang, Jiaxu, et autres
Publié: (2024)
par: Wang, Jiaxu, et autres
Publié: (2024)
Query-based Semantic Gaussian Field for Scene Representation in Reinforcement Learning
par: Wang, Jiaxu, et autres
Publié: (2024)
par: Wang, Jiaxu, et autres
Publié: (2024)
MoSA: Motion-constrained Stress Adaptation for Mitigating Real-to-Sim Gap in Continuum Dynamics via Learning Residual Anisotropy
par: Wang, Jiaxu, et autres
Publié: (2026)
par: Wang, Jiaxu, et autres
Publié: (2026)
Trinity: A Modular Humanoid Robot AI System
par: Sun, Jingkai, et autres
Publié: (2025)
par: Sun, Jingkai, et autres
Publié: (2025)
Distillation-PPO: A Novel Two-Stage Reinforcement Learning Framework for Humanoid Robot Perceptive Locomotion
par: Zhang, Qiang, et autres
Publié: (2025)
par: Zhang, Qiang, et autres
Publié: (2025)
Fully Spiking Neural Network for Legged Robots
par: Jiang, Xiaoyang, et autres
Publié: (2023)
par: Jiang, Xiaoyang, et autres
Publié: (2023)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
par: Chai, Ying, et autres
Publié: (2025)
par: Chai, Ying, et autres
Publié: (2025)
WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation
par: Qian, Zezhong, et autres
Publié: (2025)
par: Qian, Zezhong, et autres
Publié: (2025)
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
par: Li, Wei, et autres
Publié: (2026)
par: Li, Wei, et autres
Publié: (2026)
DPL: Depth-only Perceptive Humanoid Locomotion via Realistic Depth Synthesis and Cross-Attention Terrain Reconstruction
par: Sun, Jingkai, et autres
Publié: (2025)
par: Sun, Jingkai, et autres
Publié: (2025)
Occupancy World Model for Robots
par: Zhang, Zhang, et autres
Publié: (2025)
par: Zhang, Zhang, et autres
Publié: (2025)
LiPS: Large-Scale Humanoid Robot Reinforcement Learning with Parallel-Series Structures
par: Zhang, Qiang, et autres
Publié: (2025)
par: Zhang, Qiang, et autres
Publié: (2025)
RealD$^2$iff: Bridging Real-World Gap in Robot Manipulation via Depth Diffusion
par: Liang, Xiujian, et autres
Publié: (2025)
par: Liang, Xiujian, et autres
Publié: (2025)
ES-Parkour: Advanced Robot Parkour with Bio-inspired Event Camera and Spiking Neural Network
par: Zhang, Qiang, et autres
Publié: (2025)
par: Zhang, Qiang, et autres
Publié: (2025)
Physical Priors Augmented Event-Based 3D Reconstruction
par: Wang, Jiaxu, et autres
Publié: (2024)
par: Wang, Jiaxu, et autres
Publié: (2024)
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
par: He, Yunhong, et autres
Publié: (2025)
par: He, Yunhong, et autres
Publié: (2025)
3D Human Pose Estimation Based on 2D-3D Consistency with Synchronized Adversarial Training
par: Deng, Yicheng, et autres
Publié: (2021)
par: Deng, Yicheng, et autres
Publié: (2021)
Reinforcement Learning with Generalizable Gaussian Splatting
par: Wang, Jiaxu, et autres
Publié: (2024)
par: Wang, Jiaxu, et autres
Publié: (2024)
Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models
par: Cao, Jiahang, et autres
Publié: (2024)
par: Cao, Jiahang, et autres
Publié: (2024)
ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations
par: Li, Zheng, et autres
Publié: (2025)
par: Li, Zheng, et autres
Publié: (2025)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
par: Zhu, Juan, et autres
Publié: (2026)
par: Zhu, Juan, et autres
Publié: (2026)
Mamba as Decision Maker: Exploring Multi-scale Sequence Modeling in Offline Reinforcement Learning
par: Cao, Jiahang, et autres
Publié: (2024)
par: Cao, Jiahang, et autres
Publié: (2024)
Modality-Composable Diffusion Policy via Inference-Time Distribution-level Composition
par: Cao, Jiahang, et autres
Publié: (2025)
par: Cao, Jiahang, et autres
Publié: (2025)
GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation
par: Zhou, Kaichen, et autres
Publié: (2026)
par: Zhou, Kaichen, et autres
Publié: (2026)
$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation
par: Zhou, Pengfei, et autres
Publié: (2026)
par: Zhou, Pengfei, et autres
Publié: (2026)
Never-Ending Behavior-Cloning Agent for Robotic Manipulation
par: Liang, Wenqi, et autres
Publié: (2024)
par: Liang, Wenqi, et autres
Publié: (2024)
VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation
par: Zhou, Hanyu, et autres
Publié: (2025)
par: Zhou, Hanyu, et autres
Publié: (2025)
CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
par: Liu, I-Chun Arthur, et autres
Publié: (2026)
Continual Hand-Eye Calibration for Open-world Robotic Manipulation
par: Li, Fazeng, et autres
Publié: (2026)
par: Li, Fazeng, et autres
Publié: (2026)
E2H: A Two-Stage Non-Invasive Neural Signal Driven Humanoid Robotic Whole-Body Control Framework
par: Duan, Yiqun, et autres
Publié: (2024)
par: Duan, Yiqun, et autres
Publié: (2024)
TesserAct: Learning 4D Embodied World Models
par: Zhen, Haoyu, et autres
Publié: (2025)
par: Zhen, Haoyu, et autres
Publié: (2025)
PSF-4D: A Progressive Sampling Framework for View Consistent 4D Editing
par: Iqbal, Hasan, et autres
Publié: (2025)
par: Iqbal, Hasan, et autres
Publié: (2025)
Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers
par: Huang, Jingkai, et autres
Publié: (2026)
par: Huang, Jingkai, et autres
Publié: (2026)
SPECI: Skill Prompts based Hierarchical Continual Imitation Learning for Robot Manipulation
par: Xu, Jingkai, et autres
Publié: (2025)
par: Xu, Jingkai, et autres
Publié: (2025)
Kinematics-Aware Diffusion Policy with Consistent 3D Observation and Action Space for Whole-Arm Robotic Manipulation
par: Lv, Kangchen, et autres
Publié: (2025)
par: Lv, Kangchen, et autres
Publié: (2025)
HumanoidPano: Hybrid Spherical Panoramic-LiDAR Cross-Modal Perception for Humanoid Robots
par: Zhang, Qiang, et autres
Publié: (2025)
par: Zhang, Qiang, et autres
Publié: (2025)
Documents similaires
-
Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation
par: Jiang, Yicheng, et autres
Publié: (2026) -
DEL: Discrete Element Learner for Learning 3D Particle Dynamics with Neural Rendering
par: Wang, Jiaxu, et autres
Publié: (2024) -
DEGS: Deformable Event-based 3D Gaussian Splatting from RGB and Event Stream
par: He, Junhao, et autres
Publié: (2025) -
Event Masked Autoencoder: Point-wise Action Recognition with Event-Based Cameras
par: Sun, Jingkai, et autres
Publié: (2025) -
EvGGS: A Collaborative Learning Framework for Event-based Generalizable Gaussian Splatting
par: Wang, Jiaxu, et autres
Publié: (2024)