SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ni, Chaojun, Chen, Cheng, Wang, Xiaofeng, Zhu, Zheng, Zheng, Wenzhao, Wang, Boyuan, Chen, Tianrun, Zhao, Guosheng, Li, Haoyun, Dong, Zhehao, Zhang, Qiang, Ye, Yun, Wang, Yang, Huang, Guan, Mei, Wenjun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training
par: Li, Haoyun, et autres
Publié: (2025)
par: Li, Haoyun, et autres
Publié: (2025)
WonderFree: Enhancing Novel View Quality and Cross-View Consistency for 3D Scene Exploration
par: Ni, Chaojun, et autres
Publié: (2025)
par: Ni, Chaojun, et autres
Publié: (2025)
WonderTurbo: Generating Interactive 3D World in 0.72 Seconds
par: Ni, Chaojun, et autres
Publié: (2025)
par: Ni, Chaojun, et autres
Publié: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
par: Zhao, Guosheng, et autres
Publié: (2024)
par: Zhao, Guosheng, et autres
Publié: (2024)
ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction
par: Ni, Chaojun, et autres
Publié: (2025)
par: Ni, Chaojun, et autres
Publié: (2025)
ReconDreamer++: Harmonizing Generative and Reconstructive Models for Driving Scene Representation
par: Zhao, Guosheng, et autres
Publié: (2025)
par: Zhao, Guosheng, et autres
Publié: (2025)
GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning
par: GigaBrain Team, et autres
Publié: (2026)
par: GigaBrain Team, et autres
Publié: (2026)
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
par: Song, Wenxuan, et autres
Publié: (2026)
par: Song, Wenxuan, et autres
Publié: (2026)
HumanDreamer-X: Photorealistic Single-image Human Avatars Reconstruction via Gaussian Restoration
par: Wang, Boyuan, et autres
Publié: (2025)
par: Wang, Boyuan, et autres
Publié: (2025)
HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation
par: Wang, Boyuan, et autres
Publié: (2025)
par: Wang, Boyuan, et autres
Publié: (2025)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
par: Luo, Yuankai, et autres
Publié: (2026)
par: Luo, Yuankai, et autres
Publié: (2026)
PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models
par: Guo, Peizheng, et autres
Publié: (2026)
par: Guo, Peizheng, et autres
Publié: (2026)
EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
par: Dong, Zhehao, et autres
Publié: (2025)
par: Dong, Zhehao, et autres
Publié: (2025)
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
par: Wang, Boyuan, et autres
Publié: (2026)
par: Wang, Boyuan, et autres
Publié: (2026)
BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning
par: Wang, Ruiheng, et autres
Publié: (2026)
par: Wang, Ruiheng, et autres
Publié: (2026)
Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model
par: Tang, Yanchuan, et autres
Publié: (2026)
par: Tang, Yanchuan, et autres
Publié: (2026)
EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling
par: Wang, Boyuan, et autres
Publié: (2025)
par: Wang, Boyuan, et autres
Publié: (2025)
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots
par: Zhang, Likui, et autres
Publié: (2026)
par: Zhang, Likui, et autres
Publié: (2026)
ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration
par: Ni, Chaojun, et autres
Publié: (2024)
par: Ni, Chaojun, et autres
Publié: (2024)
KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation
par: Wu, You, et autres
Publié: (2026)
par: Wu, You, et autres
Publié: (2026)
VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts
par: Jiang, Yuhua, et autres
Publié: (2026)
par: Jiang, Yuhua, et autres
Publié: (2026)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
par: GigaWorld Team, et autres
Publié: (2025)
par: GigaWorld Team, et autres
Publié: (2025)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
par: Li, Haozhan, et autres
Publié: (2025)
par: Li, Haozhan, et autres
Publié: (2025)
World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy
par: Liu, Xiaokang, et autres
Publié: (2026)
par: Liu, Xiaokang, et autres
Publié: (2026)
WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
par: Jiang, Haoran, et autres
Publié: (2025)
par: Jiang, Haoran, et autres
Publié: (2025)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
par: Wang, Xiaofeng, et autres
Publié: (2024)
par: Wang, Xiaofeng, et autres
Publié: (2024)
A Pragmatic VLA Foundation Model
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments
par: Pang, Yiwen, et autres
Publié: (2026)
par: Pang, Yiwen, et autres
Publié: (2026)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
par: Bian, Jinyue, et autres
Publié: (2025)
par: Bian, Jinyue, et autres
Publié: (2025)
DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
par: Wang, Weijie, et autres
Publié: (2025)
par: Wang, Weijie, et autres
Publié: (2025)
SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
par: Li, Ye, et autres
Publié: (2025)
par: Li, Ye, et autres
Publié: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026)
par: Shen, Boyang, et autres
Publié: (2026)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
par: Huang, Jialei, et autres
Publié: (2025)
par: Huang, Jialei, et autres
Publié: (2025)
EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation
par: Cao, Jiajun, et autres
Publié: (2026)
par: Cao, Jiajun, et autres
Publié: (2026)
DroneVLA: VLA based Aerial Manipulation
par: Mehboob, Fawad, et autres
Publié: (2026)
par: Mehboob, Fawad, et autres
Publié: (2026)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
Documents similaires
-
MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training
par: Li, Haoyun, et autres
Publié: (2025) -
WonderFree: Enhancing Novel View Quality and Cross-View Consistency for 3D Scene Exploration
par: Ni, Chaojun, et autres
Publié: (2025) -
WonderTurbo: Generating Interactive 3D World in 0.72 Seconds
par: Ni, Chaojun, et autres
Publié: (2025) -
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025) -
DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation
par: Zhao, Guosheng, et autres
Publié: (2024)