EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zhaoyang, Jin, Yurun, Qi, Lizhe, Huang, Cong, Chen, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
par: Yin, Shicheng, et autres
Publié: (2026)
par: Yin, Shicheng, et autres
Publié: (2026)
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
par: Wang, Meizhong, et autres
Publié: (2026)
par: Wang, Meizhong, et autres
Publié: (2026)
World Guidance: World Modeling in Condition Space for Action Generation
par: Su, Yue, et autres
Publié: (2026)
par: Su, Yue, et autres
Publié: (2026)
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
par: Huang, Huang, et autres
Publié: (2025)
par: Huang, Huang, et autres
Publié: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
par: Sun, Jingwen, et autres
Publié: (2026)
par: Sun, Jingwen, et autres
Publié: (2026)
Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout
par: Chi, Haozhuang, et autres
Publié: (2026)
par: Chi, Haozhuang, et autres
Publié: (2026)
Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models
par: Ruan, Bo-Kai, et autres
Publié: (2026)
par: Ruan, Bo-Kai, et autres
Publié: (2026)
World Action Models: The Next Frontier in Embodied AI
par: Wang, Siyin, et autres
Publié: (2026)
par: Wang, Siyin, et autres
Publié: (2026)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
par: Han, Jianhua, et autres
Publié: (2025)
par: Han, Jianhua, et autres
Publié: (2025)
Precise Action-to-Video Generation Through Visual Action Prompts
par: Wang, Yuang, et autres
Publié: (2025)
par: Wang, Yuang, et autres
Publié: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
par: Zhang, Wenyao, et autres
Publié: (2025)
par: Zhang, Wenyao, et autres
Publié: (2025)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
par: Chai, Ying, et autres
Publié: (2025)
par: Chai, Ying, et autres
Publié: (2025)
Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
par: Xu, Mutian, et autres
Publié: (2026)
par: Xu, Mutian, et autres
Publié: (2026)
MaMi-HOI: Harmonizing Global Kinematics and Local Geometry for Human-Object Interaction Generation
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Latent Action Pretraining Through World Modeling
par: Tharwat, Bahey, et autres
Publié: (2025)
par: Tharwat, Bahey, et autres
Publié: (2025)
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
par: Wei, Julong, et autres
Publié: (2024)
par: Wei, Julong, et autres
Publié: (2024)
Towards Open-World Human Action Segmentation Using Graph Convolutional Networks
par: Xing, Hao, et autres
Publié: (2025)
par: Xing, Hao, et autres
Publié: (2025)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
par: Peng, Baorui, et autres
Publié: (2026)
par: Peng, Baorui, et autres
Publié: (2026)
KiGRAS: Kinematic-Driven Generative Model for Realistic Agent Simulation
par: Zhao, Jianbo, et autres
Publié: (2024)
par: Zhao, Jianbo, et autres
Publié: (2024)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
par: GigaBrain Team, et autres
Publié: (2025)
par: GigaBrain Team, et autres
Publié: (2025)
Language-Conditioned World Modeling for Visual Navigation
par: Dong, Yifei, et autres
Publié: (2026)
par: Dong, Yifei, et autres
Publié: (2026)
IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation
par: Lian, Shijie, et autres
Publié: (2026)
par: Lian, Shijie, et autres
Publié: (2026)
Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving
par: Hu, Bin, et autres
Publié: (2025)
par: Hu, Bin, et autres
Publié: (2025)
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks
par: Chen, Yixiang, et autres
Publié: (2026)
par: Chen, Yixiang, et autres
Publié: (2026)
Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation
par: Jin, Minghao, et autres
Publié: (2026)
par: Jin, Minghao, et autres
Publié: (2026)
MWM: Mobile World Models for Action-Conditioned Consistent Prediction
par: Yan, Han, et autres
Publié: (2026)
par: Yan, Han, et autres
Publié: (2026)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
par: Govind, Manish Kumar, et autres
Publié: (2026)
par: Govind, Manish Kumar, et autres
Publié: (2026)
EA-VTR: Event-Aware Video-Text Retrieval
par: Ma, Zongyang, et autres
Publié: (2024)
par: Ma, Zongyang, et autres
Publié: (2024)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
par: Zhou, Yang, et autres
Publié: (2026)
par: Zhou, Yang, et autres
Publié: (2026)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
par: Wang, Linbo, et autres
Publié: (2026)
par: Wang, Linbo, et autres
Publié: (2026)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
par: Won, John, et autres
Publié: (2025)
par: Won, John, et autres
Publié: (2025)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
par: Tong, Baoshun, et autres
Publié: (2026)
par: Tong, Baoshun, et autres
Publié: (2026)
ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
par: Ye, Wencheng, et autres
Publié: (2025)
par: Ye, Wencheng, et autres
Publié: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
par: Liang, Wenqi, et autres
Publié: (2025)
par: Liang, Wenqi, et autres
Publié: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation
par: Nair, Varun, et autres
Publié: (2026)
par: Nair, Varun, et autres
Publié: (2026)
Visual Grounding from Event Cameras
par: Kong, Lingdong, et autres
Publié: (2025)
par: Kong, Lingdong, et autres
Publié: (2025)
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model
par: Li, Peiyan, et autres
Publié: (2026)
par: Li, Peiyan, et autres
Publié: (2026)
Documents similaires
-
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
par: Yin, Shicheng, et autres
Publié: (2026) -
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
par: Wang, Meizhong, et autres
Publié: (2026) -
World Guidance: World Modeling in Condition Space for Action Generation
par: Su, Yue, et autres
Publié: (2026) -
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
par: Huang, Huang, et autres
Publié: (2025) -
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
par: Sun, Jingwen, et autres
Publié: (2026)