OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yang, Wang, Yifan, Zhou, Jianjun, Chang, Wenzheng, Guo, Haoyu, Li, Zizun, Ma, Kaijing, Li, Xinyue, Wang, Yating, Zhu, Haoyi, Liu, Mingyu, Liu, Dingning, Yang, Jiange, Fu, Zhoujie, Chen, Junyi, Shen, Chunhua, Pang, Jiangmiao, Zhang, Kaipeng, He, Tong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DeepVerse: 4D Autoregressive Video Generation as a World Model
por: Chen, Junyi, et al.
Publicado: (2025)
por: Chen, Junyi, et al.
Publicado: (2025)
Aether: Geometric-Aware Unified World Modeling
por: Aether Team, et al.
Publicado: (2025)
por: Aether Team, et al.
Publicado: (2025)
$π^3$: Permutation-Equivariant Visual Geometry Learning
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
por: Li, Zizun, et al.
Publicado: (2025)
por: Li, Zizun, et al.
Publicado: (2025)
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning
por: Yang, Jiange, et al.
Publicado: (2025)
por: Yang, Jiange, et al.
Publicado: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
por: Wang, Yating, et al.
Publicado: (2025)
por: Wang, Yating, et al.
Publicado: (2025)
SPA: 3D Spatial-Awareness Enables Effective Embodied Representation
por: Zhu, Haoyi, et al.
Publicado: (2024)
por: Zhu, Haoyi, et al.
Publicado: (2024)
Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning
por: Yang, Jiange, et al.
Publicado: (2024)
por: Yang, Jiange, et al.
Publicado: (2024)
Learning Primitive Embodied World Models: Towards Scalable Robotic Learning
por: Sun, Qiao, et al.
Publicado: (2025)
por: Sun, Qiao, et al.
Publicado: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
por: Li, Zizun, et al.
Publicado: (2026)
por: Li, Zizun, et al.
Publicado: (2026)
BRIDGE -- Building Reinforcement-Learning Depth-to-Image Data Generation Engine for Monocular Depth Estimation
por: Liu, Dingning, et al.
Publicado: (2025)
por: Liu, Dingning, et al.
Publicado: (2025)
MultiWorld: Scalable Multi-Agent Multi-View Video World Models
por: Wu, Haoyu, et al.
Publicado: (2026)
por: Wu, Haoyu, et al.
Publicado: (2026)
Unified Open-World Segmentation with Multi-Modal Prompts
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Yume: An Interactive World Generation Model
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
por: Chen, Junyi, et al.
Publicado: (2026)
por: Chen, Junyi, et al.
Publicado: (2026)
StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation
por: Liu, Mingyu, et al.
Publicado: (2025)
por: Liu, Mingyu, et al.
Publicado: (2025)
MAPF-World: Action World Model for Multi-Agent Path Finding
por: Yang, Zhanjiang, et al.
Publicado: (2025)
por: Yang, Zhanjiang, et al.
Publicado: (2025)
ECViT: Efficient Convolutional Vision Transformer with Local-Attention and Multi-scale Stages
por: Qian, Zhoujie
Publicado: (2025)
por: Qian, Zhoujie
Publicado: (2025)
Yume-1.5: A Text-Controlled Interactive World Generation Model
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
por: Jia, Yiduo, et al.
Publicado: (2026)
por: Jia, Yiduo, et al.
Publicado: (2026)
OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World
por: Liu, Katherine, et al.
Publicado: (2025)
por: Liu, Katherine, et al.
Publicado: (2025)
OmniArch: Building Foundation Model For Scientific Computing
por: Chen, Tianyu, et al.
Publicado: (2024)
por: Chen, Tianyu, et al.
Publicado: (2024)
Sekai: A Video Dataset towards World Exploration
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
From Words to Worlds: Benchmarking Cross-Cultural Cultural Understanding in Machine Translation
por: Han, Bangju, et al.
Publicado: (2026)
por: Han, Bangju, et al.
Publicado: (2026)
Omni-scale Learning-based Sequential Decision Framework for Order Fulfillment of Tote-handling Robotic Systems
por: Liu, Jiaxin, et al.
Publicado: (2026)
por: Liu, Jiaxin, et al.
Publicado: (2026)
Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert
por: Liu, Mingyu, et al.
Publicado: (2025)
por: Liu, Mingyu, et al.
Publicado: (2025)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
por: He, Xuehai, et al.
Publicado: (2024)
por: He, Xuehai, et al.
Publicado: (2024)
SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds
por: Zhou, Yunsong, et al.
Publicado: (2026)
por: Zhou, Yunsong, et al.
Publicado: (2026)
A Multi-Strategy Framework for Enhancing Shatian Pomelo Detection in Real-World Orchards
por: Wang, Pan, et al.
Publicado: (2025)
por: Wang, Pan, et al.
Publicado: (2025)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
por: Wang, Yuze, et al.
Publicado: (2025)
por: Wang, Yuze, et al.
Publicado: (2025)
OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
por: Liu, Yuheng, et al.
Publicado: (2026)
por: Liu, Yuheng, et al.
Publicado: (2026)
ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks
por: Wang, Kaijun, et al.
Publicado: (2025)
por: Wang, Kaijun, et al.
Publicado: (2025)
CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving
por: Huang, Minqing, et al.
Publicado: (2026)
por: Huang, Minqing, et al.
Publicado: (2026)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
por: Tao, Haoyi, et al.
Publicado: (2026)
por: Tao, Haoyi, et al.
Publicado: (2026)
Boosting Multi-View Stereo with Depth Foundation Model in the Absence of Real-World Labels
por: Zhu, Jie, et al.
Publicado: (2025)
por: Zhu, Jie, et al.
Publicado: (2025)
LinkAlign: Scalable Schema Linking for Real-World Large-Scale Multi-Database Text-to-SQL
por: Wang, Yihan, et al.
Publicado: (2025)
por: Wang, Yihan, et al.
Publicado: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
por: Tong, Wenwen, et al.
Publicado: (2025)
por: Tong, Wenwen, et al.
Publicado: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
por: Zheng, Minghang, et al.
Publicado: (2026)
por: Zheng, Minghang, et al.
Publicado: (2026)
Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos
por: Su, Taiyi, et al.
Publicado: (2025)
por: Su, Taiyi, et al.
Publicado: (2025)
OmniNWM: Omniscient Driving Navigation World Models
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
Ejemplares similares
-
DeepVerse: 4D Autoregressive Video Generation as a World Model
por: Chen, Junyi, et al.
Publicado: (2025) -
Aether: Geometric-Aware Unified World Modeling
por: Aether Team, et al.
Publicado: (2025) -
$π^3$: Permutation-Equivariant Visual Geometry Learning
por: Wang, Yifan, et al.
Publicado: (2025) -
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
por: Li, Zizun, et al.
Publicado: (2025) -
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning
por: Yang, Jiange, et al.
Publicado: (2025)