Enregistré dans:
| Auteurs principaux: | Wu, Haoyu, Yu, Jiwen, Zou, Yingtian, Liu, Xihui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.18564 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WorldSimBench: Towards Video Generation Models as World Simulators
par: Qin, Yiran, et autres
Publié: (2024)
par: Qin, Yiran, et autres
Publié: (2024)
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
par: Huang, Kaiyi, et autres
Publié: (2024)
par: Huang, Kaiyi, et autres
Publié: (2024)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
par: Xiang, Chendong, et autres
Publié: (2026)
par: Xiang, Chendong, et autres
Publié: (2026)
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
par: Zhang, Haiyu, et autres
Publié: (2024)
par: Zhang, Haiyu, et autres
Publié: (2024)
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
par: Liu, Fangfu, et autres
Publié: (2026)
par: Liu, Fangfu, et autres
Publié: (2026)
GameFactory: Creating New Games with Generative Interactive Videos
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
par: Wang, Xiaofeng, et autres
Publié: (2024)
par: Wang, Xiaofeng, et autres
Publié: (2024)
ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation
par: Qin, Yiran, et autres
Publié: (2026)
par: Qin, Yiran, et autres
Publié: (2026)
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
par: Eskandar, George, et autres
Publié: (2026)
par: Eskandar, George, et autres
Publié: (2026)
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
par: Zheng, Chaoda, et autres
Publié: (2026)
par: Zheng, Chaoda, et autres
Publié: (2026)
Boosting Multi-View Stereo with Depth Foundation Model in the Absence of Real-World Labels
par: Zhu, Jie, et autres
Publié: (2025)
par: Zhu, Jie, et autres
Publié: (2025)
ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling
par: Zhu, Jiayi, et autres
Publié: (2026)
par: Zhu, Jiayi, et autres
Publié: (2026)
DreamComposer++: Empowering Diffusion Models with Multi-View Conditions for 3D Content Generation
par: Yang, Yunhan, et autres
Publié: (2025)
par: Yang, Yunhan, et autres
Publié: (2025)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
par: Zou, Jialv, et autres
Publié: (2024)
par: Zou, Jialv, et autres
Publié: (2024)
Position: Interactive Generative Video as Next-Generation Game Engine
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models
par: Peng, Baorui, et autres
Publié: (2026)
par: Peng, Baorui, et autres
Publié: (2026)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
par: Huang, Jiehui, et autres
Publié: (2025)
par: Huang, Jiehui, et autres
Publié: (2025)
MV-VTON: Multi-View Virtual Try-On with Diffusion Models
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
Dynamic Orchestration of Multi-Agent System for Real-World Multi-Image Agricultural VQA
par: Ke, Yan, et autres
Publié: (2025)
par: Ke, Yan, et autres
Publié: (2025)
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
par: Wu, Guile, et autres
Publié: (2025)
par: Wu, Guile, et autres
Publié: (2025)
MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving
par: Wang, Haiguang, et autres
Publié: (2025)
par: Wang, Haiguang, et autres
Publié: (2025)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
par: Qiu, Lu, et autres
Publié: (2025)
par: Qiu, Lu, et autres
Publié: (2025)
Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models
par: Zhu, Shangwen, et autres
Publié: (2026)
par: Zhu, Shangwen, et autres
Publié: (2026)
WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models
par: Inbasekar, Karthik, et autres
Publié: (2026)
par: Inbasekar, Karthik, et autres
Publié: (2026)
DatasetAgent: A Novel Multi-Agent System for Auto-Constructing Datasets from Real-World Images
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation
par: Li, Chunhan, et autres
Publié: (2026)
par: Li, Chunhan, et autres
Publié: (2026)
HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
par: HY-World, Team, et autres
Publié: (2026)
par: HY-World, Team, et autres
Publié: (2026)
GenWorld: Towards Detecting AI-generated Real-world Simulation Videos
par: Chen, Weiliang, et autres
Publié: (2025)
par: Chen, Weiliang, et autres
Publié: (2025)
World Guidance: World Modeling in Condition Space for Action Generation
par: Su, Yue, et autres
Publié: (2026)
par: Su, Yue, et autres
Publié: (2026)
POV: Prompt-Oriented View-Agnostic Learning for Egocentric Hand-Object Interaction in the Multi-View World
par: Xu, Boshen, et autres
Publié: (2024)
par: Xu, Boshen, et autres
Publié: (2024)
Monocular Models are Strong Learners for Multi-View Human Mesh Recovery
par: Xie, Haoyu, et autres
Publié: (2026)
par: Xie, Haoyu, et autres
Publié: (2026)
AutoWorld: Scaling Multi-Agent Traffic Simulation with Self-Supervised World Models
par: Pourkeshavatz, Mozhgan, et autres
Publié: (2026)
par: Pourkeshavatz, Mozhgan, et autres
Publié: (2026)
Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes
par: Zhang, Qi, et autres
Publié: (2026)
par: Zhang, Qi, et autres
Publié: (2026)
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
par: Meng, Fanqing, et autres
Publié: (2026)
par: Meng, Fanqing, et autres
Publié: (2026)
Multi-View Attentive Contextualization for Multi-View 3D Object Detection
par: Liu, Xianpeng, et autres
Publié: (2024)
par: Liu, Xianpeng, et autres
Publié: (2024)
A Survey of Interactive Generative Video
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
par: Chen, Zhekai, et autres
Publié: (2026)
par: Chen, Zhekai, et autres
Publié: (2026)
Documents similaires
-
WorldSimBench: Towards Video Generation Models as World Simulators
par: Qin, Yiran, et autres
Publié: (2024) -
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
par: Huang, Kaiyi, et autres
Publié: (2024) -
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
par: Xiang, Chendong, et autres
Publié: (2026) -
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
par: Zhou, Yang, et autres
Publié: (2025) -
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
par: Zhang, Haiyu, et autres
Publié: (2024)