ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Jiayi, Zhang, Jianing, Yang, Yiying, Cheng, Wei, Yuan, Xiaoyun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024)
par: Zuo, Qi, et autres
Publié: (2024)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Owl-1: Omni World Model for Consistent Long Video Generation
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Quantitative Video World Model Evaluation for Geometric-Consistency
par: Wu, Jiaxin, et autres
Publié: (2026)
par: Wu, Jiaxin, et autres
Publié: (2026)
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
par: Jiang, Le, et autres
Publié: (2026)
par: Jiang, Le, et autres
Publié: (2026)
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
par: He, Ruozhen, et autres
Publié: (2026)
par: He, Ruozhen, et autres
Publié: (2026)
GameVerse: Can Vision-Language Models Learn from Video-based Reflection?
par: Zhang, Kuan, et autres
Publié: (2026)
par: Zhang, Kuan, et autres
Publié: (2026)
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
par: Fang, Shaoheng, et autres
Publié: (2025)
par: Fang, Shaoheng, et autres
Publié: (2025)
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
par: Zeng, Qinglin, et autres
Publié: (2025)
par: Zeng, Qinglin, et autres
Publié: (2025)
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026)
par: Wang, Zun, et autres
Publié: (2026)
Pre-Trained Video Generative Models as World Simulators
par: He, Haoran, et autres
Publié: (2025)
par: He, Haoran, et autres
Publié: (2025)
Video Generation with Consistency Tuning
par: Wang, Chaoyi, et autres
Publié: (2024)
par: Wang, Chaoyi, et autres
Publié: (2024)
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
par: Wu, Haoyu, et autres
Publié: (2025)
par: Wu, Haoyu, et autres
Publié: (2025)
WorldModelBench: Judging Video Generation Models As World Models
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
A Survey: Spatiotemporal Consistency in Video Generation
par: Yin, Zhiyu, et autres
Publié: (2025)
par: Yin, Zhiyu, et autres
Publié: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
Pack and Force Your Memory: Long-form and Consistent Video Generation
par: Wu, Xiaofei, et autres
Publié: (2025)
par: Wu, Xiaofei, et autres
Publié: (2025)
MicroVerse: A Preliminary Exploration Toward a Micro-World Simulation
par: Wang, Rongsheng, et autres
Publié: (2026)
par: Wang, Rongsheng, et autres
Publié: (2026)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
par: Ding, Kun, et autres
Publié: (2022)
par: Ding, Kun, et autres
Publié: (2022)
Degradation-Modeled Multipath Diffusion for Tunable Metalens Photography
par: Zhang, Jianing, et autres
Publié: (2025)
par: Zhang, Jianing, et autres
Publié: (2025)
BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation
par: Zhu, Zihao, et autres
Publié: (2026)
par: Zhu, Zihao, et autres
Publié: (2026)
Facilitating Video Story Interaction with Multi-Agent Collaborative System
par: Zhang, Yiwen, et autres
Publié: (2025)
par: Zhang, Yiwen, et autres
Publié: (2025)
WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs
par: Yang, Deshun, et autres
Publié: (2024)
par: Yang, Deshun, et autres
Publié: (2024)
Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
par: Zhang, Zhenxing, et autres
Publié: (2025)
par: Zhang, Zhenxing, et autres
Publié: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
par: Liu, Mingxuan, et autres
Publié: (2025)
par: Liu, Mingxuan, et autres
Publié: (2025)
A Generic Shared Attention Mechanism for Various Backbone Neural Networks
par: Huang, Zhongzhan, et autres
Publié: (2022)
par: Huang, Zhongzhan, et autres
Publié: (2022)
STORYANCHORS: Generating Consistent Multi-Scene Story Frames for Long-Form Narratives
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
RISE-Video: Can Video Generators Decode Implicit World Rules?
par: Liu, Mingxin, et autres
Publié: (2026)
par: Liu, Mingxin, et autres
Publié: (2026)
Label Sharing Incremental Learning Framework for Independent Multi-Label Segmentation Tasks
par: Anand, Deepa, et autres
Publié: (2024)
par: Anand, Deepa, et autres
Publié: (2024)
Multi-scale Information Sharing and Selection Network with Boundary Attention for Polyp Segmentation
par: Kang, Xiaolu, et autres
Publié: (2024)
par: Kang, Xiaolu, et autres
Publié: (2024)
Consistent Video Editing as Flow-Driven Image-to-Video Generation
par: Wang, Ge, et autres
Publié: (2025)
par: Wang, Ge, et autres
Publié: (2025)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
par: Girish, Sharath, et autres
Publié: (2025)
par: Girish, Sharath, et autres
Publié: (2025)
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
par: Chen, Sili, et autres
Publié: (2025)
par: Chen, Sili, et autres
Publié: (2025)
Exploring Learngene via Stage-wise Weight Sharing for Initializing Variable-sized Models
par: Xia, Shi-Yu, et autres
Publié: (2024)
par: Xia, Shi-Yu, et autres
Publié: (2024)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA
par: Yang, Chunze, et autres
Publié: (2026)
par: Yang, Chunze, et autres
Publié: (2026)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
par: Zhang, Hong, et autres
Publié: (2025)
par: Zhang, Hong, et autres
Publié: (2025)
Rethinking Video Generation Model for the Embodied World
par: Deng, Yufan, et autres
Publié: (2026)
par: Deng, Yufan, et autres
Publié: (2026)
Incomplete Multi-View Multi-Label Classification via Shared Codebook and Fused-Teacher Self-Distillation
par: Yan, Xu, et autres
Publié: (2026)
par: Yan, Xu, et autres
Publié: (2026)
Documents similaires
-
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024) -
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
par: Yang, Songlin, et autres
Publié: (2026) -
Owl-1: Omni World Model for Consistent Long Video Generation
par: Huang, Yuanhui, et autres
Publié: (2024) -
Quantitative Video World Model Evaluation for Geometric-Consistency
par: Wu, Jiaxin, et autres
Publié: (2026) -
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
par: Jiang, Le, et autres
Publié: (2026)