Owl-1: Omni World Model for Consistent Long Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yuanhui, Zheng, Wenzhao, Gao, Yuan, Tao, Xin, Wan, Pengfei, Zhang, Di, Zhou, Jie, Lu, Jiwen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Terra: Explorable Native 3D World Model with Point Latents
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
par: Zuo, Sicheng, et autres
Publié: (2024)
par: Zuo, Sicheng, et autres
Publié: (2024)
Astra: General Interactive World Model with Autoregressive Denoising
par: Zhu, Yixuan, et autres
Publié: (2025)
par: Zhu, Yixuan, et autres
Publié: (2025)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
par: Zheng, Wenzhao, et autres
Publié: (2024)
par: Zheng, Wenzhao, et autres
Publié: (2024)
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
par: Wang, Chengkun, et autres
Publié: (2024)
par: Wang, Chengkun, et autres
Publié: (2024)
Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos
par: Dou, Weijia, et autres
Publié: (2026)
par: Dou, Weijia, et autres
Publié: (2026)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Moaw: Unleashing Motion Awareness for Video Diffusion Models
par: Zhang, Tianqi, et autres
Publié: (2026)
par: Zhang, Tianqi, et autres
Publié: (2026)
SpectralAR: Spectral Autoregressive Visual Generation
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
par: Wu, Yuqi, et autres
Publié: (2024)
par: Wu, Yuqi, et autres
Publié: (2024)
GenWorld: Towards Detecting AI-generated Real-world Simulation Videos
par: Chen, Weiliang, et autres
Publié: (2025)
par: Chen, Weiliang, et autres
Publié: (2025)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
GlobalMamba: Global Image Serialization for Vision Mamba
par: Wang, Chengkun, et autres
Publié: (2024)
par: Wang, Chengkun, et autres
Publié: (2024)
GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Path Choice Matters for Clear Attribution in Path Methods
par: Zhang, Borui, et autres
Publié: (2024)
par: Zhang, Borui, et autres
Publié: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
par: Zhang, Borui, et autres
Publié: (2024)
par: Zhang, Borui, et autres
Publié: (2024)
Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
Latent Diffusion Model without Variational Autoencoder
par: Shi, Minglei, et autres
Publié: (2025)
par: Shi, Minglei, et autres
Publié: (2025)
Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
par: Zhang, Yanran, et autres
Publié: (2025)
par: Zhang, Yanran, et autres
Publié: (2025)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
par: Wu, Yuqi, et autres
Publié: (2025)
par: Wu, Yuqi, et autres
Publié: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
par: Wang, Xiaofeng, et autres
Publié: (2024)
par: Wang, Xiaofeng, et autres
Publié: (2024)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
par: Ji, Sihui, et autres
Publié: (2025)
par: Ji, Sihui, et autres
Publié: (2025)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
par: Huang, Jiehui, et autres
Publié: (2025)
par: Huang, Jiehui, et autres
Publié: (2025)
DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
par: Shi, Minglei, et autres
Publié: (2025)
par: Shi, Minglei, et autres
Publié: (2025)
OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
par: Rao, Qihang, et autres
Publié: (2025)
par: Rao, Qihang, et autres
Publié: (2025)
Quantize-then-Rectify: Efficient VQ-VAE Training
par: Zhang, Borui, et autres
Publié: (2025)
par: Zhang, Borui, et autres
Publié: (2025)
Fast Shapley Value Estimation: A Unified Approach
par: Zhang, Borui, et autres
Publié: (2023)
par: Zhang, Borui, et autres
Publié: (2023)
SceneCompleter: Dense 3D Scene Completion for Generative Novel View Synthesis
par: Chen, Weiliang, et autres
Publié: (2025)
par: Chen, Weiliang, et autres
Publié: (2025)
GameFactory: Creating New Games with Generative Interactive Videos
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
par: Zhang, Yanran, et autres
Publié: (2026)
par: Zhang, Yanran, et autres
Publié: (2026)
OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving
par: Wang, Lening, et autres
Publié: (2024)
par: Wang, Lening, et autres
Publié: (2024)
OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
par: Liu, Yuheng, et autres
Publié: (2026)
par: Liu, Yuheng, et autres
Publié: (2026)
Learning Counterfactually Decoupled Attention for Open-World Model Attribution
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
Vega: Learning to Drive with Natural Language Instructions
par: Zuo, Sicheng, et autres
Publié: (2026)
par: Zuo, Sicheng, et autres
Publié: (2026)
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
par: Peng, Ziqiao, et autres
Publié: (2025)
par: Peng, Ziqiao, et autres
Publié: (2025)
Position: Interactive Generative Video as Next-Generation Game Engine
par: Yu, Jiwen, et autres
Publié: (2025)
par: Yu, Jiwen, et autres
Publié: (2025)
4Dynamic: Text-to-4D Generation with Hybrid Priors
par: Yuan, Yu-Jie, et autres
Publié: (2024)
par: Yuan, Yu-Jie, et autres
Publié: (2024)
Documents similaires
-
Terra: Explorable Native 3D World Model with Point Latents
par: Huang, Yuanhui, et autres
Publié: (2025) -
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
par: Zuo, Sicheng, et autres
Publié: (2024) -
Astra: General Interactive World Model with Autoregressive Denoising
par: Zhu, Yixuan, et autres
Publié: (2025) -
Doe-1: Closed-Loop Autonomous Driving with Large World Model
par: Zheng, Wenzhao, et autres
Publié: (2024) -
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
par: Wang, Chengkun, et autres
Publié: (2024)