Long-Context State-Space Video World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Po, Ryan, Nitzan, Yotam, Zhang, Richard, Chen, Berlin, Dao, Tri, Shechtman, Eli, Wetzstein, Gordon, Huang, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video World Models with Long-term Spatial Memory
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
par: Po, Ryan, et autres
Publié: (2025)
par: Po, Ryan, et autres
Publié: (2025)
Lazy Diffusion Transformer for Interactive Image Editing
par: Nitzan, Yotam, et autres
Publié: (2024)
par: Nitzan, Yotam, et autres
Publié: (2024)
Orthogonal Adaptation for Modular Customization of Diffusion Models
par: Po, Ryan, et autres
Publié: (2023)
par: Po, Ryan, et autres
Publié: (2023)
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
par: Yin, Tianwei, et autres
Publié: (2024)
par: Yin, Tianwei, et autres
Publié: (2024)
Learning an Image Editing Model without Image Editing Pairs
par: Kumari, Nupur, et autres
Publié: (2025)
par: Kumari, Nupur, et autres
Publié: (2025)
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
par: Huang, Xun, et autres
Publié: (2025)
par: Huang, Xun, et autres
Publié: (2025)
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
par: Zhang, Lvmin, et autres
Publié: (2025)
par: Zhang, Lvmin, et autres
Publié: (2025)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
MotionStream: Real-Time Video Generation with Interactive Motion Controls
par: Shin, Joonghyuk, et autres
Publié: (2025)
par: Shin, Joonghyuk, et autres
Publié: (2025)
RELIC: Interactive Video World Model with Long-Horizon Memory
par: Hong, Yicong, et autres
Publié: (2025)
par: Hong, Yicong, et autres
Publié: (2025)
Causality in Video Diffusers is Separable from Denoising
par: Bai, Xingjian, et autres
Publié: (2026)
par: Bai, Xingjian, et autres
Publié: (2026)
MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines
par: Po, Ryan, et autres
Publié: (2026)
par: Po, Ryan, et autres
Publié: (2026)
StateSpaceDiffuser: Bringing Long Context to Diffusion World Models
par: Savov, Nedko, et autres
Publié: (2025)
par: Savov, Nedko, et autres
Publié: (2025)
SliderSpace: Decomposing the Visual Capabilities of Diffusion Models
par: Gandikota, Rohit, et autres
Publié: (2025)
par: Gandikota, Rohit, et autres
Publié: (2025)
VideoGigaGAN: Towards Detail-rich Video Super-Resolution
par: Xu, Yiran, et autres
Publié: (2024)
par: Xu, Yiran, et autres
Publié: (2024)
Image Neural Field Diffusion Models
par: Chen, Yinbo, et autres
Publié: (2024)
par: Chen, Yinbo, et autres
Publié: (2024)
Magic Fixup: Streamlining Photo Editing by Watching Dynamic Videos
par: Alzayer, Hadi, et autres
Publié: (2024)
par: Alzayer, Hadi, et autres
Publié: (2024)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
Spectral Progressive Diffusion for Efficient Image and Video Generation
par: Xiao, Howard, et autres
Publié: (2026)
par: Xiao, Howard, et autres
Publié: (2026)
Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation
par: Chao, Brian, et autres
Publié: (2026)
par: Chao, Brian, et autres
Publié: (2026)
VLM-Guided Adaptive Negative Prompting for Creative Generation
par: Golan, Shelly, et autres
Publié: (2025)
par: Golan, Shelly, et autres
Publié: (2025)
Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control
par: Xie, Linxi, et autres
Publié: (2026)
par: Xie, Linxi, et autres
Publié: (2026)
Jump Cut Smoothing for Talking Heads
par: Wang, Xiaojuan, et autres
Publié: (2024)
par: Wang, Xiaojuan, et autres
Publié: (2024)
ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control
par: Golan, Shelly, et autres
Publié: (2026)
par: Golan, Shelly, et autres
Publié: (2026)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
Streetscapes: Large-scale Consistent Street View Generation Using Autoregressive Video Diffusion
par: Deng, Boyang, et autres
Publié: (2024)
par: Deng, Boyang, et autres
Publié: (2024)
Asymmetric Flow Models
par: Chen, Hansheng, et autres
Publié: (2026)
par: Chen, Hansheng, et autres
Publié: (2026)
NewMove: Customizing text-to-video models with novel motions
par: Materzynska, Joanna, et autres
Publié: (2023)
par: Materzynska, Joanna, et autres
Publié: (2023)
Taming Flow-based I2V Models for Creative Video Editing
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
TurboEdit: Instant text-based image editing
par: Wu, Zongze, et autres
Publié: (2024)
par: Wu, Zongze, et autres
Publié: (2024)
Generative Video Motion Editing with 3D Point Tracks
par: Lee, Yao-Chih, et autres
Publié: (2025)
par: Lee, Yao-Chih, et autres
Publié: (2025)
GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator
par: Zhu, Liyuan, et autres
Publié: (2026)
par: Zhu, Liyuan, et autres
Publié: (2026)
GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation
par: Ackermann, Jan, et autres
Publié: (2026)
par: Ackermann, Jan, et autres
Publié: (2026)
Flying with Photons: Rendering Novel Views of Propagating Light
par: Malik, Anagh, et autres
Publié: (2024)
par: Malik, Anagh, et autres
Publié: (2024)
Customizing Text-to-Image Diffusion with Object Viewpoint Control
par: Kumari, Nupur, et autres
Publié: (2024)
par: Kumari, Nupur, et autres
Publié: (2024)
Context-aware Video Anomaly Detection in Long-Term Datasets
par: Yang, Zhengye, et autres
Publié: (2024)
par: Yang, Zhengye, et autres
Publié: (2024)
Infinite Gaze Generation for Videos with Autoregressive Diffusion
par: Kang, Jenna, et autres
Publié: (2026)
par: Kang, Jenna, et autres
Publié: (2026)
LIVE: Long-horizon Interactive Video World Modeling
par: Huang, Junchao, et autres
Publié: (2026)
par: Huang, Junchao, et autres
Publié: (2026)
Documents similaires
-
Video World Models with Long-term Spatial Memory
par: Wu, Tong, et autres
Publié: (2025) -
BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models
par: Po, Ryan, et autres
Publié: (2025) -
Lazy Diffusion Transformer for Interactive Image Editing
par: Nitzan, Yotam, et autres
Publié: (2024) -
Orthogonal Adaptation for Modular Customization of Diffusion Models
par: Po, Ryan, et autres
Publié: (2023) -
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
par: Yin, Tianwei, et autres
Publié: (2024)