SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Haoyi, Liu, Haozhe, Zhao, Yuyang, Ye, Tian, Chen, Junsong, Yu, Jincheng, He, Tong, Han, Song, Xie, Enze |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
par: Zhao, Yuyang, et autres
Publié: (2026)
par: Zhao, Yuyang, et autres
Publié: (2026)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
par: Xie, Enze, et autres
Publié: (2025)
par: Xie, Enze, et autres
Publié: (2025)
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
par: Chen, Junsong, et autres
Publié: (2025)
par: Chen, Junsong, et autres
Publié: (2025)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
par: Xie, Enze, et autres
Publié: (2024)
par: Xie, Enze, et autres
Publié: (2024)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
par: Tang, Haotian, et autres
Publié: (2024)
par: Tang, Haotian, et autres
Publié: (2024)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
par: Wu, Yecheng, et autres
Publié: (2025)
par: Wu, Yecheng, et autres
Publié: (2025)
MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head
par: Zhang, Kewei, et autres
Publié: (2026)
par: Zhang, Kewei, et autres
Publié: (2026)
DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Magic 1-For-1: Generating One Minute Video Clips within One Minute
par: Yi, Hongwei, et autres
Publié: (2025)
par: Yi, Hongwei, et autres
Publié: (2025)
WM-DAgger: Enabling Efficient Data Aggregation for Imitation Learning with World Models
par: Yu, Anlan, et autres
Publié: (2026)
par: Yu, Anlan, et autres
Publié: (2026)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
par: Chen, Junyu, et autres
Publié: (2024)
par: Chen, Junyu, et autres
Publié: (2024)
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
par: Li, Yitong, et autres
Publié: (2026)
par: Li, Yitong, et autres
Publié: (2026)
PixArt-$α$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
par: Chen, Junsong, et autres
Publié: (2023)
par: Chen, Junsong, et autres
Publié: (2023)
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
par: He, Wenkun, et autres
Publié: (2025)
par: He, Wenkun, et autres
Publié: (2025)
Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models
par: Lu, Jiacheng, et autres
Publié: (2026)
par: Lu, Jiacheng, et autres
Publié: (2026)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
par: Yin, Shicheng, et autres
Publié: (2026)
par: Yin, Shicheng, et autres
Publié: (2026)
Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer
par: Kuang, Penghao, et autres
Publié: (2026)
par: Kuang, Penghao, et autres
Publié: (2026)
Brain-WM: Brain Glioblastoma World Model
par: Wang, Chenhui, et autres
Publié: (2026)
par: Wang, Chenhui, et autres
Publié: (2026)
AdaWM: Adaptive World Model based Planning for Autonomous Driving
par: Wang, Hang, et autres
Publié: (2025)
par: Wang, Hang, et autres
Publié: (2025)
LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer
par: Fei, Song, et autres
Publié: (2025)
par: Fei, Song, et autres
Publié: (2025)
LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation
par: Huang, Yuhang, et autres
Publié: (2025)
par: Huang, Yuhang, et autres
Publié: (2025)
ContactGaussian-WM: Learning Physics-Grounded World Model from Videos
par: Wang, Meizhong, et autres
Publié: (2026)
par: Wang, Meizhong, et autres
Publié: (2026)
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
par: Wu, Chengyue, et autres
Publié: (2026)
par: Wu, Chengyue, et autres
Publié: (2026)
Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
par: Zhao, Min, et autres
Publié: (2026)
par: Zhao, Min, et autres
Publié: (2026)
PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation
par: Chen, Junsong, et autres
Publié: (2024)
par: Chen, Junsong, et autres
Publié: (2024)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
par: Jiang, Feng, et autres
Publié: (2026)
par: Jiang, Feng, et autres
Publié: (2026)
PIN-WM: Learning Physics-INformed World Models for Non-Prehensile Manipulation
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
par: Xiong, Zhexiao, et autres
Publié: (2026)
par: Xiong, Zhexiao, et autres
Publié: (2026)
COMIDA SANA, COMIDA RICA
Publié: (2007)
Publié: (2007)
LÓGICA Y SANA CRÍTICA
par: Jaime Laso Cordero
Publié: (2009)
par: Jaime Laso Cordero
Publié: (2009)
Scaling Diffusion Transformers Efficiently via $μ$P
par: Zheng, Chenyu, et autres
Publié: (2025)
par: Zheng, Chenyu, et autres
Publié: (2025)
ResWM: Residual-Action World Model for Visual RL
par: Zhang, Jseen, et autres
Publié: (2026)
par: Zhang, Jseen, et autres
Publié: (2026)
TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity
par: Chen, Yuzhuo, et autres
Publié: (2025)
par: Chen, Yuzhuo, et autres
Publié: (2025)
ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation
par: Chen, Zhikang, et autres
Publié: (2026)
par: Chen, Zhikang, et autres
Publié: (2026)
DTU-Net: A Multi-Scale Dilated Transformer Network for Nonlinear Hyperspectral Unmixing
par: Wang, ChenTong, et autres
Publié: (2025)
par: Wang, ChenTong, et autres
Publié: (2025)
EgoExo-WM: Unlocking Exo Video for Ego World Models
par: Tran, Danny, et autres
Publié: (2026)
par: Tran, Danny, et autres
Publié: (2026)
Documents similaires
-
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
par: Zhao, Yuyang, et autres
Publié: (2026) -
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
par: Xie, Enze, et autres
Publié: (2025) -
SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
par: Chen, Junsong, et autres
Publié: (2025) -
SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation
par: Chen, Junsong, et autres
Publié: (2025) -
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
par: Xie, Enze, et autres
Publié: (2024)