Scaling Diffusion Transformers to 16 Billion Parameters
Fuente:
arXiv
Guardado en:
| Autores principales: | Fei, Zhengcong, Fan, Mingyuan, Yu, Changqian, Li, Debang, Huang, Junshi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
Dimba: Transformer-Mamba Diffusion Models
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
Video Diffusion Transformers are In-Context Learners
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
Ingredients: Blending Custom Photos with Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025)
por: Fei, Zhengcong, et al.
Publicado: (2025)
Scalable Diffusion Models with State Space Backbone
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
FLUX that Plays Music
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
A-JEPA: Joint-Embedding Predictive Architecture Can Listen
por: Fei, Zhengcong, et al.
Publicado: (2023)
por: Fei, Zhengcong, et al.
Publicado: (2023)
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
por: Qiu, Di, et al.
Publicado: (2025)
por: Qiu, Di, et al.
Publicado: (2025)
SkyReels-A2: Compose Anything in Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025)
por: Fei, Zhengcong, et al.
Publicado: (2025)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025)
por: Fei, Zhengcong, et al.
Publicado: (2025)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
por: Qiu, Di, et al.
Publicado: (2024)
por: Qiu, Di, et al.
Publicado: (2024)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
por: Sun, Quan, et al.
Publicado: (2024)
por: Sun, Quan, et al.
Publicado: (2024)
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
por: Xiong, Tianwei, et al.
Publicado: (2025)
por: Xiong, Tianwei, et al.
Publicado: (2025)
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
por: He, Yu, et al.
Publicado: (2026)
por: He, Yu, et al.
Publicado: (2026)
Scaling Learned Image Compression Models up to 1 Billion
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
SCTNet: Single-Branch CNN with Transformer Semantic Information for Real-Time Segmentation
por: Xu, Zhengze, et al.
Publicado: (2023)
por: Xu, Zhengze, et al.
Publicado: (2023)
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
por: Ma, Lichen, et al.
Publicado: (2026)
por: Ma, Lichen, et al.
Publicado: (2026)
SkyReels-V3 Technique Report
por: Li, Debang, et al.
Publicado: (2026)
por: Li, Debang, et al.
Publicado: (2026)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Arctic-TILT. Business Document Understanding at Sub-Billion Scale
por: Borchmann, Łukasz, et al.
Publicado: (2024)
por: Borchmann, Łukasz, et al.
Publicado: (2024)
Music Consistency Models
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
SkyReels-V2: Infinite-length Film Generative Model
por: Chen, Guibin, et al.
Publicado: (2025)
por: Chen, Guibin, et al.
Publicado: (2025)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
por: Cui, Cheng, et al.
Publicado: (2026)
por: Cui, Cheng, et al.
Publicado: (2026)
Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era
por: Oneata, Dan, et al.
Publicado: (2025)
por: Oneata, Dan, et al.
Publicado: (2025)
Sublinear Variational Optimization of Gaussian Mixture Models with Millions to Billions of Parameters
por: Salwig, Sebastian, et al.
Publicado: (2025)
por: Salwig, Sebastian, et al.
Publicado: (2025)
Scaling Laws For Diffusion Transformers
por: Liang, Zhengyang, et al.
Publicado: (2024)
por: Liang, Zhengyang, et al.
Publicado: (2024)
ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
por: Hansen-Estruch, Philippe, et al.
Publicado: (2026)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2026)
Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models
por: Chen, Die, et al.
Publicado: (2024)
por: Chen, Die, et al.
Publicado: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
por: Fang, Xueji, et al.
Publicado: (2026)
por: Fang, Xueji, et al.
Publicado: (2026)
Dynamic Diffusion Transformer
por: Zhao, Wangbo, et al.
Publicado: (2024)
por: Zhao, Wangbo, et al.
Publicado: (2024)
OutDreamer: Video Outpainting with a Diffusion Transformer
por: Zhong, Linhao, et al.
Publicado: (2025)
por: Zhong, Linhao, et al.
Publicado: (2025)
RetinaGS: Scalable Training for Dense Scene Rendering with Billion-Scale 3D Gaussians
por: Li, Bingling, et al.
Publicado: (2024)
por: Li, Bingling, et al.
Publicado: (2024)
CrossEarth-SAR: A SAR-Centric and Billion-Scale Geospatial Foundation Model for Domain Generalizable Semantic Segmentation
por: Ye, Ziqi, et al.
Publicado: (2026)
por: Ye, Ziqi, et al.
Publicado: (2026)
LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer
por: Fei, Song, et al.
Publicado: (2025)
por: Fei, Song, et al.
Publicado: (2025)
Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer
por: Chang, Da, et al.
Publicado: (2024)
por: Chang, Da, et al.
Publicado: (2024)
Wavelet Latent Diffusion (Wala): Billion-Parameter 3D Generative Model with Compact Wavelet Encodings
por: Sanghi, Aditya, et al.
Publicado: (2024)
por: Sanghi, Aditya, et al.
Publicado: (2024)
Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
por: Tokhchukov, Danil, et al.
Publicado: (2026)
por: Tokhchukov, Danil, et al.
Publicado: (2026)
SWiT-4D: Sliding-Window Transformer for Lossless and Parameter-Free Temporal 4D Generation
por: Gong, Kehong, et al.
Publicado: (2025)
por: Gong, Kehong, et al.
Publicado: (2025)
Amber-Image: Efficient Compression of Large-Scale Diffusion Transformers
por: Yang, Chaojie, et al.
Publicado: (2026)
por: Yang, Chaojie, et al.
Publicado: (2026)
Ejemplares similares
-
Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
por: Fei, Zhengcong, et al.
Publicado: (2024) -
Dimba: Transformer-Mamba Diffusion Models
por: Fei, Zhengcong, et al.
Publicado: (2024) -
Video Diffusion Transformers are In-Context Learners
por: Fei, Zhengcong, et al.
Publicado: (2024) -
Ingredients: Blending Custom Photos with Video Diffusion Transformers
por: Fei, Zhengcong, et al.
Publicado: (2025) -
Scalable Diffusion Models with State Space Backbone
por: Fei, Zhengcong, et al.
Publicado: (2024)